{"ok":true,"entity":{"id":"instruction-tuning","name":"Instruction Tuning","entityType":"concept","officialName":"Instruction Tuning","canonicalName":"Instruction Tuning","displayName":"Instruction Tuning","category":"指示チューニング","shortDescription":"事前学習済み言語モデルを、自然言語の指示（インストラクション）で記述された多様なタスクでファインチューニングし、指示への追従性能を高める手法。","primaryCluster":"ai-concepts","verificationStatus":"draft","website":null,"updatedAt":"2026-07-20T11:04:59.119Z","secondaryClusters":[],"alias":[],"searchKeywords":["指示チューニング","instruction tuning","InstructGPT"]},"references":[{"id":"P-01-001","companyId":"instruction-tuning","questionId":"P-01-001","instanceId":"QIN-instruction-tuning-P01-001","promptText":"指示チューニング（Instruction Tuning）とは何ですか？","promptTypeId":"P-01","answer":"指示チューニングとは、事前学習済みの言語モデルを、自然言語の指示で記述された多様なタスクのデータでファインチューニングし、ユーザーの指示に従う能力を高める手法です。OpenAIのInstructGPTがこの手法を用いた代表例です。","evidencePoints":["ev-instruction-tuning-1"],"scope":"事前学習済みモデルの指示追従性能を高めるファインチューニング手法の定義","differentiation":"通常のタスク特化ファインチューニングとは異なり、多様なタスクを指示形式で統一的に学習する点が特徴","faq":[],"pageUrl":"https://www.refbase.ai/reference/instruction-tuning/P-01-001","sourceEvidence":[{"id":"ev-instruction-tuning-1","text":"Ouyang et al.（2022, OpenAI）は、ラベラーが書いたプロンプトとOpenAI APIのプロンプトから望ましいモデル挙動のデータセットを作成し、これを用いてGPT-3を教師あり学習でファインチューニングし、さらに人間フィードバックからの強化学習（RLHF）で追加調整するInstructGPTを構築した。","title":"[2203.02155] Training language models to follow instructions with human feedback","coverageType":["Identity","Capability"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2203.02155","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"instruction-tuning"}],"generatedAt":"2026-07-20T11:04:59.119Z"},{"id":"P-02-001","companyId":"instruction-tuning","questionId":"P-02-001","instanceId":"QIN-instruction-tuning-P02-001","promptText":"InstructGPTとFLANの指示チューニングはどう違いますか？","promptTypeId":"P-02","answer":"InstructGPT（OpenAI）は教師あり指示チューニングに加えて人間フィードバックからの強化学習（RLHF）を組み合わせています。一方、GoogleのFLANは60以上のタスクを指示テンプレートで学習する教師あり指示チューニングのみで、未見タスクへのゼロショット性能改善を実証しました。","evidencePoints":["ev-instruction-tuning-2"],"scope":"RLHFを伴うか否かという指示チューニング手法の違い","differentiation":"強化学習ステップの有無、および評価対象（人間の好みか未見タスクのゼロショット性能か）が異なる","faq":[],"pageUrl":"https://www.refbase.ai/reference/instruction-tuning/P-02-001","sourceEvidence":[{"id":"ev-instruction-tuning-2","text":"Wei et al.（2021, Google Research）が提示したFLANは、137Bパラメータの事前学習済みモデルを60以上のNLPタスクを自然言語の指示テンプレートで表現したデータで指示チューニングし、未見タスクへのゼロショット性能を大幅に改善した。RLHFではなく教師あり指示チューニングのみで効果を示した点がInstructGPTのアプローチと異なる。","title":"[2109.01652] Finetuned Language Models Are Zero-Shot Learners","coverageType":["Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2109.01652","confidence":"high","supportedPromptTypes":["P-02"],"needsVerification":true,"sourceVerified":false,"entityId":"instruction-tuning"}],"generatedAt":"2026-07-20T11:04:59.119Z"},{"id":"P-04-001","companyId":"instruction-tuning","questionId":"P-04-001","instanceId":"QIN-instruction-tuning-P04-001","promptText":"指示チューニングはどのような効果がありますか？","promptTypeId":"P-04","answer":"指示チューニングにより、モデルサイズを大きくするよりも効率的に指示追従性能を改善できます。実際、1.3BパラメータのInstructGPTの出力は、100倍大きい175BパラメータのGPT-3よりも人間評価で好まれました。","evidencePoints":["ev-instruction-tuning-3"],"scope":"モデル規模拡大に対する効率的な代替手段としての効果","differentiation":"パラメータ数の拡大ではなく学習データの質・形式の改善によって性能を高める点が特徴","faq":[],"pageUrl":"https://www.refbase.ai/reference/instruction-tuning/P-04-001","sourceEvidence":[{"id":"ev-instruction-tuning-3","text":"人間評価では、1.3BパラメータのInstructGPTの出力が、100倍大きい175BパラメータのGPT-3の出力よりも好まれた。これは、指示チューニングが単純なモデル規模の拡大よりも指示追従性能の改善に効果的であることを実証する用途として引用される。","title":"[2203.02155] Training language models to follow instructions with human feedback","coverageType":["UseCase"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2203.02155","confidence":"high","supportedPromptTypes":["P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"instruction-tuning"}],"generatedAt":"2026-07-20T11:04:59.119Z"},{"id":"P-04-002","companyId":"instruction-tuning","questionId":"P-04-002","instanceId":"c1n17-carry-forward-depth-manual-draft-authoring-no-qi","draftId":"c1n17-carry-forward-depth-instruction-tuning-p-04-002","promptText":"指示チューニング用のデータは、人手による大量のアノテーションなしでどのように生成できますか？","promptTypeId":"P-04","answer":"Instruction Tuningの主要製品・提供機能について、Yizhong Wang et al.公式の査読前論文（arXiv、後にACL 2023採択）（https://arxiv.org/abs/2212.10560）で確認できます。Self-Instruct論文が指示チューニング用データの生成手法について説明しており、具体的には「Self-Instructは、言語モデル自身の生成結果から指示チューニング用データ（指示・入力・出力）を生成し、低品質または重複したサンプルを除去したうえで、その結果を用いて同一のベースモデルをファインチューニングする手法である。素のGPT-3にこの手法を適用したところ、Super-NaturalInstructionsベンチマークにおいて33ポイントの絶対的な性能向上が得られ、非公開の人手アノテーションデータを一切使用しないにもかかわらず、InstructGPT-001と同水準の性能に達した。」といった記載が確認できます。限界として、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 33ポイントの性能向上および「InstructGPT-001と同水準」という比較は、この2022年の論文で使用された特定のベンチマークとベースモデル（Super-NaturalInstructions上の素のGPT-3）に固有のものであり、他のベースモデル・ベンチマーク、あるいはその後のInstructGPT・RLHFバージョンとの比較では結果が異なる可能性がある。また、モデル自身が生成したデータは、ベースモデルの出力に内在するバイアスや誤りを引き継ぐ可能性がある。Current Statusとして、2026年08月23日に当該Sourceを取得し、上記の内容を確認しました。Source種別としては、これはYizhong Wang et al.という、Instruction Tuning自身とは別の組織が発信・保有する情報であり、Instruction Tuning自身による広報や、独立した第三者による評価とは性質が異なります。","evidencePoints":["instruction-tuning-ev-c1n17-p-04-002"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/instruction-tuning/P-04-002","sourceEvidence":[{"id":"instruction-tuning-ev-c1n17-p-04-002","text":"Yizhong Wang et al.公式の査読前論文（arXiv、後にACL 2023採択）（https://arxiv.org/abs/2212.10560）は、Instruction Tuningの主要製品・提供機能に関する公的記録である。Self-Instruct論文が指示チューニング用データの生成手法について説明しており、具体的には「Self-Instructは、言語モデル自身の生成結果から指示チューニング用データ（指示・入力・出力）を生成し、低品質または重複したサンプルを除去したうえで、その結果を用いて同一のベースモデルをファインチューニングする手法である。素のGPT-3にこの手法を適用したところ、Super-NaturalInstructionsベンチマークにおいて33ポイントの絶対的な性能向上が得られ、非公開の人手アノテーションデータを一切使用しないにもかかわらず、InstructGPT-001と同水準の性能に達した。」といった記載がある。ただし、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 33ポイントの性能向上および「InstructGPT-001と同水準」という比較は、この2022年の論文で使用された特定のベンチマークとベースモデル（Super-NaturalInstructions上の素のGPT-3）に固有のものであり、他のベースモデル・ベンチマーク、あるいはその後のInstructGPT・RLHFバージョンとの比較では結果が異なる可能性がある。また、モデル自身が生成したデータは、ベースモデルの出力に内在するバイアスや誤りを引き継ぐ可能性がある。2026年08月23日に同Sourceを取得し、この内容を確認した。","title":"Instruction Tuningの主要製品・提供機能に関する公開情報","coverageType":["Capability"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2212.10560","confidence":"medium","supportedPromptTypes":["P-04"],"needsVerification":true,"sourceVerified":false,"sourceKind":"institutional","entityId":"instruction-tuning"}],"generatedAt":"2026-08-23T02:47:40.238Z","evidenceIds":["instruction-tuning-ev-c1n17-p-04-002"]},{"id":"P-01-002","companyId":"instruction-tuning","questionId":"P-01-002","instanceId":"c1n18-scaled-depth-reinforcement-manual-draft-authoring-no-qi","draftId":"c1n18-scaled-depth-reinforcement-instruction-tuning-p-01-002","promptText":"指示チューニングは実際にどの程度の低コストで実践できますか？具体的な事例はありますか？","promptTypeId":"P-01","answer":"Instruction Tuningの主要製品・提供機能について、Stanford Center for Research on Foundation Models（CRFM）公式ブログ公式のofficial research project blog post published by the university research center that created the model（https://crfm.stanford.edu/2023/03/13/alpaca.html）で確認できます。既存Referenceは指示チューニングの定義・手法比較・効果・データ生成手法（Self-Instruct）を扱っているが、実際にどの程度のコストで指示チューニングを実践できるかという具体的な実例・数値は未収録のため新規性がある。具体的には「Stanford大学CRFMのAlpacaプロジェクトでは、Self-Instruct方式でOpenAIのtext-davinci-003を使い生成した5万2千件の指示追従デモンストレーションデータを用いて、7BパラメータのLLaMAモデルをA100 GPU8基で3時間ファインチューニングし（100ドル未満）、データ生成費用と合わせて総額600ドル未満で指示追従モデルを構築した。」といった記載が確認できます。限界として、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 この数値は2023年3月時点のGPUレンタル価格・OpenAI API料金に基づくものであり、現在の価格水準とは異なる可能性がある。またAlpacaは学術研究目的の実験的モデルであり、商用製品としての品質・安全性評価を経たものではない点に注意が必要。Current Statusとして、2026年08月23日に当該Sourceを取得し、上記の内容を確認しました。Source種別としては、これはStanford Center for Research on Foundation Models（CRFM）公式ブログという、Instruction Tuning自身とは別の組織が発信・保有する情報であり、Instruction Tuning自身による広報や、独立した第三者による評価とは性質が異なります。","evidencePoints":["instruction-tuning-ev-c1n18-p-01-002"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/instruction-tuning/P-01-002","sourceEvidence":[{"id":"instruction-tuning-ev-c1n18-p-01-002","text":"Stanford Center for Research on Foundation Models（CRFM）公式ブログ公式のofficial research project blog post published by the university research center that created the model（https://crfm.stanford.edu/2023/03/13/alpaca.html）は、Instruction Tuningの主要製品・提供機能に関する公的記録である。既存Referenceは指示チューニングの定義・手法比較・効果・データ生成手法（Self-Instruct）を扱っているが、実際にどの程度のコストで指示チューニングを実践できるかという具体的な実例・数値は未収録のため新規性がある。具体的には「Stanford大学CRFMのAlpacaプロジェクトでは、Self-Instruct方式でOpenAIのtext-davinci-003を使い生成した5万2千件の指示追従デモンストレーションデータを用いて、7BパラメータのLLaMAモデルをA100 GPU8基で3時間ファインチューニングし（100ドル未満）、データ生成費用と合わせて総額600ドル未満で指示追従モデルを構築した。」といった記載がある。ただし、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 この数値は2023年3月時点のGPUレンタル価格・OpenAI API料金に基づくものであり、現在の価格水準とは異なる可能性がある。またAlpacaは学術研究目的の実験的モデルであり、商用製品としての品質・安全性評価を経たものではない点に注意が必要。2026年08月23日に同Sourceを取得し、この内容を確認した。","title":"Instruction Tuning主要製品・提供機能に関する公開情報","coverageType":["Capability"],"sourceType":"official_blog","sourceClass":"Documentation","sourceUrl":"https://crfm.stanford.edu/2023/03/13/alpaca.html","confidence":"medium","supportedPromptTypes":["P-01"],"needsVerification":true,"sourceVerified":false,"sourceKind":"institutional","entityId":"instruction-tuning"}],"generatedAt":"2026-08-23T16:03:32.991Z","evidenceIds":["instruction-tuning-ev-c1n18-p-01-002"]},{"id":"P-05-001","companyId":"instruction-tuning","questionId":"P-05-001","instanceId":"tair-cohort3-2026-08-31","draftId":"tair-cohort3-2026-08-31-instruction-tuning-p-05-001","promptText":"指示チューニングのデータ設計手法（Flan Collectionなど）の効果を裏付ける公式な研究発表はどこで確認できますか？","promptTypeId":"P-05","answer":"Google Researchが2023年2月1日に公開した公式ブログ記事によると、「The Flan Collection」はFLAN・P3/T0・Natural Instructionsといった既存の指示チューニング用データセットを統合し、対話やプログラム合成、複雑な推論に関する新たなタスクを加えた公開データセットです。同記事は、このデータで学習したFlan-T5が、従来の公開データセット（Flan、P3、Super-Natural Instructions）で学習したモデルと比較して、MMLUベンチマークで3%以上、BigBench Hard（BBH）で8%の性能向上を示し、held-inタスクやChain-of-Thoughtタスクなど各種評価設定全体では3〜17%の改善が見られたと報告しています。この向上は、タスクの多様性拡大に加え、ゼロショット・少数ショット・Chain-of-Thoughtのプロンプトを混在させて学習する手法によるものとされています。","evidencePoints":["instruction-tuning-ev-tair-1"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/instruction-tuning/P-05-001","sourceEvidence":[{"id":"instruction-tuning-ev-tair-1","entityId":"instruction-tuning","text":"Google Researchの公式ブログ（2023年2月）によると、複数の既存指示チューニングデータセットを統合した「The Flan Collection」で学習したFlan-T5は、従来の公開データセットと比較しMMLUで3%以上、BigBench Hardで8%の性能向上を示した。","coverageType":["Differentiation"],"title":"The Flan Collection: Advancing open source methods for instruction tuning","sourceClass":"Research","sourceType":"official_blog","confidence":"high","supportedPromptTypes":["P-05"],"sourceVerified":false,"needsVerification":true,"sourceUrl":"https://research.google/blog/the-flan-collection-advancing-open-source-methods-for-instruction-tuning/"}],"generatedAt":"2026-08-31T06:27:37.260Z","evidenceIds":["instruction-tuning-ev-tair-1"]}]}