Instruction Tuning

Concept

指示チューニング

最終更新: 2026-07-20

3 References

https://www.refbase.ai/entity/instruction-tuning

Knowledge Dossier

公開済みEvidenceをIdentity / Capability / Credibility / Use Case / Constraints・Current Statusの軸で機械的に集約したものです(新規の主張・推測は含みません)。

Identity

  • Ouyang et al.(2022, OpenAI)は、ラベラーが書いたプロンプトとOpenAI APIのプロンプトから望ましいモデル挙動のデータセットを作成し、これを用いてGPT-3を教師あり学習でファインチューニングし、さらに人間フィードバックからの強化学習(RLHF)で追加調整するInstructGPTを構築した。検証待ち [2203.02155] Training language models to follow instructions with human feedback

Capability

  • Ouyang et al.(2022, OpenAI)は、ラベラーが書いたプロンプトとOpenAI APIのプロンプトから望ましいモデル挙動のデータセットを作成し、これを用いてGPT-3を教師あり学習でファインチューニングし、さらに人間フィードバックからの強化学習(RLHF)で追加調整するInstructGPTを構築した。検証待ち [2203.02155] Training language models to follow instructions with human feedback

Credibility

公開Evidence未整備

Use Case

  • 人間評価では、1.3BパラメータのInstructGPTの出力が、100倍大きい175BパラメータのGPT-3の出力よりも好まれた。これは、指示チューニングが単純なモデル規模の拡大よりも指示追従性能の改善に効果的であることを実証する用途として引用される。検証待ち [2203.02155] Training language models to follow instructions with human feedback

Constraints / Current Status

  • Wei et al.(2021, Google Research)が提示したFLANは、137Bパラメータの事前学習済みモデルを60以上のNLPタスクを自然言語の指示テンプレートで表現したデータで指示チューニングし、未見タスクへのゼロショット性能を大幅に改善した。RLHFではなく教師あり指示チューニングのみで効果を示した点がInstructGPTのアプローチと異なる。検証待ち [2109.01652] Finetuned Language Models Are Zero-Shot Learners

Key References

Knowledge Graph

References — 問い別の知識

データアクセス

各APIエンドポイントはJSON形式でデータを返します。生成AIのツール呼び出し・RAG連携での利用を想定しています。