人間のフィードバックによる強化学習(RLHF)

Concept

AI基礎概念

最終更新: 2026-07-10

5 References

https://www.refbase.ai/entity/rlhf

Knowledge Dossier

公開済みEvidenceをIdentity / Capability / Credibility / Use Case / Constraints・Current Statusの軸で機械的に集約したものです(新規の主張・推測は含みません)。

Identity

  • RLHF(人間のフィードバックによる強化学習)は、人間の評価を報酬として用い、モデルの出力を人間の好みに沿わせる強化学習の手法である。検証待ち Hugging Face — Illustrating RLHF

Capability

  • RLHF(人間のフィードバックによる強化学習)は、人間の評価を報酬として用い、モデルの出力を人間の好みに沿わせる強化学習の手法である。検証待ち Hugging Face — Illustrating RLHF
  • RLHFは、正解データだけで学習する方法と異なり、人間の好みを報酬として学習させることで、より役立ち安全な応答へ調整できる点を特徴とする。検証待ち Hugging Face — Illustrating RLHF

Credibility

  • OpenAIの論文「Training language models to follow instructions with human feedback」(arXiv:2203.02155、2022年、NeurIPS 2022掲載)は、RLHFで調整した13億パラメータのInstructGPTの出力が、100倍のパラメータ数を持つ1750億パラメータのGPT-3より人間評価者に好まれたことを示した。検証待ち Training language models to follow instructions with human feedback

Use Case

公開Evidence未整備

Constraints / Current Status

  • RLHFは、正解データだけで学習する方法と異なり、人間の好みを報酬として学習させることで、より役立ち安全な応答へ調整できる点を特徴とする。検証待ち Hugging Face — Illustrating RLHF
  • スタンフォード大学のRafailovらによるarXiv論文(arXiv:2305.18290)は、RLHFの代替としてDirect Preference Optimization(DPO)を提案し、別途の報酬モデル学習や強化学習によるサンプリングを不要にしつつ複数ベンチマークでRLHF(PPO)と同等以上の性能を示したと報告している。検証待ち Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Key References

Knowledge Graph

References — 問い別の知識

データアクセス

各APIエンドポイントはJSON形式でデータを返します。生成AIのツール呼び出し・RAG連携での利用を想定しています。