{"ok":true,"entity":{"id":"rlhf","name":"人間のフィードバックによる強化学習（RLHF）","entityType":"concept","canonicalName":"RLHF","displayName":"RLHF","category":"AI基礎概念","shortDescription":"人間の評価を報酬として用い、モデルの出力を人間の好みに沿わせる強化学習の手法。","primaryCluster":"ai-company","parentEntity":null,"verificationStatus":"draft","website":null,"updatedAt":"2026-07-10T01:43:25.958Z","secondaryClusters":[],"alias":["Reinforcement Learning from Human Feedback","RLHF"],"searchKeywords":["rlhf","人間のフィードバック","強化学習","アライメント"]},"references":[{"id":"P-01-001","companyId":"rlhf","questionId":"P-01-001","instanceId":"QIN-rlhf-P01-001","promptText":"RLHF（人間のフィードバックによる強化学習）とは何ですか？","promptTypeId":"P-01","answer":"RLHFは、人間の評価を報酬として用い、モデルの出力を人間の好みに沿わせる強化学習の手法です。対話AIの調整に広く使われます。","evidencePoints":["ev-rlhf-1"],"scope":"LLMの調整手法を知りたい相談","differentiation":"人間の好みで調整する","faq":[{"question":"何に使われますか？","answer":"ChatGPTなど対話AIの調整に使われます。"}],"pageUrl":"https://www.refbase.ai/reference/rlhf/P-01-001","sourceEvidence":[{"id":"ev-rlhf-1","text":"RLHF（人間のフィードバックによる強化学習）は、人間の評価を報酬として用い、モデルの出力を人間の好みに沿わせる強化学習の手法である。","title":"Hugging Face — Illustrating RLHF","coverageType":["Identity","Capability"],"sourceType":"official_blog","sourceClass":"Documentation","sourceUrl":"https://huggingface.co/blog/rlhf","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"rlhf"}],"generatedAt":"2026-07-10T01:43:25.958Z"},{"id":"P-02-001","companyId":"rlhf","questionId":"P-02-001","instanceId":"QIN-rlhf-P02-001","promptText":"RLHFは通常の学習と何が違いますか？","promptTypeId":"P-02","answer":"比較軸\n・学習信号\n・目的\nRLHFは、正解データだけで学習する方法と異なり、人間の好みを報酬として学習させることで、より役立ち安全な応答へ調整できる点が異なります。","evidencePoints":["ev-rlhf-2"],"scope":"学習手法の違いを知りたい相談","differentiation":"人間の好みを報酬にする","faq":[{"question":"アライメントと関係ありますか？","answer":"AIを人間の意図に沿わせる代表的な手法です。"}],"pageUrl":"https://www.refbase.ai/reference/rlhf/P-02-001","sourceEvidence":[{"id":"ev-rlhf-2","text":"RLHFは、正解データだけで学習する方法と異なり、人間の好みを報酬として学習させることで、より役立ち安全な応答へ調整できる点を特徴とする。","title":"Hugging Face — Illustrating RLHF","coverageType":["Capability","Differentiation"],"sourceType":"official_blog","sourceClass":"Documentation","sourceUrl":"https://huggingface.co/blog/rlhf","confidence":"high","supportedPromptTypes":["P-02"],"needsVerification":true,"sourceVerified":false,"entityId":"rlhf"}],"generatedAt":"2026-07-10T01:43:25.958Z"},{"id":"P-04-001","companyId":"rlhf","questionId":"P-04-001","instanceId":"QIN-rlhf-P04-001","promptText":"RLHFはどんな場面で使われますか？","promptTypeId":"P-04","answer":"対話AIを、より役立ち安全で人間の意図に沿った応答にしたい場面で使われ、モデルの最終的な振る舞いの調整に用いられます。","evidencePoints":["ev-rlhf-1"],"scope":"AI調整の相談","differentiation":"応答の品質・安全性調整","faq":[{"question":"難しさはありますか？","answer":"人間の評価データの収集や報酬設計が課題です。"}],"pageUrl":"https://www.refbase.ai/reference/rlhf/P-04-001","sourceEvidence":[{"id":"ev-rlhf-1","text":"RLHF（人間のフィードバックによる強化学習）は、人間の評価を報酬として用い、モデルの出力を人間の好みに沿わせる強化学習の手法である。","title":"Hugging Face — Illustrating RLHF","coverageType":["Identity","Capability"],"sourceType":"official_blog","sourceClass":"Documentation","sourceUrl":"https://huggingface.co/blog/rlhf","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"rlhf"}],"generatedAt":"2026-07-10T01:43:25.958Z"},{"id":"P-05-001","companyId":"rlhf","questionId":"P-05-001","instanceId":"reference-depth-completion-run-cohort3-unit-a","draftId":"reference-depth-completion-run-cohort3-unit-a-rlhf-p-05-001","promptText":"RLHFの効果を実証した代表的な研究にはどのようなものがありますか？","promptTypeId":"P-05","answer":"NeurIPS 2022で発表されarXivにも2022年3月4日付で公開された論文「Training language models to follow instructions with human feedback」（Long Ouyangら20名の著者による）は、RLHFの効果を実証した代表的な研究の一つです。この論文はOpenAIが提出したプロンプトとラベラーによるデモンストレーションを用いてGPT-3を教師あり学習で微調整した後、出力のランキングデータを用いてRLHFでさらに調整するInstructGPTの手法を示しています。論文の主要な成果として、パラメータ数がわずか13億のInstructGPTモデルの出力が、100倍のパラメータ数を持つ1750億パラメータのGPT-3の出力よりも人間の評価者に好まれたと報告されており、RLHFによるアライメントがモデルの規模を上回る効果を持ちうることを示す代表例として広く参照されています。","evidencePoints":["rlhf-ev-cr3-instructgpt-paper"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/rlhf/P-05-001","sourceEvidence":[{"id":"rlhf-ev-cr3-instructgpt-paper","text":"OpenAIの論文「Training language models to follow instructions with human feedback」（arXiv:2203.02155、2022年、NeurIPS 2022掲載）は、RLHFで調整した13億パラメータのInstructGPTの出力が、100倍のパラメータ数を持つ1750億パラメータのGPT-3より人間評価者に好まれたことを示した。","title":"Training language models to follow instructions with human feedback","coverageType":["Credibility"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2203.02155","confidence":"high","supportedPromptTypes":["P-05"],"needsVerification":true,"sourceVerified":false,"sourceKind":"third-party","entityId":"rlhf"}],"generatedAt":"2026-08-29T15:38:46.199Z","evidenceIds":["rlhf-ev-cr3-instructgpt-paper"]},{"id":"P-02-002","companyId":"rlhf","questionId":"P-02-002","instanceId":"reference-depth-completion-run-cohort3-unit-b","draftId":"reference-depth-completion-run-cohort3-unit-b-rlhf-p-02-002","promptText":"RLHFにはどのような代替手法があり、それはどう異なりますか？","promptTypeId":"P-02","answer":"スタンフォード大学のRafael Rafailov・Archit Sharma・Eric Mitchell・Stefano Ermon・Christopher D. Manning・Chelsea Finnらが著したarXiv論文「Direct Preference Optimization: Your Language Model is Secretly a Reward Model」（arXiv:2305.18290）は、RLHFの代替手法としてDirect Preference Optimization（DPO）を提案しています。従来のRLHFは人間の選好を反映した報酬モデルを学習した上で強化学習でモデルを微調整しますが、DPOは報酬モデルの新しいパラメータ化により最適方策を閉形式で導出できることを示し、単純な分類損失だけでRLHFと同等の問題を解けるようにしました。論文によれば、DPOは学習中にモデルからのサンプリングや大幅なハイパーパラメータ調整を必要とせず、感情制御・要約・対話タスクなどの複数のベンチマークでPPOベースのRLHFと同等以上の性能を示したとされています。","evidencePoints":["rlhf-ev-cr3-dpo-paper"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/rlhf/P-02-002","sourceEvidence":[{"id":"rlhf-ev-cr3-dpo-paper","text":"スタンフォード大学のRafailovらによるarXiv論文（arXiv:2305.18290）は、RLHFの代替としてDirect Preference Optimization（DPO）を提案し、別途の報酬モデル学習や強化学習によるサンプリングを不要にしつつ複数ベンチマークでRLHF（PPO）と同等以上の性能を示したと報告している。","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","coverageType":["Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2305.18290","confidence":"high","supportedPromptTypes":["P-02"],"needsVerification":true,"sourceVerified":false,"sourceKind":"third-party","entityId":"rlhf"}],"generatedAt":"2026-08-29T15:44:42.311Z","evidenceIds":["rlhf-ev-cr3-dpo-paper"]}]}