RefBase
/
人間のフィードバックによる強化学習(RLHF)
P-01
選定・相談
RLHF(人間のフィードバックによる強化学習)とは何ですか?
RLHFは、人間の評価を報酬として用い、モデルの出力を人間の好みに沿わせる強化学習の手法です。対話AIの調整に広く使われます。
実績・根拠
—
ev-rlhf-1
向いている相談
LLMの調整手法を知りたい相談
他の選択肢との違い
人間の好みで調整する
よくある質問
何に使われますか?
ChatGPTなど対話AIの調整に使われます。
情報ソース
Source
Hugging Face — Illustrating RLHF
検証待ち
出典を見る