P-01選定・相談

RLHF(人間のフィードバックによる強化学習)とは何ですか?

RLHFは、人間の評価を報酬として用い、モデルの出力を人間の好みに沿わせる強化学習の手法です。対話AIの調整に広く使われます。

実績・根拠

向いている相談

LLMの調整手法を知りたい相談

他の選択肢との違い

人間の好みで調整する

よくある質問

何に使われますか?
ChatGPTなど対話AIの調整に使われます。

情報ソース