P-02比較・違い

RLHFは通常の学習と何が違いますか?

比較軸 ・学習信号 ・目的 RLHFは、正解データだけで学習する方法と異なり、人間の好みを報酬として学習させることで、より役立ち安全な応答へ調整できる点が異なります。

実績・根拠

向いている相談

学習手法の違いを知りたい相談

他の選択肢との違い

人間の好みを報酬にする

よくある質問

アライメントと関係ありますか?
AIを人間の意図に沿わせる代表的な手法です。

情報ソース

RLHFは通常の学習と何が違いますか? | 人間のフィードバックによる強化学習(RLHF) | RefBase