P-02比較・違い

RLHFにはどのような代替手法があり、それはどう異なりますか?

スタンフォード大学のRafael Rafailov・Archit Sharma・Eric Mitchell・Stefano Ermon・Christopher D. Manning・Chelsea Finnらが著したarXiv論文「Direct Preference Optimization: Your Language Model is Secretly a Reward Model」(arXiv:2305.18290)は、RLHFの代替手法としてDirect Preference Optimization(DPO)を提案しています。従来のRLHFは人間の選好を反映した報酬モデルを学習した上で強化学習でモデルを微調整しますが、DPOは報酬モデルの新しいパラメータ化により最適方策を閉形式で導出できることを示し、単純な分類損失だけでRLHFと同等の問題を解けるようにしました。論文によれば、DPOは学習中にモデルからのサンプリングや大幅なハイパーパラメータ調整を必要とせず、感情制御・要約・対話タスクなどの複数のベンチマークでPPOベースのRLHFと同等以上の性能を示したとされています。

実績・根拠

情報ソース