比較軸 ・学習信号 ・目的 RLHFは、正解データだけで学習する方法と異なり、人間の好みを報酬として学習させることで、より役立ち安全な応答へ調整できる点が異なります。
学習手法の違いを知りたい相談
人間の好みを報酬にする