TRLは、教師ありファインチューニングを超えて、人間のフィードバックに基づく強化学習(RLHF)でモデルの振る舞いを調整したい場面で活用できます。
LLMのアラインメント学習の相談
教師ありファインチューニングでは対応できないRLHF領域への対応