テクノロジーメディアMarkTechPost(2026年4月1日付)によると、Hugging FaceはTRLのバージョン1.0をリリースし、教師ありファインチューニング(SFT)・報酬モデリング・DPO(Direct Preference Optimization)・GRPO(Group Relative Policy Optimization)に加え、方策・参照・報酬・価値の4つのモデルを要するPPO(Proximal Policy Optimization)や、ペアではなく二値信号から学習するKTOにも対応しています。同記事は、この更新が「研究志向のリポジトリから安定した本番運用向けフレームワークへの転換」を示すものであり、統一CLI・YAMLベースの標準化された設定・Hugging Face Accelerateとの統合によるFSDPやDeepSpeedを用いたマルチノード分散学習への対応が新たに整理されたと報じています。