P-06推薦理由

TRLは実際にどのようなモデルの学習に使われていますか?

データサイエンス専門メディアKDnuggetsの記事によると、Hugging FaceのH4チームが開発したZephyr-7B(Mistral-7Bをベースにしたアラインメント済みモデル)は、蒸留教師ありファインチューニング(dSFT)・GPT-4によるフィードバック収集・TRLライブラリを用いたDirect Preference Optimization(dDPO)という3段階の手法で学習されたと報じられています。同記事は「エンジニアはファインチューニングとアラインメントにTRLライブラリを使用した」と明記しており、学習にはDeepSpeed Zero 3とFlash-Attention 2を用いてA100 GPU16基上で実験ごとに2〜4時間を要したとされています。Zephyr-7Bは、より大規模なモデルに匹敵する性能を達成したとされる、実際の著名なオープンモデルの一つです。

実績・根拠

情報ソース