InstructGPT(OpenAI)は教師あり指示チューニングに加えて人間フィードバックからの強化学習(RLHF)を組み合わせています。一方、GoogleのFLANは60以上のタスクを指示テンプレートで学習する教師あり指示チューニングのみで、未見タスクへのゼロショット性能改善を実証しました。
RLHFを伴うか否かという指示チューニング手法の違い
強化学習ステップの有無、および評価対象(人間の好みか未見タスクのゼロショット性能か)が異なる