Kaplan(2020)の当初の法則はモデルサイズの増加を優先する配分を示唆していましたが、DeepMindのHoffmannら(2022)が提示したChinchilla則は、計算量最適な学習ではモデルサイズとトークン数を同じ比率で増やすべきだと再定義しました。実際、Chinchilla(70B)はより大きなGopher(280B)を上回る性能を示しました。
2つのスケーリング法則の配分方針の違い
計算量最適点をモデルサイズ優先で見るか、モデルとデータの均等拡大で見るかという点で異なる