P-02比較・違い

Kaplanのスケーリング法則とChinchilla則はどう違いますか?

Kaplan(2020)の当初の法則はモデルサイズの増加を優先する配分を示唆していましたが、DeepMindのHoffmannら(2022)が提示したChinchilla則は、計算量最適な学習ではモデルサイズとトークン数を同じ比率で増やすべきだと再定義しました。実際、Chinchilla(70B)はより大きなGopher(280B)を上回る性能を示しました。

実績・根拠

向いている相談

2つのスケーリング法則の配分方針の違い

他の選択肢との違い

計算量最適点をモデルサイズ優先で見るか、モデルとデータの均等拡大で見るかという点で異なる

よくある質問

Chinchillaとは何ですか?
DeepMindがChinchilla則を実証するために学習した70Bパラメータのモデルです。

情報ソース