P-04課題解決

Model Collapseは防ぐことができますか?

スタンフォード大学・MITなど14名の共著者による論文『Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data』(Gerstgrasser et al.、arXiv:2404.01413、2024年4月1日投稿・同月29日改訂)によれば、Model Collapseは必ずしも不可避ではないとされる。従来の多くの研究は「各世代の合成データが元の実データを置き換えていく」という前提を置いていたが、本論文はより現実的な想定として「合成データが実データに追加され蓄積されていく」場合を検証した。その結果、データを置換する場合はテスト誤差が世代を重ねるごとに増加しModel Collapseに至る一方、データを蓄積する場合はテスト誤差が反復回数に依存しない有限の上限にとどまり、Model Collapseが生じないことが示された。この傾向は言語モデルだけでなく、分子構造生成の拡散モデルや画像生成の変分オートエンコーダーでも確認されたという。これはShumailov et al.(2024)が提起した問題に対する、別の独立した研究チームによる緩和策の提案である。

実績・根拠

情報ソース

Model Collapseは防ぐことができますか? | Model Collapse | RefBase