Model Collapse現象は、Ilia Shumailov氏らによる論文『AI models collapse when trained on recursively generated data』として、学術誌Nature(2024年、第631巻755-759頁)に掲載された。PubMed(PMID: 39048682)に掲載された同論文のアブストラクトによると、研究チームは『モデルが生成したコンテンツを無差別に学習に使用すると、生成されたモデルに不可逆な欠陥が生じ、元のコンテンツ分布の裾野(tail、まれなパターン)が消失する』と説明している。この劣化現象は大規模言語モデル(LLM)だけでなく、変分オートエンコーダ(VAE)やガウス混合モデル(GMM)など複数のモデル種別で確認されたとされる。世代を重ねてAI生成データで学習を続けると、モデルは元のデータ分布のまれなパターンを表現する能力を段階的に失い、人間が生成した現実のデータ分布から乖離した出力を生成するようになるという。