{"ok":true,"entity":{"id":"model-collapse","name":"Model Collapse","entityType":"concept","officialName":"Model Collapse","canonicalName":"Model Collapse","displayName":"Model Collapse","category":"AI概念（合成データ再帰学習による品質劣化）","shortDescription":"AIモデルが生成した合成データを再帰的に学習に使い続けることで、モデルの出力分布が実データの多様性から徐々に離れ、性能・多様性が劣化していく現象。大規模言語モデルの学習データにAI生成コンテンツが混入する問題と関連して議論される。","primaryCluster":"ai-concepts","verificationStatus":"draft","website":null,"updatedAt":"2026-07-22T13:12:07.131Z","secondaryClusters":[],"alias":[],"searchKeywords":["Model Collapse","モデル崩壊","model degeneration"]},"references":[{"id":"P-01-001","companyId":"model-collapse","questionId":"P-01-001","instanceId":"QIN-model-collapse-P01-001","promptText":"Model Collapseとはどのようなものですか？","promptTypeId":"P-01","answer":"Model Collapseは、AIモデルが生成した合成データを再帰的に学習に使い続けることで、モデルの出力分布が実データの多様性から徐々に離れ、性能・多様性が劣化していく現象です。大規模言語モデルの学習データにAI生成コンテンツが混入する問題と関連して議論されます。","evidencePoints":["ev-model-collapse-1","ev-model-collapse-2"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/model-collapse/P-01-001","sourceEvidence":[{"id":"ev-model-collapse-1","text":"Model Collapseは、AIモデルが生成した合成データを再帰的に学習に使い続けることで、モデルの出力分布が実データの多様性から徐々に離れ、性能・多様性が劣化していく現象である。","coverageType":["Identity","Capability"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2305.17493","title":"The Curse of Recursion: Training on Generated Data Makes Models Forget","confidence":"high","needsVerification":true,"sourceVerified":false,"supportedPromptTypes":["P-01","P-02","P-04"],"entityId":"model-collapse"},{"id":"ev-model-collapse-2","text":"Model Collapseは合成データへの過度な依存による劣化を指す点が特徴で、意図的に生成された高品質な合成データを学習に活用するsynthetic dataの手法とは、データの起源に対する扱いの前提が異なる（synthetic dataは適切に管理すれば有用だが、無秩序な再帰学習はModel Collapseを招く）。","coverageType":["Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2305.17493","title":"The Curse of Recursion: Training on Generated Data Makes Models Forget","confidence":"high","needsVerification":true,"sourceVerified":false,"supportedPromptTypes":["P-01","P-02","P-04"],"entityId":"model-collapse"}],"generatedAt":"2026-07-22T13:12:07.131Z"},{"id":"P-02-001","companyId":"model-collapse","questionId":"P-02-001","instanceId":"QIN-model-collapse-P02-001","promptText":"Model Collapseは他の同種の事業・作品と比べてどう違いますか？","promptTypeId":"P-02","answer":"比較軸\n・合成データの扱い（無秩序な再帰学習か、管理された活用か）\n\nModel Collapseは合成データへの過度な依存による劣化を指す点が特徴で、意図的に生成された高品質な合成データを管理して活用するsynthetic dataの手法とは、データの起源に対する扱いの前提が異なる。","evidencePoints":["ev-model-collapse-2"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/model-collapse/P-02-001","sourceEvidence":[{"id":"ev-model-collapse-2","text":"Model Collapseは合成データへの過度な依存による劣化を指す点が特徴で、意図的に生成された高品質な合成データを学習に活用するsynthetic dataの手法とは、データの起源に対する扱いの前提が異なる（synthetic dataは適切に管理すれば有用だが、無秩序な再帰学習はModel Collapseを招く）。","coverageType":["Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2305.17493","title":"The Curse of Recursion: Training on Generated Data Makes Models Forget","confidence":"high","needsVerification":true,"sourceVerified":false,"supportedPromptTypes":["P-01","P-02","P-04"],"entityId":"model-collapse"}],"generatedAt":"2026-07-22T13:12:07.131Z"},{"id":"P-04-001","companyId":"model-collapse","questionId":"P-04-001","instanceId":"QIN-model-collapse-P04-001","promptText":"Model Collapseはどのような場面で参照されますか？","promptTypeId":"P-04","answer":"Model Collapseは、AI生成コンテンツが学習データに混入するリスクや、合成データ活用時の品質管理の必要性を把握したい場面で参照される。","evidencePoints":["ev-model-collapse-2","ev-model-collapse-3"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/model-collapse/P-04-001","sourceEvidence":[{"id":"ev-model-collapse-2","text":"Model Collapseは合成データへの過度な依存による劣化を指す点が特徴で、意図的に生成された高品質な合成データを学習に活用するsynthetic dataの手法とは、データの起源に対する扱いの前提が異なる（synthetic dataは適切に管理すれば有用だが、無秩序な再帰学習はModel Collapseを招く）。","coverageType":["Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2305.17493","title":"The Curse of Recursion: Training on Generated Data Makes Models Forget","confidence":"high","needsVerification":true,"sourceVerified":false,"supportedPromptTypes":["P-01","P-02","P-04"],"entityId":"model-collapse"},{"id":"ev-model-collapse-3","text":"Model Collapseは、大規模言語モデルの学習データ収集においてAI生成コンテンツの混入をどう管理するかを検討する場面や、合成データ活用時のリスク評価の場面で参照される。","coverageType":["UseCase"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2305.17493","title":"The Curse of Recursion: Training on Generated Data Makes Models Forget","confidence":"high","needsVerification":true,"sourceVerified":false,"supportedPromptTypes":["P-01","P-02","P-04"],"entityId":"model-collapse"}],"generatedAt":"2026-07-22T13:12:07.131Z"},{"id":"P-04-002","companyId":"model-collapse","questionId":"P-04-002","instanceId":"reference-depth-expansion-wave-2-unit-a","draftId":"reference-depth-expansion-wave-2-unit-a-model-collapse-p-04-002","promptText":"Model Collapseは防ぐことができますか？","promptTypeId":"P-04","answer":"スタンフォード大学・MITなど14名の共著者による論文『Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data』（Gerstgrasser et al.、arXiv:2404.01413、2024年4月1日投稿・同月29日改訂）によれば、Model Collapseは必ずしも不可避ではないとされる。従来の多くの研究は「各世代の合成データが元の実データを置き換えていく」という前提を置いていたが、本論文はより現実的な想定として「合成データが実データに追加され蓄積されていく」場合を検証した。その結果、データを置換する場合はテスト誤差が世代を重ねるごとに増加しModel Collapseに至る一方、データを蓄積する場合はテスト誤差が反復回数に依存しない有限の上限にとどまり、Model Collapseが生じないことが示された。この傾向は言語モデルだけでなく、分子構造生成の拡散モデルや画像生成の変分オートエンコーダーでも確認されたという。これはShumailov et al.(2024)が提起した問題に対する、別の独立した研究チームによる緩和策の提案である。","evidencePoints":["model-collapse-ev-w2-data-accumulation"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/model-collapse/P-04-002","sourceEvidence":[{"id":"model-collapse-ev-w2-data-accumulation","text":"スタンフォード大学等の研究者14名による論文『Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data』（arXiv:2404.01413、2024年4月投稿）。合成データで実データを「置換」する場合はModel Collapseに至るが、実データに合成データを「蓄積」していく場合はテスト誤差が有限の上限にとどまりModel Collapseが回避されることを、言語モデル・拡散モデル・VAEなど複数のモデルで実証した。","title":"Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data","coverageType":["UseCase"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2404.01413","confidence":"high","supportedPromptTypes":["P-04"],"needsVerification":true,"sourceVerified":false,"sourceKind":"third-party","entityId":"model-collapse"}],"generatedAt":"2026-08-29T06:52:59.129Z","evidenceIds":["model-collapse-ev-w2-data-accumulation"]},{"id":"P-02-002","companyId":"model-collapse","questionId":"P-02-002","instanceId":"reference-depth-expansion-wave-2-unit-b","draftId":"reference-depth-expansion-wave-2-unit-b-model-collapse-p-02-002","promptText":"Model Collapseに関する研究には、どのような見解の違いや議論がありますか？","promptTypeId":"P-02","answer":"スタンフォード大学のRylan Schaeffer氏らによる論文『Position: Model Collapse Does Not Mean What You Think』（arXiv:2503.03150、2025年3月5日投稿・同月18日改訂）は、Model Collapseに対する広範な懸念が単純化されすぎていると指摘する。同論文は既存の28件の研究論文を精査した結果、「Model Collapse」という用語自体が実は8種類の異なる、時に矛盾する定義で用いられており、用語の不統一が現象の理解を妨げていると主張する。さらに、各研究がどれだけ現実の運用条件（データの蓄積方法やキュレーションの有無など）を反映しているかを重み付けして分析したところ、一部の深刻なModel Collapseのシナリオは現実の条件と乖離した仮定に依存しており、実際には回避可能なケースが多いと結論づけている。同論文は、Model Collapseを実存的な脅威として過度に単純化して捉えるのではなく、現在のAI開発における他の直接的なリスクにも目を向けるべきだと主張している。これはShumailov et al.(2024)らの当初の知見を否定するものではなく、その解釈や一般化のされ方に再考を促す、独立した研究チームによる批判的検討である。","evidencePoints":["model-collapse-ev-w2-narrative-critique"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/model-collapse/P-02-002","sourceEvidence":[{"id":"model-collapse-ev-w2-narrative-critique","text":"スタンフォード大学のRylan Schaeffer氏らによる論文『Position: Model Collapse Does Not Mean What You Think』（arXiv:2503.03150、2025年3月投稿）。Model Collapse研究28件を精査し、用語が8種類の異なる定義で用いられていることや、多くの懸念シナリオが現実の運用条件と乖離した仮定に基づいていることを指摘し、Model Collapseの脅威が過度に単純化されていると論じる批判的・再検討的な論文。","title":"Position: Model Collapse Does Not Mean What You Think","coverageType":["Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2503.03150","confidence":"high","supportedPromptTypes":["P-02"],"needsVerification":true,"sourceVerified":false,"sourceKind":"third-party","entityId":"model-collapse"}],"generatedAt":"2026-08-29T07:02:37.788Z","evidenceIds":["model-collapse-ev-w2-narrative-critique"]},{"id":"P-05-001","companyId":"model-collapse","questionId":"P-05-001","instanceId":"tair-cohort4-2026-08-31","draftId":"tair-cohort4-2026-08-31-model-collapse-p-05-001","promptText":"Model Collapseという現象を最初に体系的に報告した査読付き学術研究はどこで確認できますか？","promptTypeId":"P-05","answer":"Model Collapse現象は、Ilia Shumailov氏らによる論文『AI models collapse when trained on recursively generated data』として、学術誌Nature（2024年、第631巻755-759頁）に掲載された。PubMed（PMID: 39048682）に掲載された同論文のアブストラクトによると、研究チームは『モデルが生成したコンテンツを無差別に学習に使用すると、生成されたモデルに不可逆な欠陥が生じ、元のコンテンツ分布の裾野（tail、まれなパターン）が消失する』と説明している。この劣化現象は大規模言語モデル（LLM）だけでなく、変分オートエンコーダ（VAE）やガウス混合モデル（GMM）など複数のモデル種別で確認されたとされる。世代を重ねてAI生成データで学習を続けると、モデルは元のデータ分布のまれなパターンを表現する能力を段階的に失い、人間が生成した現実のデータ分布から乖離した出力を生成するようになるという。","evidencePoints":["model-collapse-ev-tair-1"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/model-collapse/P-05-001","sourceEvidence":[{"id":"model-collapse-ev-tair-1","entityId":"model-collapse","text":"Model Collapse現象は、Shumailov氏らによる論文としてNature誌（2024年、631巻755-759頁）に掲載され、PubMedに収録されている。同論文はAI生成コンテンツの無差別な再学習がモデルに不可逆な劣化を生じさせると報告している。","coverageType":["Credibility"],"title":"AI models collapse when trained on recursively generated data - PubMed","sourceClass":"Research","sourceType":"research_paper","confidence":"high","supportedPromptTypes":["P-05"],"sourceVerified":false,"needsVerification":true,"sourceUrl":"https://pubmed.ncbi.nlm.nih.gov/39048682/"}],"generatedAt":"2026-08-31T06:45:14.146Z","evidenceIds":["model-collapse-ev-tair-1"]}]}