{"ok":true,"entity":{"slug":"scaling-law","entityType":"concept","name":"Scaling Law","officialName":"Scaling Law","canonicalName":"Scaling Law","displayName":"Scaling Law","category":"AIスケーリング法則","shortDescription":"モデルサイズ・データ量・計算量を増やすとAIモデルの性能（損失）がべき乗則に従って改善するという経験則。学習リソース配分の意思決定の土台になっている。","alias":[],"searchKeywords":["スケーリング法則","scaling law","Chinchilla則"],"website":null,"primaryCluster":"ai-concepts","secondaryClusters":[],"verificationStatus":"draft","id":"scaling-law","updatedAt":"2026-07-20T11:04:59.119Z"},"references":[{"id":"P-01-001","companyId":"scaling-law","questionId":"P-01-001","instanceId":"QIN-scaling-law-P01-001","promptText":"AIのスケーリング法則とは何ですか？","promptTypeId":"P-01","answer":"スケーリング法則とは、AIモデルの性能（損失）がモデルサイズ・データ量・学習計算量を増やすことでべき乗則に従って改善するという経験則です。OpenAIのKaplanらが2020年に発表した論文で、7桁以上の規模にわたって成立することが示されました。","evidencePoints":["ev-scaling-law-1"],"scope":"モデルサイズ・データ量・計算量と性能の関係を説明する経験則","differentiation":"個別モデルの実装ではなく、学習リソース配分の意思決定を導く理論的枠組みという点で他の技術概念と異なる","faq":[{"question":"スケーリング法則は誰が発見しましたか？","answer":"OpenAIのJared Kaplanらが2020年の論文で提示しました。"}],"pageUrl":"https://www.refbase.ai/reference/scaling-law/P-01-001","sourceEvidence":[{"id":"ev-scaling-law-1","text":"Kaplan et al.（2020, OpenAI）は、7桁以上の計算量・パラメータ数・データ量にわたり200以上のTransformer言語モデルを学習し、クロスエントロピー損失がモデルサイズ・データセットサイズ・計算量のべき乗則に従うことを示した。","title":"[2001.08361] Scaling Laws for Neural Language Models","coverageType":["Identity","Capability"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2001.08361","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"scaling-law"}],"generatedAt":"2026-07-20T11:04:59.119Z"},{"id":"P-02-001","companyId":"scaling-law","questionId":"P-02-001","instanceId":"QIN-scaling-law-P02-001","promptText":"Kaplanのスケーリング法則とChinchilla則はどう違いますか？","promptTypeId":"P-02","answer":"Kaplan（2020）の当初の法則はモデルサイズの増加を優先する配分を示唆していましたが、DeepMindのHoffmannら（2022）が提示したChinchilla則は、計算量最適な学習ではモデルサイズとトークン数を同じ比率で増やすべきだと再定義しました。実際、Chinchilla（70B）はより大きなGopher（280B）を上回る性能を示しました。","evidencePoints":["ev-scaling-law-2","ev-scaling-law-3"],"scope":"2つのスケーリング法則の配分方針の違い","differentiation":"計算量最適点をモデルサイズ優先で見るか、モデルとデータの均等拡大で見るかという点で異なる","faq":[{"question":"Chinchillaとは何ですか？","answer":"DeepMindがChinchilla則を実証するために学習した70Bパラメータのモデルです。"}],"pageUrl":"https://www.refbase.ai/reference/scaling-law/P-02-001","sourceEvidence":[{"id":"ev-scaling-law-2","text":"Hoffmann et al.（2022, DeepMind）はChinchilla則として、計算量最適な学習ではモデルサイズとトークン数を同じ比率で増やすべきだと再定義した。Kaplanらの当初の法則（モデルサイズを優先的に増やす配分）とは、計算量最適点の推定方法で異なる。","title":"[2203.15556] Training Compute-Optimal Large Language Models","coverageType":["Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2203.15556","confidence":"high","supportedPromptTypes":["P-02"],"needsVerification":true,"sourceVerified":false,"entityId":"scaling-law"},{"id":"ev-scaling-law-3","text":"Chinchilla（70B、Gopher相当の計算量で学習）はGopher（280B）・GPT-3（175B）・Megatron-Turing NLG（530B）を上回る性能を示し、スケーリング法則がモデル・データ配分の意思決定に実用上使われていることを示す代表例となった。","title":"[2203.15556] Training Compute-Optimal Large Language Models","coverageType":["UseCase"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2203.15556","confidence":"high","supportedPromptTypes":["P-02","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"scaling-law"}],"generatedAt":"2026-07-20T11:04:59.119Z"},{"id":"P-04-001","companyId":"scaling-law","questionId":"P-04-001","instanceId":"QIN-scaling-law-P04-001","promptText":"スケーリング法則は実際の開発でどう使われますか？","promptTypeId":"P-04","answer":"限られた計算予算のもとで、モデルサイズと学習データ量をどう配分すれば性能が最大化されるかを予測するために使われます。Chinchillaはこの考え方を実証し、より小さく・より多くのデータで学習したモデルが、より大きく・データが少ないモデルを上回ることを示しました。","evidencePoints":["ev-scaling-law-3"],"scope":"学習リソース配分の意思決定という課題への適用","differentiation":"理論的な経験則を実際のモデル学習計画に落とし込む橋渡しの役割を担う","faq":[],"pageUrl":"https://www.refbase.ai/reference/scaling-law/P-04-001","sourceEvidence":[{"id":"ev-scaling-law-3","text":"Chinchilla（70B、Gopher相当の計算量で学習）はGopher（280B）・GPT-3（175B）・Megatron-Turing NLG（530B）を上回る性能を示し、スケーリング法則がモデル・データ配分の意思決定に実用上使われていることを示す代表例となった。","title":"[2203.15556] Training Compute-Optimal Large Language Models","coverageType":["UseCase"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2203.15556","confidence":"high","supportedPromptTypes":["P-02","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"scaling-law"}],"generatedAt":"2026-07-20T11:04:59.119Z"}]}