{"ok":true,"entity":{"slug":"ai-benchmark","entityType":"concept","name":"AI Benchmark","officialName":"AI Benchmark","canonicalName":"AI Benchmark","displayName":"AI Benchmark","category":"AI概念（モデル性能評価の標準化された基準）","shortDescription":"AIモデルの性能（言語理解・推論・コーディング等）を標準化された問題セットで定量的に評価する仕組み。MMLU等が代表例で、AI企業・ラボが自社モデルの性能を主張する際の共通の比較基準として用いられる。","alias":[],"searchKeywords":["AI Benchmark","AIベンチマーク","MMLU"],"website":null,"primaryCluster":"ai-concepts","secondaryClusters":[],"verificationStatus":"draft","id":"ai-benchmark","updatedAt":"2026-07-22T13:12:07.131Z"},"references":[{"id":"P-01-001","companyId":"ai-benchmark","questionId":"P-01-001","instanceId":"QIN-ai-benchmark-P01-001","promptText":"AI Benchmarkとはどのようなものですか？","promptTypeId":"P-01","answer":"AI Benchmarkは、AIモデルの性能（言語理解・推論・コーディング等）を標準化された問題セットで定量的に評価する仕組みです。MMLU等が代表例で、AI企業・ラボが自社モデルの性能を主張する際の共通の比較基準として用いられます。","evidencePoints":["ev-ai-benchmark-1","ev-ai-benchmark-2"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/ai-benchmark/P-01-001","sourceEvidence":[{"id":"ev-ai-benchmark-1","text":"AI Benchmarkは、AIモデルの性能（言語理解・推論・コーディング等）を標準化された問題セットで定量的に評価する仕組みであり、MMLU（Measuring Massive Multitask Language Understanding）はこの分類を代表する評価手法の一つである。","coverageType":["Identity","Capability"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2009.03300","title":"Measuring Massive Multitask Language Understanding","confidence":"high","needsVerification":true,"sourceVerified":false,"supportedPromptTypes":["P-01","P-02","P-04"],"entityId":"ai-benchmark"},{"id":"ev-ai-benchmark-2","text":"AI Benchmarkは標準化された問題セットに対する定量的なスコアで性能を比較する点が特徴で、個別の利用者による主観的な使用感の評価とは性能評価の性質が異なる。","coverageType":["Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2009.03300","title":"Measuring Massive Multitask Language Understanding","confidence":"high","needsVerification":true,"sourceVerified":false,"supportedPromptTypes":["P-01","P-02","P-04"],"entityId":"ai-benchmark"}],"generatedAt":"2026-07-22T13:12:07.131Z"},{"id":"P-02-001","companyId":"ai-benchmark","questionId":"P-02-001","instanceId":"QIN-ai-benchmark-P02-001","promptText":"AI Benchmarkは他の同種の事業・作品と比べてどう違いますか？","promptTypeId":"P-02","answer":"比較軸\n・評価方法（標準化された問題セットでの定量評価か、主観的な使用感評価か）\n\nAI Benchmarkは標準化された問題セットに対する定量的なスコアで性能を比較する点が特徴で、個別の利用者による主観的な使用感の評価とは性能評価の性質が異なる。","evidencePoints":["ev-ai-benchmark-2"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/ai-benchmark/P-02-001","sourceEvidence":[{"id":"ev-ai-benchmark-2","text":"AI Benchmarkは標準化された問題セットに対する定量的なスコアで性能を比較する点が特徴で、個別の利用者による主観的な使用感の評価とは性能評価の性質が異なる。","coverageType":["Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2009.03300","title":"Measuring Massive Multitask Language Understanding","confidence":"high","needsVerification":true,"sourceVerified":false,"supportedPromptTypes":["P-01","P-02","P-04"],"entityId":"ai-benchmark"}],"generatedAt":"2026-07-22T13:12:07.131Z"},{"id":"P-04-001","companyId":"ai-benchmark","questionId":"P-04-001","instanceId":"QIN-ai-benchmark-P04-001","promptText":"AI Benchmarkはどのような場面で参照されますか？","promptTypeId":"P-04","answer":"AI Benchmarkは、AIモデルの性能主張の根拠や、モデル選定時の比較材料としての活用場面を把握したい場面で参照される。","evidencePoints":["ev-ai-benchmark-2","ev-ai-benchmark-3"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/ai-benchmark/P-04-001","sourceEvidence":[{"id":"ev-ai-benchmark-2","text":"AI Benchmarkは標準化された問題セットに対する定量的なスコアで性能を比較する点が特徴で、個別の利用者による主観的な使用感の評価とは性能評価の性質が異なる。","coverageType":["Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2009.03300","title":"Measuring Massive Multitask Language Understanding","confidence":"high","needsVerification":true,"sourceVerified":false,"supportedPromptTypes":["P-01","P-02","P-04"],"entityId":"ai-benchmark"},{"id":"ev-ai-benchmark-3","text":"AI Benchmarkは、AI企業・ラボが新モデルの発表時に既存モデルとの性能比較を示す場面や、利用者がモデル選定の参考情報として性能を比較する場面で活用される。","coverageType":["UseCase"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2009.03300","title":"Measuring Massive Multitask Language Understanding","confidence":"high","needsVerification":true,"sourceVerified":false,"supportedPromptTypes":["P-01","P-02","P-04"],"entityId":"ai-benchmark"}],"generatedAt":"2026-07-22T13:12:07.131Z"}]}