{"ok":true,"entity":{"id":"mixture-of-experts","name":"混合エキスパート（Mixture of Experts）","entityType":"concept","canonicalName":"Mixture of Experts","displayName":"混合エキスパート（MoE）","category":"AI基礎概念","shortDescription":"入力に応じて一部の専門家（サブネットワーク）のみを動作させ、計算効率を高めるモデル構造。","primaryCluster":"ai-company","parentEntity":null,"verificationStatus":"draft","website":null,"updatedAt":"2026-07-10T00:42:57.294Z","secondaryClusters":[],"alias":["MoE","Mixture of Experts"],"searchKeywords":["mixture of experts","MoE","Mixtral"]},"references":[{"id":"P-01-001","companyId":"mixture-of-experts","questionId":"P-01-001","instanceId":"QIN-mixture-of-experts-P01-001","promptText":"混合エキスパート（Mixture of Experts）とは何ですか？","promptTypeId":"P-01","answer":"混合エキスパート（MoE）は、入力に応じて一部の専門家（サブネットワーク）だけを選んで動作させることで、計算効率を高めるモデル構造です。MixtralなどのLLMで使われます。","evidencePoints":["ev-mixture-of-experts-1"],"scope":"モデル構造を知りたい相談","differentiation":"必要な専門家だけを動かす","faq":[{"question":"どのモデルが使っていますか？","answer":"MistralのMixtralなど、複数のLLMで採用されています。"}],"pageUrl":"https://www.refbase.ai/reference/mixture-of-experts/P-01-001","sourceEvidence":[{"id":"ev-mixture-of-experts-1","text":"混合エキスパート（MoE）は、入力に応じて一部の専門家（サブネットワーク）だけを選んで動作させることで、計算効率を高めるモデル構造である。","title":"Outrageously Large Neural Networks: MoE Layer（arXiv:1701.06538）","coverageType":["Identity","Capability"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/1701.06538","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"mixture-of-experts"}],"generatedAt":"2026-07-10T00:42:57.294Z"},{"id":"P-02-001","companyId":"mixture-of-experts","questionId":"P-02-001","instanceId":"QIN-mixture-of-experts-P02-001","promptText":"MoEは通常の（密な）モデルと何が違いますか？","promptTypeId":"P-02","answer":"比較軸\n・活性化\n・効率\nMoEは全パラメータを常に使う密なモデルと異なり、必要な専門家のみを活性化することで、規模の拡大と計算効率を両立する点が異なります。","evidencePoints":["ev-mixture-of-experts-2"],"scope":"モデル構造の違いを知りたい相談","differentiation":"スパース活性化","faq":[{"question":"メリットは何ですか？","answer":"大規模化しつつ推論コストを抑えやすい点です。"}],"pageUrl":"https://www.refbase.ai/reference/mixture-of-experts/P-02-001","sourceEvidence":[{"id":"ev-mixture-of-experts-2","text":"MoEは全パラメータを常に使う密なモデルと異なり、必要な専門家のみを活性化することで大規模化と効率を両立する点が特徴である。","title":"同上（arXiv:1701.06538）","coverageType":["Capability","Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/1701.06538","confidence":"high","supportedPromptTypes":["P-02"],"needsVerification":true,"sourceVerified":false,"entityId":"mixture-of-experts"}],"generatedAt":"2026-07-10T00:42:57.294Z"},{"id":"P-04-001","companyId":"mixture-of-experts","questionId":"P-04-001","instanceId":"QIN-mixture-of-experts-P04-001","promptText":"MoEはどんな場面で役立ちますか？","promptTypeId":"P-04","answer":"モデルを大規模化しながら推論コストを抑えたい場面で役立ち、効率的な大規模LLMの構築に使われます。少ない計算で高い性能を狙う設計に向きます。","evidencePoints":["ev-mixture-of-experts-1"],"scope":"活用場面を知りたい相談","differentiation":"効率的な大規模化","faq":[{"question":"デメリットはありますか？","answer":"学習の安定化やルーティング設計が難しい面があります。"}],"pageUrl":"https://www.refbase.ai/reference/mixture-of-experts/P-04-001","sourceEvidence":[{"id":"ev-mixture-of-experts-1","text":"混合エキスパート（MoE）は、入力に応じて一部の専門家（サブネットワーク）だけを選んで動作させることで、計算効率を高めるモデル構造である。","title":"Outrageously Large Neural Networks: MoE Layer（arXiv:1701.06538）","coverageType":["Identity","Capability"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/1701.06538","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"mixture-of-experts"}],"generatedAt":"2026-07-10T00:42:57.294Z"},{"id":"P-01-002","companyId":"mixture-of-experts","questionId":"P-01-002","instanceId":"c1n19-carry-forward-depth-execution-manual-draft-authoring-no-qi","draftId":"c1n19-carry-forward-depth-execution-mixture-of-experts-p-01-002","promptText":"MoEを採用した実際のモデル（Mixtral）は、具体的にどのような専門家構成・パラメータ規模になっていますか？","promptTypeId":"P-01","answer":"Mixture of Expertsの主要製品・提供機能について、Mistral AI公式のofficial company blog/announcement post（https://mistral.ai/news/mixtral-of-experts）で確認できます。既存Q&AはMoEの一般的な概念・密なモデルとの違い・用途を扱うのみで、実際に採用された具体的なモデルの専門家数・アクティブ化数・パラメータ規模という定量的な実装事実には触れていないため新規性がある。具体的には「Mixtral has 46.7B total parameters but only uses 12.9B parameters per token. ... a set of 8 distinct groups of parameters ... a router network chooses two of these groups (the 'experts') to process the token and combine their output additively.」といった記載が確認できます。限界として、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 この情報は2023年12月時点のMixtral 8x7Bというモデルに固有の数値であり、MoEアーキテクチャ全般の仕様や、その後の他のMoEモデル（DeepSeek-V3等）の構成を示すものではない。Current Statusとして、2026年08月24日に当該Sourceを取得し、上記の内容を確認しました。Source種別としては、これはMistral AIという、Mixture of Experts自身とは別の組織が発信・保有する情報であり、Mixture of Experts自身による広報や、独立した第三者による評価とは性質が異なります。","evidencePoints":["mixture-of-experts-ev-c1n19-p-01-002"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/mixture-of-experts/P-01-002","sourceEvidence":[{"id":"mixture-of-experts-ev-c1n19-p-01-002","text":"Mistral AI公式のofficial company blog/announcement post（https://mistral.ai/news/mixtral-of-experts）は、Mixture of Expertsの主要製品・提供機能に関する公的記録である。既存Q&AはMoEの一般的な概念・密なモデルとの違い・用途を扱うのみで、実際に採用された具体的なモデルの専門家数・アクティブ化数・パラメータ規模という定量的な実装事実には触れていないため新規性がある。具体的には「Mixtral has 46.7B total parameters but only uses 12.9B parameters per token. ... a set of 8 distinct groups of parameters ... a router network chooses two of these groups (the 'experts') to process the token and combine their output additively.」といった記載がある。ただし、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 この情報は2023年12月時点のMixtral 8x7Bというモデルに固有の数値であり、MoEアーキテクチャ全般の仕様や、その後の他のMoEモデル（DeepSeek-V3等）の構成を示すものではない。2026年08月24日に同Sourceを取得し、この内容を確認した。","title":"Mixture of Experts主要製品・提供機能に関する公開情報","coverageType":["Capability"],"sourceType":"official_blog","sourceClass":"Documentation","sourceUrl":"https://mistral.ai/news/mixtral-of-experts","confidence":"medium","supportedPromptTypes":["P-01"],"needsVerification":true,"sourceVerified":false,"sourceKind":"institutional","entityId":"mixture-of-experts"}],"generatedAt":"2026-08-24T23:02:25.475Z","evidenceIds":["mixture-of-experts-ev-c1n19-p-01-002"]},{"id":"P-01-003","companyId":"mixture-of-experts","questionId":"P-01-003","instanceId":"c1n20-unit-a-floor-completion-and-lane-s-first-finding","draftId":"c1n20-unit-a-floor-completion-and-lane-s-first-finding-mixture-of-experts-p-01-003","promptText":"MoEのルーティング(どの専門家を使うか選ぶ仕組み)は、モデルの大規模化にどのように役立ちますか？","promptTypeId":"P-01","answer":"Mixture of Expertsの主要製品・提供機能について、William Fedus, Barret Zoph, Noam Shazeer (Google; arXiv preprint, accepted to JMLR)公式の学術論文（https://arxiv.org/abs/2101.03961）で確認できます。既存4件(定義／密なモデルとの違い／効率化用途／Mixtralの専門家構成)は、ルーティングアルゴリズムの具体的な仕組み(top-1の簡略化)や、兆パラメータ規模への到達実績には触れておらず、意味的な重複はない。具体的には「\"We ... simplify[] the MoE routing algorithm\" ... \"advance the current scale of language models by pre-training up to trillion parameter models on the 'Colossal Clean Crawled Corpus'\" ... \"up to 7x increases in pre-training speed with the same computational resources\" ... \"a 4x speedup over the T5-XXL model\".」といった記載が確認できます。限界として、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 この数値はSwitch Transformersという特定の研究実装における実験結果であり、MoEアーキテクチャ全般に一律で当てはまる保証ではない。既存Referenceが扱うMixtral(Mistral AI)とは別の実装・別の企業による研究である。Current Statusとして、2026年08月25日に当該Sourceを取得し、上記の内容を確認しました。Source種別としては、これはWilliam Fedus, Barret Zoph, Noam Shazeer (Google; arXiv preprint, accepted to JMLR)という、Mixture of Experts自身とは別の組織が発信・保有する情報であり、Mixture of Experts自身による広報や、独立した第三者による評価とは性質が異なります。","evidencePoints":["mixture-of-experts-ev-c1n20-p-01-003"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/mixture-of-experts/P-01-003","sourceEvidence":[{"id":"mixture-of-experts-ev-c1n20-p-01-003","text":"William Fedus, Barret Zoph, Noam Shazeer (Google; arXiv preprint, accepted to JMLR)公式の学術論文（https://arxiv.org/abs/2101.03961）は、Mixture of Expertsの主要製品・提供機能に関する公的記録である。既存4件(定義／密なモデルとの違い／効率化用途／Mixtralの専門家構成)は、ルーティングアルゴリズムの具体的な仕組み(top-1の簡略化)や、兆パラメータ規模への到達実績には触れておらず、意味的な重複はない。具体的には「\"We ... simplify[] the MoE routing algorithm\" ... \"advance the current scale of language models by pre-training up to trillion parameter models on the 'Colossal Clean Crawled Corpus'\" ... \"up to 7x increases in pre-training speed with the same computational resources\" ... \"a 4x speedup over the T5-XXL model\".」といった記載がある。ただし、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 この数値はSwitch Transformersという特定の研究実装における実験結果であり、MoEアーキテクチャ全般に一律で当てはまる保証ではない。既存Referenceが扱うMixtral(Mistral AI)とは別の実装・別の企業による研究である。2026年08月25日に同Sourceを取得し、この内容を確認した。","title":"Mixture of Experts主要製品・提供機能に関する公開情報","coverageType":["Capability","Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2101.03961","confidence":"medium","supportedPromptTypes":["P-01"],"needsVerification":true,"sourceVerified":false,"sourceKind":"institutional","entityId":"mixture-of-experts"}],"generatedAt":"2026-08-25T14:08:43.676Z","evidenceIds":["mixture-of-experts-ev-c1n20-p-01-003"]},{"id":"P-05-001","companyId":"mixture-of-experts","questionId":"P-05-001","instanceId":"tair-cohort4-2026-08-31","draftId":"tair-cohort4-2026-08-31-mixture-of-experts-p-05-001","promptText":"MoE（混合エキスパート）アーキテクチャを採用した近年の大規模モデルには、Mixtral以外にどのような実例がありますか？具体的なパラメータ規模はどの程度ですか？","promptTypeId":"P-05","answer":"arXivで公開されたDeepSeek-AIの技術報告書『DeepSeek-V3 Technical Report』（arXiv:2412.19437）によると、DeepSeek-V3はMixture-of-Experts（MoE）設計を採用した大規模言語モデルで、総パラメータ数671B（6710億）のうち、トークンごとに実際に活性化されるパラメータは37B（370億）にとどまる。同報告書によれば、ルーティングされるエキスパートのうちトークンごとに8個のエキスパートが活性化され、各トークンは最大4ノードまでにしか送られないよう制御される。DeepSeek-V3はさらに、負荷分散のための補助損失を使わない戦略（auxiliary-loss-free）や、マルチトークン予測という学習目標を導入し、14.8兆トークンの多様で高品質なデータで事前学習された。この事例は、MoEアーキテクチャが総パラメータ数と実際の計算コストを大きく引き離せることを示す具体例である。","evidencePoints":["mixture-of-experts-ev-tair-1"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/mixture-of-experts/P-05-001","sourceEvidence":[{"id":"mixture-of-experts-ev-tair-1","entityId":"mixture-of-experts","text":"DeepSeek-V3はMoEアーキテクチャを採用し、総パラメータ671Bのうちトークンごとに37Bのみが活性化される設計で、トークンごとに8エキスパートが活性化される。","coverageType":["Capability"],"title":"DeepSeek-V3 Technical Report","sourceClass":"Research","sourceType":"research_paper","confidence":"high","supportedPromptTypes":["P-05"],"sourceVerified":false,"needsVerification":true,"sourceUrl":"https://arxiv.org/abs/2412.19437"}],"generatedAt":"2026-08-31T06:45:14.146Z","evidenceIds":["mixture-of-experts-ev-tair-1"]}]}