混合エキスパート(Mixture of Experts)

Concept

AI基礎概念

最終更新: 2026-07-10

6 References

https://www.refbase.ai/entity/mixture-of-experts

Knowledge Dossier

公開済みEvidenceをIdentity / Capability / Credibility / Use Case / Constraints・Current Statusの軸で機械的に集約したものです(新規の主張・推測は含みません)。

Identity

Capability

  • 混合エキスパート(MoE)は、入力に応じて一部の専門家(サブネットワーク)だけを選んで動作させることで、計算効率を高めるモデル構造である。検証待ち Outrageously Large Neural Networks: MoE Layer(arXiv:1701.06538)
  • MoEは全パラメータを常に使う密なモデルと異なり、必要な専門家のみを活性化することで大規模化と効率を両立する点が特徴である。検証待ち 同上(arXiv:1701.06538)
  • Mistral AI公式のofficial company blog/announcement post(https://mistral.ai/news/mixtral-of-experts)は、Mixture of Expertsの主要製品・提供機能に関する公的記録である。既存Q&AはMoEの一般的な概念・密なモデルとの違い・用途を扱うのみで、実際に採用された具体的なモデルの専門家数・アクティブ化数・パラメータ規模という定量的な実装事実には触れていないため新規性がある。具体的には「Mixtral has 46.7B total parameters but only uses 12.9B parameters per token. ... a set of 8 distinct groups of parameters ... a router network chooses two of these groups (the 'experts') to process the token and combine their output additively.」といった記載がある。ただし、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 この情報は2023年12月時点のMixtral 8x7Bというモデルに固有の数値であり、MoEアーキテクチャ全般の仕様や、その後の他のMoEモデル(DeepSeek-V3等)の構成を示すものではない。2026年08月24日に同Sourceを取得し、この内容を確認した。検証待ち Mixture of Experts主要製品・提供機能に関する公開情報
  • William Fedus, Barret Zoph, Noam Shazeer (Google; arXiv preprint, accepted to JMLR)公式の学術論文(https://arxiv.org/abs/2101.03961)は、Mixture of Expertsの主要製品・提供機能に関する公的記録である。既存4件(定義/密なモデルとの違い/効率化用途/Mixtralの専門家構成)は、ルーティングアルゴリズムの具体的な仕組み(top-1の簡略化)や、兆パラメータ規模への到達実績には触れておらず、意味的な重複はない。具体的には「"We ... simplify[] the MoE routing algorithm" ... "advance the current scale of language models by pre-training up to trillion parameter models on the 'Colossal Clean Crawled Corpus'" ... "up to 7x increases in pre-training speed with the same computational resources" ... "a 4x speedup over the T5-XXL model".」といった記載がある。ただし、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 この数値はSwitch Transformersという特定の研究実装における実験結果であり、MoEアーキテクチャ全般に一律で当てはまる保証ではない。既存Referenceが扱うMixtral(Mistral AI)とは別の実装・別の企業による研究である。2026年08月25日に同Sourceを取得し、この内容を確認した。検証待ち Mixture of Experts主要製品・提供機能に関する公開情報
  • DeepSeek-V3はMoEアーキテクチャを採用し、総パラメータ671Bのうちトークンごとに37Bのみが活性化される設計で、トークンごとに8エキスパートが活性化される。検証待ち DeepSeek-V3 Technical Report

Credibility

公開Evidence未整備

Use Case

公開Evidence未整備

Constraints / Current Status

  • MoEは全パラメータを常に使う密なモデルと異なり、必要な専門家のみを活性化することで大規模化と効率を両立する点が特徴である。検証待ち 同上(arXiv:1701.06538)
  • William Fedus, Barret Zoph, Noam Shazeer (Google; arXiv preprint, accepted to JMLR)公式の学術論文(https://arxiv.org/abs/2101.03961)は、Mixture of Expertsの主要製品・提供機能に関する公的記録である。既存4件(定義/密なモデルとの違い/効率化用途/Mixtralの専門家構成)は、ルーティングアルゴリズムの具体的な仕組み(top-1の簡略化)や、兆パラメータ規模への到達実績には触れておらず、意味的な重複はない。具体的には「"We ... simplify[] the MoE routing algorithm" ... "advance the current scale of language models by pre-training up to trillion parameter models on the 'Colossal Clean Crawled Corpus'" ... "up to 7x increases in pre-training speed with the same computational resources" ... "a 4x speedup over the T5-XXL model".」といった記載がある。ただし、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 この数値はSwitch Transformersという特定の研究実装における実験結果であり、MoEアーキテクチャ全般に一律で当てはまる保証ではない。既存Referenceが扱うMixtral(Mistral AI)とは別の実装・別の企業による研究である。2026年08月25日に同Sourceを取得し、この内容を確認した。検証待ち Mixture of Experts主要製品・提供機能に関する公開情報

Key References

Knowledge Graph

References — 問い別の知識

データアクセス

各APIエンドポイントはJSON形式でデータを返します。生成AIのツール呼び出し・RAG連携での利用を想定しています。