P-01選定・相談

MoEを採用した実際のモデル(Mixtral)は、具体的にどのような専門家構成・パラメータ規模になっていますか?

Mixture of Expertsの主要製品・提供機能について、Mistral AI公式のofficial company blog/announcement post(https://mistral.ai/news/mixtral-of-experts)で確認できます。既存Q&AはMoEの一般的な概念・密なモデルとの違い・用途を扱うのみで、実際に採用された具体的なモデルの専門家数・アクティブ化数・パラメータ規模という定量的な実装事実には触れていないため新規性がある。具体的には「Mixtral has 46.7B total parameters but only uses 12.9B parameters per token. ... a set of 8 distinct groups of parameters ... a router network chooses two of these groups (the 'experts') to process the token and combine their output additively.」といった記載が確認できます。限界として、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 この情報は2023年12月時点のMixtral 8x7Bというモデルに固有の数値であり、MoEアーキテクチャ全般の仕様や、その後の他のMoEモデル(DeepSeek-V3等)の構成を示すものではない。Current Statusとして、2026年08月24日に当該Sourceを取得し、上記の内容を確認しました。Source種別としては、これはMistral AIという、Mixture of Experts自身とは別の組織が発信・保有する情報であり、Mixture of Experts自身による広報や、独立した第三者による評価とは性質が異なります。

実績・根拠

情報ソース