Mistral AI公式のofficial company blog/announcement post(https://mistral.ai/news/mixtral-of-experts)は、Mixture of Expertsの主要製品・提供機能に関する公的記録である。既存Q&AはMoEの一般的な概念・密なモデルとの違い・用途を扱うのみで、実際に採用された具体的なモデルの専門家数・アクティブ化数・パラメータ規模という定量的な実装事実には触れていないため新規性がある。具体的には「Mixtral has 46.7B total parameters but only uses 12.9B parameters per token. ... a set of 8 distinct groups of parameters ... a router network chooses two of these groups (the 'experts') to process the token and combine their output additively.」といった記載がある。ただし、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 この情報は2023年12月時点のMixtral 8x7Bというモデルに固有の数値であり、MoEアーキテクチャ全般の仕様や、その後の他のMoEモデル(DeepSeek-V3等)の構成を示すものではない。2026年08月24日に同Sourceを取得し、この内容を確認した。検証待ちMixture of Experts主要製品・提供機能に関する公開情報
William Fedus, Barret Zoph, Noam Shazeer (Google; arXiv preprint, accepted to JMLR)公式の学術論文(https://arxiv.org/abs/2101.03961)は、Mixture of Expertsの主要製品・提供機能に関する公的記録である。既存4件(定義/密なモデルとの違い/効率化用途/Mixtralの専門家構成)は、ルーティングアルゴリズムの具体的な仕組み(top-1の簡略化)や、兆パラメータ規模への到達実績には触れておらず、意味的な重複はない。具体的には「"We ... simplify[] the MoE routing algorithm" ... "advance the current scale of language models by pre-training up to trillion parameter models on the 'Colossal Clean Crawled Corpus'" ... "up to 7x increases in pre-training speed with the same computational resources" ... "a 4x speedup over the T5-XXL model".」といった記載がある。ただし、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 この数値はSwitch Transformersという特定の研究実装における実験結果であり、MoEアーキテクチャ全般に一律で当てはまる保証ではない。既存Referenceが扱うMixtral(Mistral AI)とは別の実装・別の企業による研究である。2026年08月25日に同Sourceを取得し、この内容を確認した。検証待ちMixture of Experts主要製品・提供機能に関する公開情報
William Fedus, Barret Zoph, Noam Shazeer (Google; arXiv preprint, accepted to JMLR)公式の学術論文(https://arxiv.org/abs/2101.03961)は、Mixture of Expertsの主要製品・提供機能に関する公的記録である。既存4件(定義/密なモデルとの違い/効率化用途/Mixtralの専門家構成)は、ルーティングアルゴリズムの具体的な仕組み(top-1の簡略化)や、兆パラメータ規模への到達実績には触れておらず、意味的な重複はない。具体的には「"We ... simplify[] the MoE routing algorithm" ... "advance the current scale of language models by pre-training up to trillion parameter models on the 'Colossal Clean Crawled Corpus'" ... "up to 7x increases in pre-training speed with the same computational resources" ... "a 4x speedup over the T5-XXL model".」といった記載がある。ただし、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 この数値はSwitch Transformersという特定の研究実装における実験結果であり、MoEアーキテクチャ全般に一律で当てはまる保証ではない。既存Referenceが扱うMixtral(Mistral AI)とは別の実装・別の企業による研究である。2026年08月25日に同Sourceを取得し、この内容を確認した。検証待ちMixture of Experts主要製品・提供機能に関する公開情報