Mistral AI公式サイトの発表(mistral.ai/news/mixtral-of-experts/)によると、2023年12月に公開されたMixtral 8x7Bは、Sparse Modelの設計思想を採用した代表的な実装例の一つです。同モデルは各層で8つの専門家グループを持ち、ルーターネットワークがトークンごとに2つの専門家を選択して処理する構成で、総パラメータ数46.7Bのうち実際に活性化されるのはトークンあたり12.9Bのみとされています。この設計により、パラメータ数を増やしながらも「12.9Bモデルと同じ速度・同じコストで」推論を実行できるとMistral AIは説明しています。公式発表によれば、Mixtral 8x7BはLlama 2 70Bをほとんどのベンチマークで上回りながら推論速度は6倍速く、GPT-3.5とほぼ同等以上の性能を多くの標準ベンチマークで達成したとされています。