Sparse Modelの代表的な実装形態であるMixture of Experts(MoE)の起源は、2017年にGoogle Brainの研究者らが発表したarXiv論文「Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer」(Noam Shazeer・Azalia Mirhoseini・Krzysztof Maziarz・Andy Davis・Quoc Le・Geoffrey Hinton・Jeff Dean著、arXiv:1701.06538)に遡ります。同論文は、入力ごとに数千の専門家(サブネットワーク)の中から一部のみをゲーティングネットワークで選択的に活性化させる「Sparsely-Gated Mixture-of-Experts」層を提案し、最新のGPUクラスタ上で計算効率の損失を最小限に抑えながらモデル容量を1000倍以上向上させることに成功したと報告しています。同技術は言語モデリングと機械翻訳に適用され、最大1370億パラメータのモデルで最先端の性能を達成したとされ、後のSwitch Transformer等の大規模MoEモデルの基礎となりました。