Sparse Model

Concept

AI概念(部分的パラメータ活性化)

最終更新: 2026-07-22

5 References

https://www.refbase.ai/entity/sparse-model

Knowledge Dossier

公開済みEvidenceをIdentity / Capability / Credibility / Use Case / Constraints・Current Statusの軸で機械的に集約したものです(新規の主張・推測は含みません)。

Identity

Capability

  • Sparse Modelは、入力ごとにモデル全体のパラメータの一部のみを活性化させることで、総パラメータ数を増やしつつ推論時の計算コストを抑える設計手法であり、Switch Transformer論文はこの手法を大規模に適用した研究例である。検証待ち Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
  • Mistral AI公式サイトによると、2023年12月公開のMixtral 8x7Bは総パラメータ46.7Bのうちトークンあたり12.9Bのみを活性化するSparse Model(MoE)の実装例であり、Llama 2 70Bをほとんどのベンチマークで上回りながら推論速度は6倍速いとされている。検証待ち Mixtral of experts

Credibility

  • 2017年発表のGoogle Brain研究者らによるarXiv論文(arXiv:1701.06538、Noam Shazeer・Geoffrey Hinton・Jeff Deanら著)は、Sparsely-Gated Mixture-of-Experts層を提案し、計算効率の損失を抑えつつモデル容量を1000倍以上向上させ最大1370億パラメータのモデルで最先端性能を達成した、MoEの基礎となる研究である。検証待ち Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer

Use Case

Constraints / Current Status

  • Sparse Modelは入力ごとに一部のパラメータのみを活性化する設計思想である点が特徴で、全パラメータを常に活性化するdense(密)なモデルとは計算資源の使い方が異なる。Mixture of Expertsはこの設計思想を「複数の専門家(expert)ネットワークから一部を選択する」という具体的なアーキテクチャで実現した代表例である。検証待ち Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity

Key References

Knowledge Graph

References — 問い別の知識

データアクセス

各APIエンドポイントはJSON形式でデータを返します。生成AIのツール呼び出し・RAG連携での利用を想定しています。