知識蒸留(Knowledge Distillation)

Concept

AI基礎概念

最終更新: 2026-07-10

6 References

https://www.refbase.ai/entity/knowledge-distillation

Knowledge Dossier

公開済みEvidenceをIdentity / Capability / Credibility / Use Case / Constraints・Current Statusの軸で機械的に集約したものです(新規の主張・推測は含みません)。

Identity

Capability

Credibility

公開Evidence未整備

Use Case

  • Hugging Faceチーム(Sanh, Debut, Chaumond, Wolf)が2019年のNeurIPSワークショップで発表したDistilBERT論文は、事前学習段階から言語モデリング損失・蒸留損失・コサイン距離損失を組み合わせる手法により、BERTと比べサイズを40%削減しつつ言語理解能力の97%を維持し推論を60%高速化したと報告している。検証待ち DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter
  • DeepSeek技術報告書(arXiv)によれば、32Bモデルへの大規模強化学習直接適用と、より強力なモデル(DeepSeek-R1)からの知識蒸留を比較した結果、蒸留の方が優れた性能を示した。蒸留モデルDeepSeek-R1-Distill-Qwen-7BはAIME 2024で55.5%を記録し既存オープンソースモデルQwQ-32B-Previewを上回った。検証待ち DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Constraints / Current Status

  • 知識蒸留は、単に小さいモデルを一から学習させる方法と異なり、大きなモデルの出力を教師として使うことで、小さくても性能を保ちやすい点を特徴とする。検証待ち Distilling the Knowledge in a Neural Network(arXiv:1503.02531)
  • Yang, Qiu, Song, Tao, Wangらが2020年CVPRで発表した論文は、グラフ畳み込みネットワーク(GCN)向けの専用知識蒸留手法として、教師・生徒モデル間の局所構造情報分布を比較しトポロジー知識を伝達する「局所構造保存モジュール」を提案し、従来のCNN向け手法とは異なるグラフ構造特有の課題に対応したと報告している。検証待ち Distilling Knowledge from Graph Convolutional Networks

Key References

Knowledge Graph

References — 問い別の知識

データアクセス

各APIエンドポイントはJSON形式でデータを返します。生成AIのツール呼び出し・RAG連携での利用を想定しています。