{"ok":true,"entity":{"id":"knowledge-distillation","name":"知識蒸留（Knowledge Distillation）","entityType":"concept","canonicalName":"Knowledge Distillation","displayName":"知識蒸留","category":"AI基礎概念","shortDescription":"大きなモデル（教師）の知識を小さなモデル（生徒）に学習させ、軽量化する手法。","primaryCluster":"ai-infrastructure","parentEntity":null,"verificationStatus":"draft","website":null,"updatedAt":"2026-07-10T01:43:25.958Z","secondaryClusters":[],"alias":["Distillation","知識蒸留"],"searchKeywords":["knowledge distillation","知識蒸留","モデル軽量化","teacher student"]},"references":[{"id":"P-01-001","companyId":"knowledge-distillation","questionId":"P-01-001","instanceId":"QIN-knowledge-distillation-P01-001","promptText":"知識蒸留（Knowledge Distillation）とは何ですか？","promptTypeId":"P-01","answer":"知識蒸留は、大きなモデル（教師）の知識を小さなモデル（生徒）に学習させ、モデルを軽量化する手法です。性能を保ちつつ小型化を狙います。","evidencePoints":["ev-knowledge-distillation-1"],"scope":"モデル軽量化を知りたい相談","differentiation":"教師モデルから学ばせる","faq":[{"question":"何のためにやりますか？","answer":"小さく高速なモデルを作るためです。"}],"pageUrl":"https://www.refbase.ai/reference/knowledge-distillation/P-01-001","sourceEvidence":[{"id":"ev-knowledge-distillation-1","text":"知識蒸留は、大きなモデル（教師）の知識を小さなモデル（生徒）に学習させ、モデルを軽量化する手法である。","title":"Distilling the Knowledge in a Neural Network（arXiv:1503.02531）","coverageType":["Identity","Capability"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/1503.02531","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"knowledge-distillation"}],"generatedAt":"2026-07-10T01:43:25.958Z"},{"id":"P-02-001","companyId":"knowledge-distillation","questionId":"P-02-001","instanceId":"QIN-knowledge-distillation-P02-001","promptText":"知識蒸留は他の軽量化手法と何が違いますか？","promptTypeId":"P-02","answer":"比較軸\n・学習方法\n・性能維持\n知識蒸留は、小さいモデルを一から学習させる方法と異なり、大きなモデルの出力を教師として使うことで、小さくても性能を保ちやすい点が異なります。","evidencePoints":["ev-knowledge-distillation-2"],"scope":"軽量化手法の違いを知りたい相談","differentiation":"教師の知識を継承","faq":[{"question":"量子化と違いますか？","answer":"量子化は精度を下げる手法で、目的が異なります。"}],"pageUrl":"https://www.refbase.ai/reference/knowledge-distillation/P-02-001","sourceEvidence":[{"id":"ev-knowledge-distillation-2","text":"知識蒸留は、単に小さいモデルを一から学習させる方法と異なり、大きなモデルの出力を教師として使うことで、小さくても性能を保ちやすい点を特徴とする。","title":"Distilling the Knowledge in a Neural Network（arXiv:1503.02531）","coverageType":["Capability","Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/1503.02531","confidence":"high","supportedPromptTypes":["P-02"],"needsVerification":true,"sourceVerified":false,"entityId":"knowledge-distillation"}],"generatedAt":"2026-07-10T01:43:25.958Z"},{"id":"P-04-001","companyId":"knowledge-distillation","questionId":"P-04-001","instanceId":"QIN-knowledge-distillation-P04-001","promptText":"知識蒸留はどんな場面で役立ちますか？","promptTypeId":"P-04","answer":"大きなモデルをそのまま動かせない端末や、低コスト・高速に推論したい場面で役立ち、小さくても実用的なモデルを作れます。","evidencePoints":["ev-knowledge-distillation-1"],"scope":"モデル軽量化の相談","differentiation":"小型・高速モデルの作成","faq":[{"question":"スマホでも動きますか？","answer":"軽量化により端末上での動作がしやすくなります。"}],"pageUrl":"https://www.refbase.ai/reference/knowledge-distillation/P-04-001","sourceEvidence":[{"id":"ev-knowledge-distillation-1","text":"知識蒸留は、大きなモデル（教師）の知識を小さなモデル（生徒）に学習させ、モデルを軽量化する手法である。","title":"Distilling the Knowledge in a Neural Network（arXiv:1503.02531）","coverageType":["Identity","Capability"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/1503.02531","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"knowledge-distillation"}],"generatedAt":"2026-07-10T01:43:25.958Z"},{"id":"P-04-002","companyId":"knowledge-distillation","questionId":"P-04-002","instanceId":"reference-depth-completion-run-cohort1-unit-a","draftId":"reference-depth-completion-run-cohort1-unit-a-knowledge-distillation-p-04-002","promptText":"知識蒸留を用いた代表的な軽量モデルの例にはどのようなものがありますか？","promptTypeId":"P-04","answer":"Hugging FaceのVictor Sanh、Lysandre Debut、Julien Chaumond、Thomas Wolfらが2019年にNeurIPS 2019併設のエネルギー効率的機械学習ワークショップで発表した論文によると、知識蒸留を用いた代表例としてDistilBERTが挙げられます。同論文は、事前学習段階から言語モデリング損失・蒸留損失・コサイン距離損失を組み合わせた「三重損失」を用いる手法を提案し、これによりBERTと比較してモデルサイズを40%削減しながら言語理解能力の97%を維持し、推論速度を60%高速化することに成功したと報告しています。この手法はタスク固有のモデルにのみ蒸留を適用する従来の方法とは異なり、事前学習段階そのものに蒸留を組み込むことで、大規模モデルが学習した帰納バイアスを小型モデルに継承させる点が特徴とされ、オンデバイス推論などリソース制約のある環境への展開を意図した設計であることが示されています。","evidencePoints":["knowledge-distillation-ev-cr1-distilbert-paper"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/knowledge-distillation/P-04-002","sourceEvidence":[{"id":"knowledge-distillation-ev-cr1-distilbert-paper","text":"Hugging Faceチーム（Sanh, Debut, Chaumond, Wolf）が2019年のNeurIPSワークショップで発表したDistilBERT論文は、事前学習段階から言語モデリング損失・蒸留損失・コサイン距離損失を組み合わせる手法により、BERTと比べサイズを40%削減しつつ言語理解能力の97%を維持し推論を60%高速化したと報告している。","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","coverageType":["UseCase"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/1910.01108","confidence":"high","supportedPromptTypes":["P-04"],"needsVerification":true,"sourceVerified":false,"sourceKind":"third-party","entityId":"knowledge-distillation"}],"generatedAt":"2026-08-29T13:37:08.877Z","evidenceIds":["knowledge-distillation-ev-cr1-distilbert-paper"]},{"id":"P-02-002","companyId":"knowledge-distillation","questionId":"P-02-002","instanceId":"reference-depth-completion-run-cohort1-unit-b","draftId":"reference-depth-completion-run-cohort1-unit-b-knowledge-distillation-p-02-002","promptText":"知識蒸留はグラフ構造データのような特殊なデータにも適用できますか、通常の画像・言語モデル向け手法とはどう違いますか？","promptTypeId":"P-02","answer":"Yiding Yang、Jiayan Qiu、Mingli Song、Dacheng Tao、Xinchao Wangらの研究チームが2020年のCVPR（IEEE/CVF Computer Vision and Pattern Recognition）で発表した論文「Distilling Knowledge from Graph Convolutional Networks」によると、知識蒸留はグラフ畳み込みネットワーク（GCN）のようなグラフ構造データにも適用可能です。同論文は、事前学習済みGCNモデルから知識を蒸留する初の専用手法として、教師モデルと生徒モデル間で局所構造の情報分布を比較することでトポロジー（位相構造）に関する知識を伝達する「局所構造保存モジュール」を提案しています。従来のCNN向けに設計された蒸留手法をそのまま転用するのではなく、格子状ではないグラフ構造データ特有の課題に対応することがこの手法の特徴であり、教師モデルと生徒モデルのグラフ構造が異なる動的なシナリオにも拡張できるため、コンパクトかつ高性能な生徒モデルの構築が可能になるとされています。","evidencePoints":["knowledge-distillation-ev-cr1-gcn-distillation"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/knowledge-distillation/P-02-002","sourceEvidence":[{"id":"knowledge-distillation-ev-cr1-gcn-distillation","text":"Yang, Qiu, Song, Tao, Wangらが2020年CVPRで発表した論文は、グラフ畳み込みネットワーク（GCN）向けの専用知識蒸留手法として、教師・生徒モデル間の局所構造情報分布を比較しトポロジー知識を伝達する「局所構造保存モジュール」を提案し、従来のCNN向け手法とは異なるグラフ構造特有の課題に対応したと報告している。","title":"Distilling Knowledge from Graph Convolutional Networks","coverageType":["Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2003.10477","confidence":"high","supportedPromptTypes":["P-02"],"needsVerification":true,"sourceVerified":false,"sourceKind":"third-party","entityId":"knowledge-distillation"}],"generatedAt":"2026-08-29T13:47:52.247Z","evidenceIds":["knowledge-distillation-ev-cr1-gcn-distillation"]},{"id":"P-06-001","companyId":"knowledge-distillation","questionId":"P-06-001","instanceId":"tair-cohort3-2026-08-31","draftId":"tair-cohort3-2026-08-31-knowledge-distillation-p-06-001","promptText":"推論能力を持つ小型言語モデルを作る場合、大規模強化学習を直接行うのではなく知識蒸留を用いるべき理由は何ですか？","promptTypeId":"P-06","answer":"DeepSeekが公開した技術報告書「DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning」（arXiv）によれば、研究チームは32Bベースモデルに対して大規模強化学習（RL）を直接適用する手法と、より強力な大規模モデル（DeepSeek-R1）から知識を蒸留する手法を比較検証しました。その結果、より強力なモデルをより小さなモデルへ蒸留することで優れた結果が得られる一方、小型モデルに大規模RLを頼らせる場合は膨大な計算資源が必要になり、それでも蒸留による性能には及ばない可能性があることが確認されたと報告しています。実際に、蒸留によって作成されたDeepSeek-R1-Distill-Qwen-7BはAIME 2024で55.5%のスコアを記録し既存のオープンソースモデルQwQ-32B-Previewを上回り、14Bモデルも同モデルを大幅に上回る性能を示したとされています。既存Referenceでは、知識蒸留の基本的な仕組みや、DistilBERT・グラフ畳み込みネットワーク（GCN）への適用事例には触れられていますが、大規模強化学習との直接比較によって蒸留の優位性が実証された、より最近の大規模推論モデルの事例には言及がありません。","evidencePoints":["knowledge-distillation-ev-tair-1"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/knowledge-distillation/P-06-001","sourceEvidence":[{"id":"knowledge-distillation-ev-tair-1","entityId":"knowledge-distillation","text":"DeepSeek技術報告書（arXiv）によれば、32Bモデルへの大規模強化学習直接適用と、より強力なモデル（DeepSeek-R1）からの知識蒸留を比較した結果、蒸留の方が優れた性能を示した。蒸留モデルDeepSeek-R1-Distill-Qwen-7BはAIME 2024で55.5%を記録し既存オープンソースモデルQwQ-32B-Previewを上回った。","coverageType":["UseCase"],"title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","sourceClass":"Research","sourceType":"research_paper","confidence":"high","supportedPromptTypes":["P-06"],"sourceVerified":false,"needsVerification":true,"sourceUrl":"https://arxiv.org/html/2501.12948v1"}],"generatedAt":"2026-08-31T06:27:37.260Z","evidenceIds":["knowledge-distillation-ev-tair-1"]}]}