Hugging FaceのVictor Sanh、Lysandre Debut、Julien Chaumond、Thomas Wolfらが2019年にNeurIPS 2019併設のエネルギー効率的機械学習ワークショップで発表した論文によると、知識蒸留を用いた代表例としてDistilBERTが挙げられます。同論文は、事前学習段階から言語モデリング損失・蒸留損失・コサイン距離損失を組み合わせた「三重損失」を用いる手法を提案し、これによりBERTと比較してモデルサイズを40%削減しながら言語理解能力の97%を維持し、推論速度を60%高速化することに成功したと報告しています。この手法はタスク固有のモデルにのみ蒸留を適用する従来の方法とは異なり、事前学習段階そのものに蒸留を組み込むことで、大規模モデルが学習した帰納バイアスを小型モデルに継承させる点が特徴とされ、オンデバイス推論などリソース制約のある環境への展開を意図した設計であることが示されています。