bitsandbytesが実装するLLM.int8()手法は、Tim Dettmers氏らによる論文『LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale』(arXiv:2208.07339、2022年8月15日提出、NeurIPS 2022で発表)で提案された手法です。同論文によれば、この手法は各内積ごとに個別の正規化定数を用いるベクトル単位量子化と、外れ値となる特徴次元のみを16-bit精度で計算する混合精度分解(mixed-precision decomposition)を組み合わせた二段階の量子化戦略を採用しており、値の99.9%以上を8-bitで乗算しながら、175Bパラメータ規模のモデルまで性能劣化なしに推論できるとされています。これによりOPT-175BやBLOOMのようなモデルを、コンシューマー向けGPUを積んだ単一サーバー上で扱うことが可能になったと説明されています。ただしこの論文自体は手法の提案者自身による発表であり、他の独立した研究者による性能の再検証結果ではない点には留意が必要です。2026年8月29日時点でarXivの当該論文ページの内容を確認しました。この情報源はTim Dettmers氏ら手法の提案者自身による研究論文(プレプリント・査読付き会議発表)であり、bitsandbytesライブラリの技術的な基盤を示す一次資料です。