bitsandbytes

Product

量子化ライブラリ

最終更新: 2026-07-20

6 References

https://www.refbase.ai/entity/bitsandbytes

Knowledge Dossier

公開済みEvidenceをIdentity / Capability / Credibility / Use Case / Constraints・Current Statusの軸で機械的に集約したものです(新規の主張・推測は含みません)。

Identity

Capability

  • bitsandbytesはPyTorch向けのk-bit量子化ライブラリで、LLM.int8()やQLoRA(4-bit量子化)等の手法を実装している。検証待ち GitHub — bitsandbytes-foundation/bitsandbytes
  • bitsandbytesのLLM.int8()は外れ値特徴を16-bitで処理しつつ残りを8-bitに量子化するベクトル単位の量子化手法で、性能劣化なしにメモリ使用量を約半分にすると報告されている。検証待ち Hugging Face Docs — Bitsandbytes
  • bitsandbytesはHugging Face Transformersと標準的に統合されており、公式ドキュメントの量子化ガイドで4-bit/8-bit量子化の標準手段として説明されている。検証待ち Bitsandbytes · Hugging Face
  • AMD公式ROCm Blogs(2024年11月13日付)によれば、bitsandbytesはROCm 6.2以降でAMD Instinct MI210/MI250/MI250X/MI300A/MI300X GPUに正式対応した。T5-11Bの8-bit Adam学習でGPUメモリ使用率が約60.5%から約36%へ低下(約41%削減)し、OPT-66Bの推論では64GB中63.48GBの使用でフル精度時のOOMを回避できたと報告されている。検証待ち AMD GPU(ROCm)でのbitsandbytesサポートと性能検証
  • Hugging Face公式ブログによれば、bitsandbytesの4-bit量子化とQLoRAを組み合わせることで65Bパラメータモデルを単一の48GB GPUでファインチューニングでき、33Bモデルは24GB GPU、65Bモデルは46GB GPUで実行可能とされている。検証待ち Making LLMs even more accessible with bitsandbytes, 4-bit quantization and QLoRA

Credibility

  • bitsandbytesはHugging Face Transformersと標準的に統合されており、公式ドキュメントの量子化ガイドで4-bit/8-bit量子化の標準手段として説明されている。検証待ち Bitsandbytes · Hugging Face

Use Case

公開Evidence未整備

Constraints / Current Status

  • bitsandbytesのLLM.int8()は外れ値特徴を16-bitで処理しつつ残りを8-bitに量子化するベクトル単位の量子化手法で、性能劣化なしにメモリ使用量を約半分にすると報告されている。検証待ち Hugging Face Docs — Bitsandbytes
  • bitsandbytesが実装するLLM.int8()手法の原著論文(arXiv:2208.07339、Tim Dettmers氏ら、NeurIPS 2022)によれば、この手法はベクトル単位量子化と、外れ値次元のみ16-bitで扱う混合精度分解を組み合わせ、値の99.9%以上を8-bitで乗算しながら175Bパラメータ規模のモデルを性能劣化なしに推論可能にする。検証待ち LLM.int8()の量子化手法(原著論文)

Key References

Knowledge Graph

References — 問い別の知識

データアクセス

各APIエンドポイントはJSON形式でデータを返します。生成AIのツール呼び出し・RAG連携での利用を想定しています。