Hugging Face公式ブログ「Making LLMs even more accessible with bitsandbytes, 4-bit quantization and QLoRA」によれば、bitsandbytesの4-bit量子化とQLoRA手法を組み合わせることで、65Bパラメータ規模のモデルを単一の48GBのGPUでファインチューニングできることが示されています。また33Bパラメータモデルを24GBのGPUで、65Bパラメータモデルを46GBのGPUでそれぞれ実行できるとされています。同記事に掲載されたベンチマークでは、NVIDIA T4(16GB)上でのLlama 7B・13Bの学習実験において、「4bit + NF4 + bf16計算型」の構成が従来の8-bit手法(LLM.int8())と比べてメモリ効率が向上し、より長いシーケンス長での学習が可能になることが示されています。既存Referenceは概要・GGUFとの違い・活用場面・LLM.int8()の技術詳細・AMD ROCm対応を扱っていますが、QLoRAによる大規模モデルの具体的なファインチューニング達成事例(65Bモデルの単一GPU実行)には一切触れていないため、新しい情報です。正確なGB単位での削減率は同記事には明記されていない点にも留意が必要です。