bitsandbytesはPyTorchモデルに対しLLM.int8()やQLoRA等の手法でその場(ランタイム)で量子化を適用するライブラリです。GGUFは量子化済みモデルをあらかじめファイルとして保存・配布する形式で、llama.cppエコシステムでの利用を主目的としています。量子化のタイミングと対象エコシステムが異なります。
量子化手法・形式の比較検討
ランタイム量子化 vs 事前量子化ファイル形式