bitsandbytesのLLM.int8()やQLoRAを使うことで、性能劣化を抑えながらメモリ使用量を大幅に削減できます。Hugging Face Transformersの量子化ガイドで導入方法を確認でき、GitHubのbitsandbytes-foundation/bitsandbytesリポジトリで実装を確認できます。
省メモリでのモデル推論・学習の相談
Transformersとの標準統合による導入の容易さ