TheBlokeが提供するGPTQモデルはGPU推論向けに最適化された量子化パラメータの選択肢を持つ形式です。GGUFモデルは2〜8-bitの量子化オプションを持ち、CPU+GPUの両方での推論に対応するため、GPU非搭載環境でも実行できる点が異なります。
量子化モデルの配布形式の比較検討
GPU専用(GPTQ)とCPU+GPU対応(GGUF)の違い