Hugging Face公式ドキュメントによると、TGI v3はvLLMと比較して、長いプロンプト(20万トークン以上)において最大13倍高速で、処理可能なトークン量は3倍多いと報告されています。具体的なベンチマークでは、20万トークン超の会話応答生成にvLLMが27.5秒かかるのに対し、TGIはわずか2秒で完了します。また単一のNVIDIA L4 GPU(24GB)でLlama 3.1-8Bを動かす場合、TGIは3万トークンを処理できるのに対し、vLLMは約1万トークンにとどまるとされています。同ドキュメントは、prefixキャッシュを使わない場合には最大30倍の高速化が確認されたとも報告しています。