NVIDIA公式のTensorRT製品ページによると、TensorRTはCPUのみのプラットフォームと比較して推論を最大36倍高速化できるとされています。加えて、具体的なモデル別のベンチマークとして、GPT-J 6Bの推論では8倍、Llama2 70Bの推論では4倍の性能向上が公式に示されています。このように、TensorRTはGPU上でのモデル最適化を通じて、本番環境における推論速度とコスト効率を大きく改善することを訴求しています。