TensorRT-LLMはNVIDIAの最新GPUアーキテクチャに最適化されたコンパイル済みエンジン方式で最高スループットを追求するのに対し、vLLMは幅広いハードウェア対応と導入の容易さを重視するアプローチを取ります。
LLM推論エンジンを比較したい相談
コンパイル済みエンジンによるNVIDIA GPU特化の最高スループット