いずれもLLMの推論エンジンですが、SGLangはRadixAttentionによるKVキャッシュ再利用や構造化出力向けの圧縮有限状態機械を特徴とし、既存システムに対し最大6.4倍のスループットを達成したと報告されています。vLLMはPagedAttentionを提案した推論エンジンで、より広いコミュニティ・クラウドプロバイダーで採用されています。最適化技術と採用実績の重心が異なります。
LLM推論エンジン同士の比較検討
RadixAttention等の最適化技術の違い