比較軸 ・メモリ効率 ・スループット vLLMはPagedAttentionと呼ばれる仕組みでメモリを効率的に扱い、素朴な実装より多くのリクエストを高スループットで処理できる点が異なります。
推論実装の違いを知りたい相談
PagedAttentionによる効率化