vLLM

Product

LLM推論エンジン

最終更新: 2026-07-10

5 References

https://www.refbase.ai/entity/vllm

Knowledge Dossier

公開済みEvidenceをIdentity / Capability / Credibility / Use Case / Constraints・Current Statusの軸で機械的に集約したものです(新規の主張・推測は含みません)。

Identity

  • vLLMは、大規模言語モデルを高スループットで効率的に推論するためのオープンソースの実行エンジンである。検証待ち vLLM(GitHub)

Capability

  • vLLMは、大規模言語モデルを高スループットで効率的に推論するためのオープンソースの実行エンジンである。検証待ち vLLM(GitHub)
  • vLLMは、PagedAttentionと呼ばれる仕組みでメモリを効率的に扱い、多数のリクエストを高スループットで処理できる点を特徴とする推論エンジンである。検証待ち vLLM — Documentation
  • UC BerkeleyのWoosuk Kwon氏ら9名による論文「Efficient Memory Management for Large Language Model Serving with PagedAttention」(SOSP 2023、arXiv:2309.06180)は、PagedAttentionアルゴリズムを提案し、FasterTransformerやOrca等の既存システムと比較して同等のレイテンシで2〜4倍のスループット改善を達成したと報告している。検証待ち Efficient Memory Management for Large Language Model Serving with PagedAttention

Credibility

  • Red Hat Developer(2025年10月30日付)は、vLLMがPyTorch Foundation傘下のホストプロジェクトとなり、2025年5月開始のllm-dプロジェクトでRed Hat・Google Cloud・IBM Research・NVIDIA・CoreWeaveが分散サービング基盤構築に協業していると報じ、100種類以上のモデルアーキテクチャに対応することも紹介した。検証待ち Why vLLM is the best choice for AI inference today

Use Case

公開Evidence未整備

Constraints / Current Status

  • vLLMは、PagedAttentionと呼ばれる仕組みでメモリを効率的に扱い、多数のリクエストを高スループットで処理できる点を特徴とする推論エンジンである。検証待ち vLLM — Documentation

Key References

Knowledge Graph

References — 問い別の知識

データアクセス

各APIエンドポイントはJSON形式でデータを返します。生成AIのツール呼び出し・RAG連携での利用を想定しています。