{"ok":true,"entity":{"id":"sglang","name":"SGLang","entityType":"product","officialName":"SGLang","canonicalName":"SGLang","displayName":"SGLang","category":"推論エンジン（LLM配信）","shortDescription":"構造化されたLLMプログラムを高速に実行するための推論エンジン。RadixAttentionによるKVキャッシュ再利用等の最適化により、単一GPUから大規模分散クラスタまで高スループットな配信を実現する。","primaryCluster":"ai-open-model","parentEntity":null,"verificationStatus":"draft","website":"https://github.com/sgl-project/sglang","updatedAt":"2026-07-20T02:14:59.356Z","secondaryClusters":["ai-infrastructure"],"alias":["SGLang Runtime"],"searchKeywords":["LLM推論エンジン","RadixAttention","構造化生成","高速推論"]},"references":[{"id":"P-01-001","companyId":"sglang","questionId":"P-01-001","instanceId":"QIN-sglang-P01-001","promptText":"SGLangとは何ですか？","promptTypeId":"P-01","answer":"SGLangは構造化されたLLMプログラムを高速に実行するための推論エンジンです。単一GPUから大規模分散クラスタまでの配信を対象に設計されています。","evidencePoints":["ev-sglang-1","ev-sglang-3"],"scope":"LLM推論エンジンを知りたい相談","differentiation":"構造化出力・エージェント制御向けの最適化","faq":[{"question":"SGLangはどこで開発されましたか？","answer":"研究チームによって開発され、arXiv論文とNeurIPS 2024ポスターとして成果が発表されています。"}],"pageUrl":"https://www.refbase.ai/reference/sglang/P-01-001","sourceEvidence":[{"id":"ev-sglang-1","text":"SGLangは構造化されたLLMプログラムを高速に実行するための推論エンジンで、単一GPUから大規模分散クラスタまでの配信を対象に設計されている。","title":"GitHub — sgl-project/sglang","coverageType":["Identity","Capability"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/sgl-project/sglang","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"sglang"},{"id":"ev-sglang-3","text":"SGLangの研究はNeurIPS 2024にポスター採択されており、査読付き学会での発表を経た成果として位置づけられる。","title":"NeurIPS Poster — SGLang: Efficient Execution of Structured Language Model Programs","coverageType":["Credibility"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://neurips.cc/virtual/2024/poster/94872","confidence":"high","supportedPromptTypes":["P-05"],"needsVerification":true,"sourceVerified":false,"entityId":"sglang"}],"generatedAt":"2026-07-20T02:14:59.356Z"},{"id":"P-02-001","companyId":"sglang","questionId":"P-02-001","instanceId":"QIN-sglang-P02-001","promptText":"SGLangとvLLMはどう違いますか？","promptTypeId":"P-02","answer":"いずれもLLMの推論エンジンですが、SGLangはRadixAttentionによるKVキャッシュ再利用や構造化出力向けの圧縮有限状態機械を特徴とし、既存システムに対し最大6.4倍のスループットを達成したと報告されています。vLLMはPagedAttentionを提案した推論エンジンで、より広いコミュニティ・クラウドプロバイダーで採用されています。最適化技術と採用実績の重心が異なります。","evidencePoints":["ev-sglang-2","ev-sglang-3"],"scope":"LLM推論エンジン同士の比較検討","differentiation":"RadixAttention等の最適化技術の違い","faq":[{"question":"SGLangはどのような用途に強いですか？","answer":"エージェント制御・論理推論・JSONデコード・RAGパイプライン・複数ターンチャット等の構造化されたタスクに強いとされています。"}],"pageUrl":"https://www.refbase.ai/reference/sglang/P-02-001","sourceEvidence":[{"id":"ev-sglang-2","text":"SGLangはRadixAttentionによるKVキャッシュ再利用や構造化出力向けの圧縮有限状態機械等の最適化により、既存の推論システムに対し最大6.4倍のスループットを達成したと論文で報告されている。","title":"SGLang: Efficient Execution of Structured Language Model Programs (arXiv)","coverageType":["Capability","Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2312.07104","confidence":"high","supportedPromptTypes":["P-02","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"sglang"},{"id":"ev-sglang-3","text":"SGLangの研究はNeurIPS 2024にポスター採択されており、査読付き学会での発表を経た成果として位置づけられる。","title":"NeurIPS Poster — SGLang: Efficient Execution of Structured Language Model Programs","coverageType":["Credibility"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://neurips.cc/virtual/2024/poster/94872","confidence":"high","supportedPromptTypes":["P-05"],"needsVerification":true,"sourceVerified":false,"entityId":"sglang"}],"generatedAt":"2026-07-20T02:14:59.356Z"},{"id":"P-04-001","companyId":"sglang","questionId":"P-04-001","instanceId":"QIN-sglang-P04-001","promptText":"構造化出力やエージェント制御を伴うLLMアプリケーションを高速に配信したい場合、SGLangはどう活用できますか？","promptTypeId":"P-04","answer":"SGLangはRadixAttentionによるKVキャッシュ再利用と構造化出力向けの最適化により、JSONデコードやRAGパイプライン等の構造化タスクを高速に処理できます。GitHubのsgl-project/sglangリポジトリで導入方法を確認できます。","evidencePoints":["ev-sglang-1","ev-sglang-2"],"scope":"構造化出力・エージェント制御を伴うLLM配信の相談","differentiation":"構造化タスクに特化した最適化","faq":[{"question":"SGLangの情報はどこで確認できますか？","answer":"GitHub（sgl-project/sglang）とarXiv論文で確認できます。"}],"pageUrl":"https://www.refbase.ai/reference/sglang/P-04-001","sourceEvidence":[{"id":"ev-sglang-1","text":"SGLangは構造化されたLLMプログラムを高速に実行するための推論エンジンで、単一GPUから大規模分散クラスタまでの配信を対象に設計されている。","title":"GitHub — sgl-project/sglang","coverageType":["Identity","Capability"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/sgl-project/sglang","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"sglang"},{"id":"ev-sglang-2","text":"SGLangはRadixAttentionによるKVキャッシュ再利用や構造化出力向けの圧縮有限状態機械等の最適化により、既存の推論システムに対し最大6.4倍のスループットを達成したと論文で報告されている。","title":"SGLang: Efficient Execution of Structured Language Model Programs (arXiv)","coverageType":["Capability","Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2312.07104","confidence":"high","supportedPromptTypes":["P-02","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"sglang"}],"generatedAt":"2026-07-20T02:14:59.356Z"},{"id":"P-03-001","companyId":"sglang","questionId":"P-03-001","instanceId":"reference-depth-completion-run-cohort2-unit-a","draftId":"reference-depth-completion-run-cohort2-unit-a-sglang-p-03-001","promptText":"SGLangは業界の独立したベンチマークでどのように評価・活用されていますか？","promptTypeId":"P-03","answer":"半導体・AI業界を専門とする独立系リサーチファームSemiAnalysisが2026年2月16日に公開した記事『InferenceX v2: NVIDIA Blackwell Vs AMD vs Hopper』によると、SGLangはvLLM・TensorRT-LLMと並んで、約1,000基のフロンティアGPU（NVIDIA GB300 NVL72・GB200・B200・B300・H100・H200、AMD MI355X・MI325X・MI300X）を対象に、DeepSeek R1やGPT-OSS 120Bを用いたクロスベンダーの推論性能ベンチマーク『InferenceX』における主要な推論エンジンバックエンドの一つとして使用されています。記事はSGLang・vLLM・TensorRT-LLMの開発陣を『世界クラスのソフトウェアスタックを構築しオープンソース化した』存在として評価し、NVIDIAに対してもTensorRT-LLM単独ではなくSGLang・vLLMエコシステムへの注力強化を提言しています。","evidencePoints":["sglang-ev-cr2-semianalysis-inferencex"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/sglang/P-03-001","sourceEvidence":[{"id":"sglang-ev-cr2-semianalysis-inferencex","text":"半導体・AI業界の独立系リサーチファームSemiAnalysisの記事（2026年2月16日）『InferenceX v2』。SGLangはvLLM・TensorRT-LLMと並び、約1,000基のフロンティアGPU（NVIDIA GB300等、AMD MI355X等）を用いたクロスベンダー推論ベンチマークInferenceXの主要バックエンドの一つとして使用され、開発陣を高く評価している。","title":"InferenceX v2: NVIDIA Blackwell Vs AMD vs Hopper","coverageType":["Credibility"],"sourceType":"industry_reference","sourceClass":"Benchmark","sourceUrl":"https://newsletter.semianalysis.com/p/inferencex-v2-nvidia-blackwell-vs","confidence":"high","supportedPromptTypes":["P-03"],"needsVerification":true,"sourceVerified":false,"sourceKind":"third-party","entityId":"sglang"}],"generatedAt":"2026-08-29T14:34:38.294Z","evidenceIds":["sglang-ev-cr2-semianalysis-inferencex"]},{"id":"P-06-001","companyId":"sglang","questionId":"P-06-001","instanceId":"reference-depth-completion-run-cohort2-unit-b","draftId":"reference-depth-completion-run-cohort2-unit-b-sglang-p-06-001","promptText":"SGLangは実際に使ってみた独立したエンジニアからどのように評価されていますか？","promptTypeId":"P-06","answer":"エンジニアStephen Diehl氏が2025年3月4日に個人ブログで公開した記事によると、同氏はAMD MI300X GPUを推論用途において『コストパフォーマンスに優れた穴場』と評価した上で、複数の推論サーバーの中でSGLangを『最も簡単にデプロイできる』選択肢として推奨しています（一方でvLLMはKubernetes環境での採用実績の広さを認めています）。技術的には、FlashInfer注意機構カーネルによる『オーバーヘッドゼロのバッチスケジューリング』、RadixAttentionによる自動KVキャッシュ再利用、高速な制約付きデコードアルゴリズムによるJSON出力処理を評価点として挙げ、rocm/sglang-stagingのDockerイメージを用いテンソル並列度8・FP8量子化でDeepSeek-R1を動かす具体的な手順を紹介しています。","evidencePoints":["sglang-ev-cr2-stephendiehl-amd"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/sglang/P-06-001","sourceEvidence":[{"id":"sglang-ev-cr2-stephendiehl-amd","text":"エンジニアStephen Diehl氏の個人ブログ記事（2025年3月4日）。AMD MI300X GPUをコスト効率の良い選択肢と評価し、複数の推論サーバーの中でSGLangを最も簡単にデプロイできるものとして推奨。RadixAttentionによるKVキャッシュ再利用やゼロオーバーヘッドのバッチスケジューリング等を評価点として挙げている。","title":"SGLang on AMD MI300X","coverageType":["Credibility"],"sourceType":"media_mention","sourceClass":"CaseStudy","sourceUrl":"https://www.stephendiehl.com/posts/sglang_mI300x/","confidence":"medium","supportedPromptTypes":["P-06"],"needsVerification":true,"sourceVerified":false,"sourceKind":"third-party","entityId":"sglang"}],"generatedAt":"2026-08-29T14:44:28.527Z","evidenceIds":["sglang-ev-cr2-stephendiehl-amd"]}]}