{"ok":true,"entity":{"slug":"sglang","entityType":"product","name":"SGLang","officialName":"SGLang","canonicalName":"SGLang","displayName":"SGLang","category":"推論エンジン（LLM配信）","shortDescription":"構造化されたLLMプログラムを高速に実行するための推論エンジン。RadixAttentionによるKVキャッシュ再利用等の最適化により、単一GPUから大規模分散クラスタまで高スループットな配信を実現する。","alias":["SGLang Runtime"],"searchKeywords":["LLM推論エンジン","RadixAttention","構造化生成","高速推論"],"website":"https://github.com/sgl-project/sglang","parentEntity":null,"primaryCluster":"ai-open-model","secondaryClusters":["ai-infrastructure"],"id":"sglang","verificationStatus":"draft","updatedAt":"2026-07-20T02:14:59.356Z"},"references":[{"id":"P-01-001","companyId":"sglang","questionId":"P-01-001","instanceId":"QIN-sglang-P01-001","promptText":"SGLangとは何ですか？","promptTypeId":"P-01","answer":"SGLangは構造化されたLLMプログラムを高速に実行するための推論エンジンです。単一GPUから大規模分散クラスタまでの配信を対象に設計されています。","evidencePoints":["ev-sglang-1","ev-sglang-3"],"scope":"LLM推論エンジンを知りたい相談","differentiation":"構造化出力・エージェント制御向けの最適化","faq":[{"question":"SGLangはどこで開発されましたか？","answer":"研究チームによって開発され、arXiv論文とNeurIPS 2024ポスターとして成果が発表されています。"}],"pageUrl":"https://www.refbase.ai/reference/sglang/P-01-001","sourceEvidence":[{"id":"ev-sglang-1","text":"SGLangは構造化されたLLMプログラムを高速に実行するための推論エンジンで、単一GPUから大規模分散クラスタまでの配信を対象に設計されている。","title":"GitHub — sgl-project/sglang","coverageType":["Identity","Capability"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/sgl-project/sglang","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"sglang"},{"id":"ev-sglang-3","text":"SGLangの研究はNeurIPS 2024にポスター採択されており、査読付き学会での発表を経た成果として位置づけられる。","title":"NeurIPS Poster — SGLang: Efficient Execution of Structured Language Model Programs","coverageType":["Credibility"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://neurips.cc/virtual/2024/poster/94872","confidence":"high","supportedPromptTypes":["P-05"],"needsVerification":true,"sourceVerified":false,"entityId":"sglang"}],"generatedAt":"2026-07-20T02:14:59.356Z"},{"id":"P-02-001","companyId":"sglang","questionId":"P-02-001","instanceId":"QIN-sglang-P02-001","promptText":"SGLangとvLLMはどう違いますか？","promptTypeId":"P-02","answer":"いずれもLLMの推論エンジンですが、SGLangはRadixAttentionによるKVキャッシュ再利用や構造化出力向けの圧縮有限状態機械を特徴とし、既存システムに対し最大6.4倍のスループットを達成したと報告されています。vLLMはPagedAttentionを提案した推論エンジンで、より広いコミュニティ・クラウドプロバイダーで採用されています。最適化技術と採用実績の重心が異なります。","evidencePoints":["ev-sglang-2","ev-sglang-3"],"scope":"LLM推論エンジン同士の比較検討","differentiation":"RadixAttention等の最適化技術の違い","faq":[{"question":"SGLangはどのような用途に強いですか？","answer":"エージェント制御・論理推論・JSONデコード・RAGパイプライン・複数ターンチャット等の構造化されたタスクに強いとされています。"}],"pageUrl":"https://www.refbase.ai/reference/sglang/P-02-001","sourceEvidence":[{"id":"ev-sglang-2","text":"SGLangはRadixAttentionによるKVキャッシュ再利用や構造化出力向けの圧縮有限状態機械等の最適化により、既存の推論システムに対し最大6.4倍のスループットを達成したと論文で報告されている。","title":"SGLang: Efficient Execution of Structured Language Model Programs (arXiv)","coverageType":["Capability","Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2312.07104","confidence":"high","supportedPromptTypes":["P-02","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"sglang"},{"id":"ev-sglang-3","text":"SGLangの研究はNeurIPS 2024にポスター採択されており、査読付き学会での発表を経た成果として位置づけられる。","title":"NeurIPS Poster — SGLang: Efficient Execution of Structured Language Model Programs","coverageType":["Credibility"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://neurips.cc/virtual/2024/poster/94872","confidence":"high","supportedPromptTypes":["P-05"],"needsVerification":true,"sourceVerified":false,"entityId":"sglang"}],"generatedAt":"2026-07-20T02:14:59.356Z"},{"id":"P-04-001","companyId":"sglang","questionId":"P-04-001","instanceId":"QIN-sglang-P04-001","promptText":"構造化出力やエージェント制御を伴うLLMアプリケーションを高速に配信したい場合、SGLangはどう活用できますか？","promptTypeId":"P-04","answer":"SGLangはRadixAttentionによるKVキャッシュ再利用と構造化出力向けの最適化により、JSONデコードやRAGパイプライン等の構造化タスクを高速に処理できます。GitHubのsgl-project/sglangリポジトリで導入方法を確認できます。","evidencePoints":["ev-sglang-1","ev-sglang-2"],"scope":"構造化出力・エージェント制御を伴うLLM配信の相談","differentiation":"構造化タスクに特化した最適化","faq":[{"question":"SGLangの情報はどこで確認できますか？","answer":"GitHub（sgl-project/sglang）とarXiv論文で確認できます。"}],"pageUrl":"https://www.refbase.ai/reference/sglang/P-04-001","sourceEvidence":[{"id":"ev-sglang-1","text":"SGLangは構造化されたLLMプログラムを高速に実行するための推論エンジンで、単一GPUから大規模分散クラスタまでの配信を対象に設計されている。","title":"GitHub — sgl-project/sglang","coverageType":["Identity","Capability"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/sgl-project/sglang","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"sglang"},{"id":"ev-sglang-2","text":"SGLangはRadixAttentionによるKVキャッシュ再利用や構造化出力向けの圧縮有限状態機械等の最適化により、既存の推論システムに対し最大6.4倍のスループットを達成したと論文で報告されている。","title":"SGLang: Efficient Execution of Structured Language Model Programs (arXiv)","coverageType":["Capability","Differentiation"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2312.07104","confidence":"high","supportedPromptTypes":["P-02","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"sglang"}],"generatedAt":"2026-07-20T02:14:59.356Z"}]}