SGLangは構造化されたLLMプログラムを高速に実行するための推論エンジンです。単一GPUから大規模分散クラスタまでの配信を対象に設計されています。
LLM推論エンジンを知りたい相談
構造化出力・エージェント制御向けの最適化