新一代 LLM 推理框架,RadixAttention 前缀复用与结构化生成大幅提升吞吐与效率。
Project story
SGLang 是主打性能的 LLM 推理与服务框架:RadixAttention 自动复用 KV Cache 前缀,配合结构化输出(JSON Schema)生成,在长对话与批量请求场景吞吐显著优于传统方案。
提供 OpenAI 兼容 API、前端语言(SGLang 程序)简化复杂提示流程,支持主流开源模型与量化。
适合场景:高并发的模型服务、工具调用与结构化输出为主的 Agent 后端、性能敏感的生产部署。
上手方式:pip install sglang 后启动服务器并传入模型路径即可。