AI产品库
SGLang LogoSGLang

面向大模型与多模态模型的高性能服务框架

官方定位为「面向大语言模型与多模态模型的高性能服务框架」:以 RadixAttention 前缀缓存、零开销 CPU 调度器、预填充与解码分离、推测解码为核心,从单张 GPU 到大规模分布式集群提供低延迟、高吞吐推理。

深度介绍

SGLang详细介绍

🧠

RadixAttention:把前缀缓存做成基础设施

SGLang 最早上量的特性是 RadixAttention——用基数树管理 KV 缓存,让多个请求自动共享相同的前缀。官方在 2024 年 1 月的博客里给出的口径是最多 5 倍推理加速。这类优化在多轮对话、批量同模板任务和 RAG 场景里收益最明显,因为相邻请求往往共享很长的系统提示与检索内容。配合零开销的 CPU 调度器,调度决策本身几乎不吃算力。实际使用时值得注意:前缀复用率取决于请求的相似程度,如果每次请求的提示词完全随机,收益会明显下降;另外缓存也占用显存,长上下文场景要权衡缓存容量与并发数。

预填充解码分离、推测解码与连续批处理

官方把运行时能力列得很细:预填充与解码分离(PD disaggregation)把两种负载放到不同实例上,避免长提示词预填充拖慢解码;推测解码用草稿模型或多令牌预测加速生成,2026 年 6 月官方发布了新一代方案 DFlash 与 Spec V2;连续批处理与分块预填充则让新请求在生成过程中插入、长提示词被切成块执行,减少排队等待。这几项组合起来决定的是尾延迟而非平均吞吐。工程实践中要留意:PD 分离会增加部署复杂度与跨节点流量,适合吞吐敏感的大规模场景;推测解码的收益与接受率强相关,模型与草稿模型搭配不同,效果差别很大。

🧩

结构化解码:压缩状态机加速 JSON 输出

结构化输出是 SGLang 的另一条主线。官方在 2024 年 2 月提出用压缩有限状态机(compressed FSM)把 JSON 解码做到约 3 倍加速,此后结构化解码一直是核心能力之一,前端语言也围绕它设计:开发者可以用声明式写法描述生成过程,让模型输出严格符合给定结构。对做 Agent 与工具调用的团队,这意味着函数参数不必再靠事后校验与重试来修正。需要注意的是约束越强、对生成速度的影响越明显,尤其是深嵌套结构;实践中通常只对确实需要机器解析的字段加约束,把自由文本留给模型自由发挥。

🧮

量化与并行:从 FP4 到多 LoRA 批处理

官方列出的量化支持包括 FP4、FP8、INT4、AWQ 与 GPTQ,覆盖了当前主流的低精度部署路径。并行方面支持张量并行、流水线并行、专家并行与数据并行,其中专家并行(EP)是官方投入最多的方向之一——大规模 MoE 模型的专家分散在多机上,通信与调度策略直接决定能否线性扩展。此外还有多 LoRA 批处理:同一个基础模型上挂载多个适配器并在一个批次里服务不同租户,对做多客户定制的平台很实用。选型时要注意量化格式与硬件的匹配关系(例如 FP4 与 FP8 在最新一代 GPU 上收益最大),老硬件上往往只有 INT4 与 AWQ 可用。

🖥

硬件覆盖:NVIDIA、AMD、Intel、TPU 与昇腾

官方列出的运行目标包括 NVIDIA GPU(GB200、B300、H100、A100、DGX Spark、RTX 5090 等)、AMD GPU(MI355、MI300)、Intel Xeon CPU、Google TPU 与昇腾 NPU。TPU 这条线在 2025 年 10 月通过 SGLang-Jax 后端实现原生运行,2026 年 7 月官方进一步宣布把完整 SGLang 特性带到 TPU。对采购决策而言,跨硬件支持意味着不必把架构锁死在某一家芯片上;但不同后端的特性完整度与优化程度并不相同,迁移前最好用真实负载在目标硬件上实测,而不是只看文档里的支持列表。

📚

不只是聊天模型:嵌入、奖励与扩散模型

官方支持的模型类型比「对话服务」宽得多:语言模型覆盖 Llama、Qwen、DeepSeek、Kimi、GLM、Gemma、Mistral 等系列,另有嵌入模型(e5-mistral、gte、mcdse)、奖励模型(Skywork)以及扩散模型(WAN、Qwen-Image)。官方称与大多数 Hugging Face 模型兼容,接口则兼容 OpenAI 风格。扩散模型的支持体现在 2025 年 11 月与 2026 年 1 月的 SGLang Diffusion 相关工作,用于加速图像与视频生成。对平台型团队,价值在于生成、检索与排序可以走同一套服务框架与运维流程,减少维护两套推理栈的成本。

🌍

生产采用:官方称覆盖 40 万张以上 GPU

官方给出的规模口径是:全球部署运行在超过 40 万张 GPU 上,每天生成数万亿 token,并称其已成为开源推理引擎事实上的行业标准。README 中列出的采用方包括 xAI、NVIDIA、AMD、Intel、LinkedIn、Cursor、Oracle Cloud、Google Cloud、Microsoft Azure、AWS、Nebius、Modal、Baseten、RunPod、Novita、百度、蚂蚁、阿里、腾讯,以及 MIT、斯坦福、UC Berkeley、华盛顿大学与清华等高校。项目由非营利组织 LMSYS 托管,2025 年 6 月获得 a16z 开源 AI 资助,2025 年 3 月加入 PyTorch 生态。采用名单可以作为生态活跃度的参考,具体到自家负载仍需自行压测。

🎯

强化学习与后训练:被当作 rollout 后端

官方把 SGLang 描述为「经过验证的 rollout 后端」,即强化学习训练中负责批量生成样本的那一层。它已被多个后训练框架集成,官方点名的包括 AReaL、Miles、slime、Tunix 与 verl。这条线的意义在于:推理引擎的性能直接决定 RL 训练的样本吞吐,因而训练与推理不再是两套割裂的工程。官方在 2026 年 4 月的 DeepSeek-V4 相关工作中也强调「从快速推理到可验证的 RL」。对做后训练的团队,值得确认的是所用框架与 SGLang 版本的对应关系,以及权重更新与推理实例之间的同步方式,这两点最容易在自建流程里踩坑。

产品特点

核心功能与独有价值

01

RadixAttention 前缀缓存

用基数树管理 KV 缓存,让多个请求共享相同前缀。官方 2024 年 1 月的博客口径是最多 5 倍加速,在多轮对话、同模板批处理与检索增强场景收益最明显。

02

预填充解码分离与大规模专家并行

PD 分离把预填充与解码放到不同实例,避免长提示词拖慢生成;专家并行面向大规模 MoE 部署,官方多篇博客给出在 GB200 NVL72 与 96 张 H100 上的扩展结果。

03

结构化解码与前端语言

压缩有限状态机让 JSON 解码约快 3 倍,前端语言支持用声明式写法描述生成过程,输出严格符合结构;对 Agent 与工具调用场景省去了事后校验与重试。

04

同时服务对话、嵌入、奖励与扩散模型

除语言模型外还支持嵌入模型、奖励模型与扩散模型(WAN、Qwen-Image),官方称兼容大多数 Hugging Face 模型与 OpenAI 风格接口,一套框架覆盖生成、检索与排序。

最近动态

重要更新

Kimi K3 与 GLM5.2 等新模型的 day-0 支持

官方博客记录:2026 年 7 月 SGLang 与 Miles 为 Kimi K3 提供 day-0 支持,同期发布在 SGLang 上服务 GLM5.2 NVFP4 Agent 负载、两周内达到 500 TPS 的优化记录,以及 RadixArk 与 Google 把完整 SGLang 特性带到 TPU 的工作。

新一代推测解码 DFlash 与 Spec V2

官方在 2026 年 6 月发布推测解码的下一代方案(DFlash 与 Spec V2),并同期给出对 Nemotron 3 Ultra/Super 与 Higgs Audio v3 TTS 等新模型的 day-0 支持说明。

DeepSeek-V4 day 0:从快速推理到可验证 RL

官方 2026 年 4 月的博客以「DeepSeek-V4 在 Day 0」为题,描述 SGLang 与 Miles 组合下从快速推理到可验证强化学习训练的路径,这也是官方把推理引擎定位为 rollout 后端的直接证据。

GB300 NVL72 上的推理性能提升

官方 2026 年 2 月的博客给出在 NVIDIA GB300 NVL72 上的推理性能提升结果,并在同期发布 GB300 长上下文场景的优化记录;相关数字来自官方博客,具体口径与测试条件以原文为准。

产品总结

SGLang 是由非营利组织 LMSYS 托管的开源大模型推理与服务框架,官方定位为「面向大语言模型与多模态模型的高性能服务框架」,目标是在从单张 GPU 到大规模分布式集群的各种规模上提供低延迟、高吞吐推理。项目以 Apache-2.0 许可开源,2024 年 1 月创建,截至 2026 年 9 月核验约有 3.6 万 star、9000 余 fork,最新版本 v0.5.20(2026 年 9 月 18 日)。官方站点、文档与路线图分别位于 sglang.io、docs.sglang.io 与 roadmap.sglang.io,代码与发布在 GitHub。 核心特性围绕运行时效率展开:RadixAttention 用基数树管理 KV 缓存、让请求共享前缀(官方早期博客口径为最多 5 倍加速);零开销 CPU 调度器、连续批处理与分块预填充降低排队;预填充与解码分离把两类负载拆开部署;推测解码在 2026 年推出 DFlash 与 Spec V2 两代方案;并行方面覆盖张量、流水线、专家与数据并行,其中大规模专家并行面向 MoE 模型的多机部署;量化支持 FP4、FP8、INT4、AWQ 与 GPTQ,并有面向多租户的多 LoRA 批处理。结构化解码是另一条主线:压缩有限状态机让 JSON 解码约快 3 倍,前端语言则允许用声明式写法约束生成结构。 支持范围也超出对话服务:模型侧覆盖 Llama、Qwen、DeepSeek、Kimi、GLM、Gemma、Mistral 等语言模型,以及嵌入模型、奖励模型与扩散模型(WAN、Qwen-Image),官方称兼容大多数 Hugging Face 模型与 OpenAI 风格接口;硬件侧包括 NVIDIA、AMD、Intel Xeon CPU、Google TPU 与昇腾 NPU。官方称其部署运行在全球 40 万张以上 GPU 上、每天生成数万亿 token,采用方名单涵盖云厂商、GPU 云服务商、互联网公司与多所高校,并被 AReaL、Miles、slime、Tunix、verl 等后训练框架用作强化学习的 rollout 后端。 使用时需要注意:PD 分离与大规模专家并行会显著增加部署复杂度与跨节点网络压力,适合吞吐敏感的大规模场景,小规模部署未必划算;推测解码的收益强依赖草稿模型与接受率,需要实测;量化格式与硬件代际相关,FP4 与 FP8 主要在较新的 GPU 上收益明显;不同硬件后端的特性完整度不一致,迁移前应在目标硬件上用真实负载压测;作为 RL rollout 后端时,要确认所用后训练框架与 SGLang 版本的对应关系及权重同步方式。整体而言,它适合有自建推理需求、需要在高并发或大规模集群下压榨吞吐的团队。

产品类型
大模型推理与服务框架
支持平台
Python 库与启动命令 / OpenAI 兼容 API 服务 / 前端 DSL(结构化解码) / 多模态(图像、视频、音频) / 扩散模型(图像与视频生成) / 嵌入与奖励模型 / RL 训练 rollout 后端 / 多节点分布式部署
资费模式
开源免费(Apache-2.0 许可);成本来自自备 GPU 或云算力,官方不提供托管推理服务。

核验信息

参考文章与数据来源

本页事实来自 SGLang 官方渠道:GitHub 仓库 README(项目定位、RadixAttention 前缀缓存、零开销调度器、PD 分离、推测解码、连续批处理、分页注意力、张量与流水线、专家与数据并行、结构化解码、分块预填充、量化格式、多 LoRA 批处理、模型与硬件支持清单、40 万张 GPU 与数万亿 token 口径、采用方名单、LMSYS 托管与 RL 集成框架、历史新闻列表)以及官方站点与文档(站点定位与支持范围、安装与 OpenAI 兼容接口、前端教程、路线图入口)。star 数、版本号与新闻时间线核验于 2026 年 9 月 22 日,变化较快,请以官方最新信息为准;性能数字均引自官方博客,测试条件以原文为准。

  1. 官网SGLang 官网
  2. 其他SGLang 官方仓库
  3. 官方文档SGLang 官方文档
  4. 官方文档官方文档 · 安装指南
  5. 官方文档官方文档 · OpenAI 兼容接口
  6. 官方文档官方文档 · 前端教程
  7. 官方文档SGLang 开发路线图
  8. 其他SGLang 版本发布页

用户体验调查

SGLang介绍页面对您是否有帮助?