系列:每日AI热点

每日AI热点 · 2026-08-29:SGLang 把冷启动压到 35.6 秒(2.38×),vLLM v0.28.0 的三处破坏性变更

★ 今日最值得关注

SGLang v0.5.18:checkpoint 分页与 CUDA graph 捕获重叠,Qwen3-32B / H100 引擎启动 84.8s → 35.6s(2.38×)。

为什么选这一条而不是那些更大的架构新闻:冷启动时延是过去两年里最被低估、也最少被优化的一个指标。

大家的注意力都在稳态吞吐和 TTFT 上,但真实生产里,冷启动时延直接决定了三件事:

  1. 弹性扩缩容能不能真的”弹性”——扩容要 85 秒才-ready,意味着你必须提前预留,弹性打了折扣。
  2. 故障恢复的 SLO——一个实例挂掉,替换实例 85 秒不可用。
  3. 研发迭代速度——每次改个参数重跑,等一分半。

做法本身不玄:把 checkpoint 分页加载与 CUDA graph 捕获两个原本串行的阶段重叠起来。前者是 I/O 密集,后者是 GPU 密集,天然可以并行——之前只是没人去做。

2.38× 就是这么来的。

值得对照着看的是同版本的另一条:SGLANG_CACHE_DIR 统一了所有编译内核缓存路径(破坏性变更)。好处是缓存管理终于可预测,代价是升级后首次启动需要重编译——也就是说,升级后的第一次冷启动会明显比 35.6s 慢。这两个改动放在一个版本里,读起来像是先给你 2.38×,再用一次重编译把它要回去一部分。

一、AI 产业与论文热点

论文:RDT-1B(清华 + 字节 Seed,2024)—— 动作空间的扩散 Transformer

Robot Diffusion Transformer,12 亿参数的扩散基础模型,生成机器人双臂协同操作的动作序列。

核心思路:把”动作块”(未来若干步的关节角 / 位姿)当成扩散变量。

影响与瓶颈:它验证了”扩散 + 基础模型”在机器人操作上可行,直接启发了 π0 / OpenVLA-ACTION / TRACE。但瓶颈也很直白——50 步采样约 50× 开销。这正是 Flow Matching 这类”把步数压下来”的工作存在的理由。

把它和 π0 摆在一起看,VLA 的两大动作表征路线就清楚了:RDT-1B 走扩散去噪,π0 走流匹配。前者表达力强、步数贵;后者步数便宜、表达力略妥协。目前流匹配在工程上更占优,但扩散的上限未必更低。

算子:KV Cache 量化(KIVI,2-bit)

把注意力的 KV 从 FP16 压到 2-bit,显存降 4–8×,长上下文 / 端侧 VLA 因此跑得动,且几乎不掉点。

关键在于 K 和 V 要用不同的量化策略——这是 KIVI 的核心洞察:

原因:K 的每个通道量级差异大(某些 head dim 特别大),必须分组处理;V 则沿 token 方向更平滑。这个非对称设计是精度几乎不损失的关键。

配合 PagedAttention 收益最大——页级粒度正好匹配分组量化的边界。

在用模型:DeepSeek V4 / Qwen3 将 KV 以 FP8 存储(同族思路,没那么极端);vLLM / llama.cpp 的量化路径已集成 2-bit 极端版。

性能优化:KV Cache 卸载与分层存储(GPU → CPU → NVMe)

代表工作:FlexGen / vLLM CPU offload。可服务 10–100× 更长的上下文。

产业热点

优必选那组数字最刺眼的是 销量 921 台(+1947%)。从三位数到接近千台的跨越,配合 Thinker-VLA 推理效率 +176% / 存储 −60%——这说明它已经不是”演示能力”,而是交付能力。人形机器人的竞争正在从”能不能做”转向”能不能便宜地批量交付”。

二、vLLM & SGLang 社区跟踪

两个大版本同周期发布:vLLM v0.28.0(8/26,584 commits / 270 contributors) 与 SGLang v0.5.18(8/22,710 PRs / 212 contributors)。

vLLM v0.28.0

性能提升:

新特性:

架构:Model Runner V2 落地 E/P/D 分离、权重卸载、多层 MTP KV 缓存;分层 KV 卸载新增磁盘层。

破坏性变更(升版前必读):

变更影响
max_num_batched_tokens 8192 → 16384显存峰值上升,小显存配置需重测
bitsandbytes 移出核心 → 外置量化路径需单独安装
Transformers 升至 5.15.0自定义模型定义大概率要改

SGLang v0.5.18

类别内容数字
性能启动期 checkpoint 分页 × CUDA graph 捕获重叠Qwen3-32B/H100 2.38×(35.6s vs 84.8s)★
性能TP LMHead 改 All-to-AllV4-Pro B200 decode LMHead 320μs → 169μs,TPOT 36.97 → 35.67ms
性能FlashInfer MNNVL 纯 allreduceV4-Flash TP4/Blackwell 小 batch 最高 +6.9%
新特性NVFP4 权重跑 AMD(quark_mxfp4)GSM8K 恢复 97.5–100.2%
新特性Kimi K3 针对 MI355X 调优吞吐 1.37–1.77×、ITL 1.45–2.42×
新特性7 个模型 day-0(含 5 个扩散类:SANA-Video、LTX-2.5、Cosmos3、LongCat-Image 等)多模态 / 视频生成成重点
破坏性所有编译内核缓存统一到 SGLANG_CACHE_DIR升级后首次启动需重编译

TP LMHead 改 All-to-All 那条值得展开:LMHead 在 TP 下原本要做一次 all-gather 把各卡的 logits 拼回来,而实际只需要 top-k。改成 All-to-All 后只传必要的部分,于是 320μs → 169μs,几乎是砍半。TPOT 36.97 → 35.67ms 的收益看着不大,但这是长上下文下逐层叠加的结果——每一步省一点,长序列就省出可观的一截。

7 个 day-0 模型里 5 个是扩散类,这个比例本身就是信号:SGLang 正在把多模态 / 视频生成当成主战场之一,而不只是 LLM 服务框架。

原理:自适应投机 token 预算

传统投机解码固定每步 draft 数,负载变化时要么摊不薄 verify 开销、要么浪费算力。

自适应做法:按上一轮接受率 $a = \text{accepted} / \text{drafted}$ 动态调整下一轮 budget——

配合 DSpark 置信度调度验证:高置信 draft 优先验证。

不改模型、不改算子,仅调度调整即获 DSpark TTFT 改善约 55–65%——这是典型的”零成本收益”。

可迁移性:同样的思路对机器人 VLA 的低时延控制(首动作时延)同样适用。只要你的系统里有”先猜后验”的结构,就有自适应预算的位置。

常驻专题

PD 分离:vLLM V2 落地 E/P/D 分离 + 权重卸载 + 分层 KV 卸载(磁盘层、外部二级层 module_path、与并行解耦的 CPU 布局),可跨重启缓存超长共享前缀;SGLang 侧为 DCP 可插拔通信后端 + FlashInfer MNNVL 纯 allreduce 降传输开销。

架构演进:投机解码三路线并行(DFlash2 / DSpark / Eagle3 vs SGLang 的 DSpark + KDA 前缀缓存);稀疏注意力成标配(V4 稀疏 MLA、K3 KDA);量化下沉 4-bit(NVFP4 / MXFP4 / FP8 KV);多模态扩散模型成 SGLang day-0 主力。

PyTorch vs transformers:本轮未检索到明确”脱离 transformers”的新 PR,但 vLLM v0.28.0 的同向信号明显(bitsandbytes 外置、Transformers 升 5.15.0、移除运行时 KV scale 计算)。

Step 适配(本期有实质进展):Step-3.7-Flash(198B 稀疏 MoE VLM,激活约 11B,256k 上下文)已在 vLLM 拿到一等公民级支持——官方镜像 vllm/vllm-openai:stepfun37 + 专用 reasoning/tool parser + expert-parallel + FP8/NVFP4(NVFP4 可 4 卡);SGLang 有 dev 镜像支持多模态与投机解码,但成熟度略低。另支持 Transformers、llama.cpp,接入 NVIDIA Nemo/NIM,可在 Mac / DGX / AMD Ryzen AI Max+ 运行;三档 reasoning_effort,原生 MCP/Skills,API 输出 8.1 元/百万 token。

注意措辞变化:此前多日的结论是”靠预建镜像,上游 PR 全 open”,今天的表述是”一等公民级支持”。区别在于——官方镜像 + 专用 parser + expert-parallel 意味着生产可用,而不只是社区 workaround。这是 Step 适配线上多日以来第一次明确的正面进展。

三、一句话结论

两个大版本同周期落地,但真正的看点不是版本本身:SGLang 用”checkpoint 分页 × CUDA graph 捕获重叠”把一个被忽视了两年的指标(冷启动)砍掉 58%,vLLM 用”自适应投机预算”在不动模型和算子的前提下拿到 55–65% 的 TTFT 改善——本周期最好的两个收益,都来自调度层而不是计算层。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。