★ 今日最值得关注
SGLang v0.5.18:checkpoint 分页与 CUDA graph 捕获重叠,Qwen3-32B / H100 引擎启动 84.8s → 35.6s(2.38×)。
为什么选这一条而不是那些更大的架构新闻:冷启动时延是过去两年里最被低估、也最少被优化的一个指标。
大家的注意力都在稳态吞吐和 TTFT 上,但真实生产里,冷启动时延直接决定了三件事:
- 弹性扩缩容能不能真的”弹性”——扩容要 85 秒才-ready,意味着你必须提前预留,弹性打了折扣。
- 故障恢复的 SLO——一个实例挂掉,替换实例 85 秒不可用。
- 研发迭代速度——每次改个参数重跑,等一分半。
做法本身不玄:把 checkpoint 分页加载与 CUDA graph 捕获两个原本串行的阶段重叠起来。前者是 I/O 密集,后者是 GPU 密集,天然可以并行——之前只是没人去做。
2.38× 就是这么来的。
值得对照着看的是同版本的另一条:SGLANG_CACHE_DIR 统一了所有编译内核缓存路径(破坏性变更)。好处是缓存管理终于可预测,代价是升级后首次启动需要重编译——也就是说,升级后的第一次冷启动会明显比 35.6s 慢。这两个改动放在一个版本里,读起来像是先给你 2.38×,再用一次重编译把它要回去一部分。
一、AI 产业与论文热点
论文:RDT-1B(清华 + 字节 Seed,2024)—— 动作空间的扩散 Transformer
Robot Diffusion Transformer,12 亿参数的扩散基础模型,生成机器人双臂协同操作的动作序列。
核心思路:把”动作块”(未来若干步的关节角 / 位姿)当成扩散变量。
- 前向过程:$x_t = \sqrt{\alpha_t}, x_0 + \sqrt{1-\alpha_t}, \epsilon$
- 训练目标:$\mathcal{L} = \mathbb{E}\lVert \epsilon_\theta(x_t, t, c) - \epsilon \rVert^2$
- 条件 $c$ = 语言嵌入 + 视觉 token + 本体感知
- 架构:DiT 风格 Transformer,每层用**自适应 LayerNorm(FiLM)**注入条件
- 采样:DDIM 约 50 步
影响与瓶颈:它验证了”扩散 + 基础模型”在机器人操作上可行,直接启发了 π0 / OpenVLA-ACTION / TRACE。但瓶颈也很直白——50 步采样约 50× 开销。这正是 Flow Matching 这类”把步数压下来”的工作存在的理由。
把它和 π0 摆在一起看,VLA 的两大动作表征路线就清楚了:RDT-1B 走扩散去噪,π0 走流匹配。前者表达力强、步数贵;后者步数便宜、表达力略妥协。目前流匹配在工程上更占优,但扩散的上限未必更低。
算子:KV Cache 量化(KIVI,2-bit)
把注意力的 KV 从 FP16 压到 2-bit,显存降 4–8×,长上下文 / 端侧 VLA 因此跑得动,且几乎不掉点。
关键在于 K 和 V 要用不同的量化策略——这是 KIVI 的核心洞察:
- K 沿 head 维平滑 → 按通道分组量化
- V 沿 token 维平滑 → 按 token 量化
原因:K 的每个通道量级差异大(某些 head dim 特别大),必须分组处理;V 则沿 token 方向更平滑。这个非对称设计是精度几乎不损失的关键。
配合 PagedAttention 收益最大——页级粒度正好匹配分组量化的边界。
在用模型:DeepSeek V4 / Qwen3 将 KV 以 FP8 存储(同族思路,没那么极端);vLLM / llama.cpp 的量化路径已集成 2-bit 极端版。
性能优化:KV Cache 卸载与分层存储(GPU → CPU → NVMe)
- 热块留 GPU
- 冷块卸载 CPU
- 最冷落 NVMe
- 按需回拷
代表工作:FlexGen / vLLM CPU offload。可服务 10–100× 更长的上下文。
产业热点
- 宇树科技(688836):8/19 科创板上市,开盘 +629%;2026H1 营收 +40.5%、净利扭亏;累计下线人形约 1.8 万台。
- 优必选(09880.HK):2026H1 营收 12.7 亿(+104%);人形收入 +1445%、销量 921 台(+1947%);Thinker-VLA 推理效率 +176%、存储 −60%。→ 港股人形主线。
- 智元(拟港股 IPO)/ 小鹏(9 亿美元融资)/ 银河通用(25 亿):资本化竞赛加速,A 股映射 688585 / 002050 / 601689。
- 其他:第二届世界人形机器人运动会 8/26 闭幕(天工 Ultra 百米 8.64 秒);世界机器人大会 150+ 新品;国家电网 68 亿具身智能采购。
优必选那组数字最刺眼的是 销量 921 台(+1947%)。从三位数到接近千台的跨越,配合 Thinker-VLA 推理效率 +176% / 存储 −60%——这说明它已经不是”演示能力”,而是交付能力。人形机器人的竞争正在从”能不能做”转向”能不能便宜地批量交付”。
二、vLLM & SGLang 社区跟踪
两个大版本同周期发布:vLLM v0.28.0(8/26,584 commits / 270 contributors) 与 SGLang v0.5.18(8/22,710 PRs / 212 contributors)。
vLLM v0.28.0
性能提升:
- Kimi-K3 全栈优化:DCP 支持、fused FlashKDA 内核、all-gather 合并 1.5–3× 内核加速。→ K3 长上下文 decode 成本下降。
- 自适应投机 token 预算,DSpark TTFT 改善约 55–65%;shared-expert 分片每卡省约 17 GiB。→ 纯调度收益,零模型成本。
新特性:
- DeepSeek V4 稀疏 MLA 端到端打通(decode / MTP / DSpark)
- AMD Quark NVFP4 + ROCm gfx11 / gfx950
- → V4 生产服务在 N / A 卡上基本闭环
架构:Model Runner V2 落地 E/P/D 分离、权重卸载、多层 MTP KV 缓存;分层 KV 卸载新增磁盘层。
破坏性变更(升版前必读):
| 变更 | 影响 |
|---|---|
max_num_batched_tokens 8192 → 16384 | 显存峰值上升,小显存配置需重测 |
| bitsandbytes 移出核心 → 外置 | 量化路径需单独安装 |
| Transformers 升至 5.15.0 | 自定义模型定义大概率要改 |
SGLang v0.5.18
| 类别 | 内容 | 数字 |
|---|---|---|
| 性能 | 启动期 checkpoint 分页 × CUDA graph 捕获重叠 | Qwen3-32B/H100 2.38×(35.6s vs 84.8s)★ |
| 性能 | TP LMHead 改 All-to-All | V4-Pro B200 decode LMHead 320μs → 169μs,TPOT 36.97 → 35.67ms |
| 性能 | FlashInfer MNNVL 纯 allreduce | V4-Flash TP4/Blackwell 小 batch 最高 +6.9% |
| 新特性 | NVFP4 权重跑 AMD(quark_mxfp4) | GSM8K 恢复 97.5–100.2% |
| 新特性 | Kimi K3 针对 MI355X 调优 | 吞吐 1.37–1.77×、ITL 1.45–2.42× |
| 新特性 | 7 个模型 day-0(含 5 个扩散类:SANA-Video、LTX-2.5、Cosmos3、LongCat-Image 等) | 多模态 / 视频生成成重点 |
| 破坏性 | 所有编译内核缓存统一到 SGLANG_CACHE_DIR | 升级后首次启动需重编译 |
TP LMHead 改 All-to-All 那条值得展开:LMHead 在 TP 下原本要做一次 all-gather 把各卡的 logits 拼回来,而实际只需要 top-k。改成 All-to-All 后只传必要的部分,于是 320μs → 169μs,几乎是砍半。TPOT 36.97 → 35.67ms 的收益看着不大,但这是长上下文下逐层叠加的结果——每一步省一点,长序列就省出可观的一截。
7 个 day-0 模型里 5 个是扩散类,这个比例本身就是信号:SGLang 正在把多模态 / 视频生成当成主战场之一,而不只是 LLM 服务框架。
原理:自适应投机 token 预算
传统投机解码固定每步 draft 数,负载变化时要么摊不薄 verify 开销、要么浪费算力。
自适应做法:按上一轮接受率 $a = \text{accepted} / \text{drafted}$ 动态调整下一轮 budget——
- $a$ 高 → 加大预算(摊薄 verify 开销)
- $a$ 低 → 缩小预算(减少无效算力与回退)
配合 DSpark 置信度调度验证:高置信 draft 优先验证。
不改模型、不改算子,仅调度调整即获 DSpark TTFT 改善约 55–65%——这是典型的”零成本收益”。
可迁移性:同样的思路对机器人 VLA 的低时延控制(首动作时延)同样适用。只要你的系统里有”先猜后验”的结构,就有自适应预算的位置。
常驻专题
PD 分离:vLLM V2 落地 E/P/D 分离 + 权重卸载 + 分层 KV 卸载(磁盘层、外部二级层 module_path、与并行解耦的 CPU 布局),可跨重启缓存超长共享前缀;SGLang 侧为 DCP 可插拔通信后端 + FlashInfer MNNVL 纯 allreduce 降传输开销。
架构演进:投机解码三路线并行(DFlash2 / DSpark / Eagle3 vs SGLang 的 DSpark + KDA 前缀缓存);稀疏注意力成标配(V4 稀疏 MLA、K3 KDA);量化下沉 4-bit(NVFP4 / MXFP4 / FP8 KV);多模态扩散模型成 SGLang day-0 主力。
PyTorch vs transformers:本轮未检索到明确”脱离 transformers”的新 PR,但 vLLM v0.28.0 的同向信号明显(bitsandbytes 外置、Transformers 升 5.15.0、移除运行时 KV scale 计算)。
- 好处:算子可控、开销低、便于定制、减少耦合。
- 代价:需自实现 tokenizer、模型加载与并行。
- 结论:生产服务优先 vLLM / SGLang,研究验证用 transformers。
Step 适配(本期有实质进展):Step-3.7-Flash(198B 稀疏 MoE VLM,激活约 11B,256k 上下文)已在 vLLM 拿到一等公民级支持——官方镜像 vllm/vllm-openai:stepfun37 + 专用 reasoning/tool parser + expert-parallel + FP8/NVFP4(NVFP4 可 4 卡);SGLang 有 dev 镜像支持多模态与投机解码,但成熟度略低。另支持 Transformers、llama.cpp,接入 NVIDIA Nemo/NIM,可在 Mac / DGX / AMD Ryzen AI Max+ 运行;三档 reasoning_effort,原生 MCP/Skills,API 输出 8.1 元/百万 token。
注意措辞变化:此前多日的结论是”靠预建镜像,上游 PR 全 open”,今天的表述是”一等公民级支持”。区别在于——官方镜像 + 专用 parser + expert-parallel 意味着生产可用,而不只是社区 workaround。这是 Step 适配线上多日以来第一次明确的正面进展。
三、一句话结论
两个大版本同周期落地,但真正的看点不是版本本身:SGLang 用”checkpoint 分页 × CUDA graph 捕获重叠”把一个被忽视了两年的指标(冷启动)砍掉 58%,vLLM 用”自适应投机预算”在不动模型和算子的前提下拿到 55–65% 的 TTFT 改善——本周期最好的两个收益,都来自调度层而不是计算层。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。