系列:每日AI热点

每日AI热点 · 2026-09-15:vLLM v0.29.1rc0 落地投机解码双密钥水印 + EPD 三段分离,SGLang main 补扩散与 XPU DFlash

★ 今日最值得关注

vLLM 把「发版」重新切回了「补丁 + 主线工程」节奏:v0.29.1rc0(09-12)的头号特性是投机解码 dual-key Gumbel-max 水印(#56122)——生产环境可给草稿/验证输出打防伪水印;main 又落地 EPD 三段分离(Encoder–Prefill–Decode,#56657/#56786),多模态视觉编码可独立扩缩。SGLang 维持 v0.5.19(09-05)无新 tag,但 main 密集上新:mixed INT8 扩散嵌入 + Comfy NVFP4 编码器(MiniMax-H3 视频/音频扩散更顺)、DFLASH 上 XPU(国产卡也能跑 DFlash)。三者皆无新正式发版,增量全在 main。今天真正的主线,是 NVIDIA 官方投机解码 co-design 指南把「接受长度 vs 草稿开销」的硬件约束讲透了。

三层事实:

  1. vLLM v0.29.1rc0 头号特性 = 投机解码双密钥水印(#56122):草稿与验证 token 走两套独立 Gumbel-max 采样密钥,可在不破坏质量的前提下给投机解码输出加可验证水印 → 生产合规、防伪、溯源利好(金融/监管场景直接可用)。
  2. EPD 三段分离落地 main(#56657/#56786 + #56546):把推理拆成 Encoder / Prefill / Decode 三段,视觉编码(多模态 VL)可独立扩缩容;#56546 修 encoder 媒体选项 → 多模态请求的编码阶段不再与 decode 绑定。
  3. SGLang main 两路补强(diffusion + XPU):[diffusion] mixed INT8 embeddings + Comfy NVFP4 encoder(09-09)让 MiniMax-H3 视频+音频扩散落地更顺;DFLASH for XPU(09-11)+ Rust TreeCore external cache linker(09-10)让国产 XPU 也能跑 DFlash 草稿。

可执行结论:双密钥水印让投机解码从「提速技巧」升级成「可审计的生产能力」——但提速本身仍受 NVIDIA 指南约束:Speedup = E[L]×Ttarget/(Tdraft+Tverify),接受长度 E[L] 才是天花板。对本人 OpenInfer / Qwen3-4B DFlash:并行草稿省的是串行延迟,草稿质量(E[L])才是硬上限,应优先 benchmark 不同 D 的 E[L],而非盲目加宽草稿树。

值得单独说:本周主角从「显存池化/分层」(0913)又切回「投机解码 + 多模态/国产硬件适配」——没有新 tag,但把投机解码做成可审计、把 DFlash 搬上 XPU、把多模态编码拆成独立段,三件事都在「把推理栈推向生产 + 国产可替代」。

二、vLLM & SGLang 社区跟踪

版本状态:vLLM v0.29.1rc0(09-12) 已切下个补丁,stable 仍为 v0.29.0(09-08/09-09);SGLang v0.5.19(09-05) 仍为最新稳定,近窗无新 tag;Step 冻结。本期增量几乎全部来自 main 分支,无正式发版。

vLLM(main · 投机解码可审计 + 多模态拆分主线)

新特性 / 架构演进:

破坏性变更:

变更影响
双密钥水印加入投机解码输出(#56122)草稿/验证采样路径变更,下游哈希/校验一致性须重验
EPD 三段分离(#56657/#56786)部署拓扑变更,须重验 prefill/decode/encoder 分离后的 parity
nvfp4_ds_mla 路径抽出(#55538)AMD DSA 路径变更,须重验 ROCm 上 NVFP4 MLA 的 parity

SGLang(main · 扩散 + 国产 XPU 主线)

新特性 / 重大适配:

生产实践:diffusion + NVFP4 编码器让 SGLang 在「多模态生成」场景补齐短板;DFLASH for XPU 则把投机解码的并行草稿能力从 NVIDIA 扩到国产卡,国产替代链路又通一段(main 分支增量,尚未进 v0.5.19 tag)。

原理:投机解码「接受长度 vs 草稿开销」硬件约束(NVIDIA co-design 指南 09-02)

NVIDIA 官方把投机解码的提速封死在一个公式里:Speedup = E[L]×Ttarget / (Tdraft + Tverify),验证 token 数 = 1 + D。

启示:对本人 OpenInfer / Qwen3-4B DFlash,并行草稿省的是串行延迟,但 E[L] 是硬天花板——应优先 benchmark 不同 D 下的 E[L],选「E[L]×Ttarget/(Tdraft+Tverify)」最大的 D,而非盲目堆宽。这条约束与 0913 的「缓存边界 Pareto 取舍」同源:都在 tradeoff 上找最优工作点。

我的判断:今天主线是「投机解码可审计化 + 草稿开销被公式钉死」。双密钥水印解决「敢不敢上生产」,NVIDIA 公式解决「上多宽才划算」——两者合起来,投机解码才真正从 trick 变成工程。

常驻专题

PD 分离:vLLM main 有 EPD 三段分离 + 9 类 KV connector(NIXL/Mooncake/LMCache)+ llm-d(CNCF);SGLang #37506 unified-pool 把 MHA/MLA/SWA/full+SWA+Mamba 统一进 Mooncake PD 传输(拒绝 speculative PD,需 Mooncake + equal TP + PP=1 + lazy compaction)。横向:vLLM 偏连接器插件化,SGLang 偏路由 + 统一树缓存原生。Mooncake 日均万亿 Token、KV 命中 >90%、批量读 <50ms(标杆)。

架构演进:投机解码四路线(EAGLE-3 / MTP / DFlash / DSpark)经 NVIDIA 指南体系化;稀疏注意力 HiSparse(vLLM #53781/#56629,SGLang #39337 code owners);FP8/NVFP4 量化(NVFP4 lm_head 仍坑);多模态扩散(SGLang MiniMax-H3 / Step Video-Audio)。

PyTorch vs transformers:本周期无「脱离 transformers」新 PR。沿用立场:vLLM v0.29.0 反向把 FlexOlmo/Olmo3/Hunyuan 迁回 Transformers 后端(#53615),纯 PyTorch 自研仅在头部模型划算;Step-3.7-Flash 调试需 transformers≥5.0。横向结论:自研推理栈适用高频/头部/极致优化,长尾借力 transformers。

Step 适配:vLLM stepfun37(FP8/BF16 MTP k=3;NVFP4 4 卡 TP4 需 modelopt + FP8 KV cache + async-scheduling);SGLang dev-step-3.7-flash EAGLE 多层层草稿。定价 ¥1.35 输入(未命中)/¥0.27 缓存/¥8.10 输出;已上 OpenRouter + NVIDIA NIM + 本地。IPO:2026-5 完成近 25 亿美元 Pre-IPO,港股递表仍「冲刺中」。横向:vLLM 一等公民 > SGLang dev 镜像。

三、AI 论文与产业热点

今日重点(1 句)

UC Berkeley 的 DayDreamer 把世界模型直接搬上真实机器人、无仿真器,四足约 1h 从零行走、被推后约 10min 适应,开创了「真实世界世界模型 RL」第三条路径;而 EAGLE 特征级投机解码头(~3×)与 S-LoRA 多 LoRA 并发服务,正好把今日「推理提速」主线从框架层补到算子层——产业侧宇树 G1 大升级、Skild AI ARR 破亿美元、谐波减速器瓶颈=护城河,正把具身「看懂 + 管动」逐一标价。

论文核心(DayDreamer · UC Berkeley,CoRL 2022,arXiv:2206.14176)

算子讲解:EAGLE(特征级投机解码头)

性能优化:S-LoRA(多 LoRA 并发服务)

产业热点(具身智能公司 / 产业链速递 · 置顶)

⚠️ 产业动态不构成投资建议。

四、一句话结论

vLLM v0.29.1rc0(09-12)头号特性=投机解码 dual-key Gumbel-max 水印(#56122,生产合规/防伪),main 又落地 EPD 三段分离(Encoder–Prefill–Decode,#56657/#56786)让多模态视觉编码独立扩缩;SGLang 维持 v0.5.19 但 main 密集上新——mixed INT8 扩散嵌入 + Comfy NVFP4 编码器(MiniMax-H3 视频/音频扩散)、DFLASH for XPU(国产卡也能跑 DFlash)。三者皆无新 tag,主线是「投机解码可审计化 + 草稿开销被 NVIDIA 公式钉死(Speedup = E[L]×Ttarget/(Tdraft+Tverify),E[L] 随 D 饱和)」,对本人 OpenInfer/Qwen3-4B DFlash 的启示是优先 benchmark 不同 D 的 E[L]。论文侧 DayDreamer 把世界模型搬上真机(四足 1h 行走、被推 10min 适应)开创真实世界世界模型 RL 第三条路径,EAGLE(~3×)与 S-LoRA 把提速主线补到算子层,而宇树 G1 大升级、Skild ARR 破亿美元、谐波减速器瓶颈=护城河,正把具身「看懂 + 管动」逐一标价。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。