★ 今日最值得关注
vLLM 把「发版」重新切回了「补丁 + 主线工程」节奏:v0.29.1rc0(09-12)的头号特性是投机解码 dual-key Gumbel-max 水印(#56122)——生产环境可给草稿/验证输出打防伪水印;main 又落地 EPD 三段分离(Encoder–Prefill–Decode,#56657/#56786),多模态视觉编码可独立扩缩。SGLang 维持 v0.5.19(09-05)无新 tag,但 main 密集上新:mixed INT8 扩散嵌入 + Comfy NVFP4 编码器(MiniMax-H3 视频/音频扩散更顺)、DFLASH 上 XPU(国产卡也能跑 DFlash)。三者皆无新正式发版,增量全在 main。今天真正的主线,是 NVIDIA 官方投机解码 co-design 指南把「接受长度 vs 草稿开销」的硬件约束讲透了。
三层事实:
- vLLM v0.29.1rc0 头号特性 = 投机解码双密钥水印(#56122):草稿与验证 token 走两套独立 Gumbel-max 采样密钥,可在不破坏质量的前提下给投机解码输出加可验证水印 → 生产合规、防伪、溯源利好(金融/监管场景直接可用)。
- EPD 三段分离落地 main(#56657/#56786 + #56546):把推理拆成 Encoder / Prefill / Decode 三段,视觉编码(多模态 VL)可独立扩缩容;#56546 修 encoder 媒体选项 → 多模态请求的编码阶段不再与 decode 绑定。
- SGLang main 两路补强(diffusion + XPU):[diffusion] mixed INT8 embeddings + Comfy NVFP4 encoder(09-09)让 MiniMax-H3 视频+音频扩散落地更顺;DFLASH for XPU(09-11)+ Rust TreeCore external cache linker(09-10)让国产 XPU 也能跑 DFlash 草稿。
可执行结论:双密钥水印让投机解码从「提速技巧」升级成「可审计的生产能力」——但提速本身仍受 NVIDIA 指南约束:Speedup = E[L]×Ttarget/(Tdraft+Tverify),接受长度 E[L] 才是天花板。对本人 OpenInfer / Qwen3-4B DFlash:并行草稿省的是串行延迟,草稿质量(E[L])才是硬上限,应优先 benchmark 不同 D 的 E[L],而非盲目加宽草稿树。
值得单独说:本周主角从「显存池化/分层」(0913)又切回「投机解码 + 多模态/国产硬件适配」——没有新 tag,但把投机解码做成可审计、把 DFlash 搬上 XPU、把多模态编码拆成独立段,三件事都在「把推理栈推向生产 + 国产可替代」。
二、vLLM & SGLang 社区跟踪
版本状态:vLLM v0.29.1rc0(09-12) 已切下个补丁,stable 仍为 v0.29.0(09-08/09-09);SGLang v0.5.19(09-05) 仍为最新稳定,近窗无新 tag;Step 冻结。本期增量几乎全部来自 main 分支,无正式发版。
vLLM(main · 投机解码可审计 + 多模态拆分主线)
新特性 / 架构演进:
- 投机解码双密钥水印(#56122,v0.29.1rc0 头号):草稿/验证走两套独立 Gumbel-max 密钥,输出可加可验证水印,质量无损 → 生产合规/防伪/溯源直接可用。
- AMD/ROCm 性能(main 09-14):DeepSeek-V4.1 mHC 后处理折叠进延迟预投影、DeepSelect TopK 进 DSA 稀疏 indexer(#56464)、nvfp4_ds_mla 从融合 norm+rope 抽出(#55538)→ AMD 上 DSA 更省、NVFP4 MLA 路径更干净。
- EPD 三段分离(#56657/#56786):Encoder–Prefill–Decode 拆分,#56546 修 encoder 媒体选项 → 多模态视觉编码可独立扩缩,不再与 decode 绑定。
- stable v0.29.0 已含:/v1/messages/render、OffloadingConnector 修复(MTP/EAGLE 下不再零命中)、FP8 QSA indexer(GB300 decode 最高 1.3×)。
破坏性变更:
| 变更 | 影响 |
|---|---|
| 双密钥水印加入投机解码输出(#56122) | 草稿/验证采样路径变更,下游哈希/校验一致性须重验 |
| EPD 三段分离(#56657/#56786) | 部署拓扑变更,须重验 prefill/decode/encoder 分离后的 parity |
| nvfp4_ds_mla 路径抽出(#55538) | AMD DSA 路径变更,须重验 ROCm 上 NVFP4 MLA 的 parity |
SGLang(main · 扩散 + 国产 XPU 主线)
新特性 / 重大适配:
- diffusion 补强(09-09):mixed INT8 embeddings + Comfy NVFP4 encoder → MiniMax-H3 视频+音频扩散落地更顺,多模态生成从「文本」扩到「视频+音频」。
- 路由/缓存:sgl-router bucket-aware policy domains + native cache indexing(09-06)、Rust TreeCore external cache linker(09-10)、DFLASH for XPU(09-11) → 国产 XPU 也能跑 DFlash 并行草稿。
- 文档:官网新增 Qwen3.8-Flash-Next / MiniMax-H3 / Kimi-K3 / Inkling 四个 day-0 cookbook。
生产实践:diffusion + NVFP4 编码器让 SGLang 在「多模态生成」场景补齐短板;DFLASH for XPU 则把投机解码的并行草稿能力从 NVIDIA 扩到国产卡,国产替代链路又通一段(main 分支增量,尚未进 v0.5.19 tag)。
原理:投机解码「接受长度 vs 草稿开销」硬件约束(NVIDIA co-design 指南 09-02)
NVIDIA 官方把投机解码的提速封死在一个公式里:Speedup = E[L]×Ttarget / (Tdraft + Tverify),验证 token 数 = 1 + D。
- MTP:需 D 次串行 step,Tdraft ≈ D×Ltarget(草稿开销随 D 线性涨)。
- DFlash / DSpark:一次并行前向生成 D 个草稿,≈ 5×Ltarget,大目标模型开销可忽略。
- 关键陷阱:接受长度 E[L] 随 D 增大而饱和(SPEED-Bench 已证)——把草稿树加宽到一定程度,提速不再涨甚至回落,因为更多草稿 token 被拒。
启示:对本人 OpenInfer / Qwen3-4B DFlash,并行草稿省的是串行延迟,但 E[L] 是硬天花板——应优先 benchmark 不同 D 下的 E[L],选「E[L]×Ttarget/(Tdraft+Tverify)」最大的 D,而非盲目堆宽。这条约束与 0913 的「缓存边界 Pareto 取舍」同源:都在 tradeoff 上找最优工作点。
我的判断:今天主线是「投机解码可审计化 + 草稿开销被公式钉死」。双密钥水印解决「敢不敢上生产」,NVIDIA 公式解决「上多宽才划算」——两者合起来,投机解码才真正从 trick 变成工程。
常驻专题
PD 分离:vLLM main 有 EPD 三段分离 + 9 类 KV connector(NIXL/Mooncake/LMCache)+ llm-d(CNCF);SGLang #37506 unified-pool 把 MHA/MLA/SWA/full+SWA+Mamba 统一进 Mooncake PD 传输(拒绝 speculative PD,需 Mooncake + equal TP + PP=1 + lazy compaction)。横向:vLLM 偏连接器插件化,SGLang 偏路由 + 统一树缓存原生。Mooncake 日均万亿 Token、KV 命中 >90%、批量读 <50ms(标杆)。
架构演进:投机解码四路线(EAGLE-3 / MTP / DFlash / DSpark)经 NVIDIA 指南体系化;稀疏注意力 HiSparse(vLLM #53781/#56629,SGLang #39337 code owners);FP8/NVFP4 量化(NVFP4 lm_head 仍坑);多模态扩散(SGLang MiniMax-H3 / Step Video-Audio)。
PyTorch vs transformers:本周期无「脱离 transformers」新 PR。沿用立场:vLLM v0.29.0 反向把 FlexOlmo/Olmo3/Hunyuan 迁回 Transformers 后端(#53615),纯 PyTorch 自研仅在头部模型划算;Step-3.7-Flash 调试需 transformers≥5.0。横向结论:自研推理栈适用高频/头部/极致优化,长尾借力 transformers。
Step 适配:vLLM stepfun37(FP8/BF16 MTP k=3;NVFP4 4 卡 TP4 需 modelopt + FP8 KV cache + async-scheduling);SGLang dev-step-3.7-flash EAGLE 多层层草稿。定价 ¥1.35 输入(未命中)/¥0.27 缓存/¥8.10 输出;已上 OpenRouter + NVIDIA NIM + 本地。IPO:2026-5 完成近 25 亿美元 Pre-IPO,港股递表仍「冲刺中」。横向:vLLM 一等公民 > SGLang dev 镜像。
三、AI 论文与产业热点
今日重点(1 句)
UC Berkeley 的 DayDreamer 把世界模型直接搬上真实机器人、无仿真器,四足约 1h 从零行走、被推后约 10min 适应,开创了「真实世界世界模型 RL」第三条路径;而 EAGLE 特征级投机解码头(~3×)与 S-LoRA 多 LoRA 并发服务,正好把今日「推理提速」主线从框架层补到算子层——产业侧宇树 G1 大升级、Skild AI ARR 破亿美元、谐波减速器瓶颈=护城河,正把具身「看懂 + 管动」逐一标价。
论文核心(DayDreamer · UC Berkeley,CoRL 2022,arXiv:2206.14176)
- 一句话定位:传统世界模型依赖仿真器、难迁移真机;DayDreamer 直接在真实机器人上做世界模型 RL,无仿真器——四足约 1 小时从零学会行走,被外力推倒后约 10 分钟适应,验证了「真实世界世界模型 RL」可行性。
- 核心思想:把「预测未来观测」的世界模型目标函数直接用于真机在线学习,规避 sim-to-real 鸿沟;把「模型预测控制 + 强化学习」闭环跑在真实传感器流上。
- 意义:与「先在仿真训、再迁真机」「纯离线策略」并列,成为真实世界具身学习的第三条路径——对数据稀缺、仿真不准的本体(足式/灵巧手)尤其关键。已写入 AI 知识库【具身智能】并产出知乎科普。
算子讲解:EAGLE(特征级投机解码头)
- 定位:在 LLM 末层隐藏状态上做自回归草稿(而非 token 级),配树注意力一次性验证多分支 → 约 3× 加速。
- 为什么快:草稿在表征空间生成,复用目标模型深层特征,比独立小草稿模型更准(E[L] 更高),与今日 NVIDIA 公式「E[L] 是天花板」互为印证。
- 地位:EAGLE-3 是 NVIDIA 体系化投机解码四路线之一,与 MTP/DFlash/DSpark 并列。
性能优化:S-LoRA(多 LoRA 并发服务)
- 问题:单基座服务数千适配器时,逐请求加载 LoRA 权重显存爆炸、批处理碎片化。
- 方案:统一分页 + 异构批处理——把不同 LoRA 的增量权重分页管理、跨请求统一调度,单基座服务数千适配器近零额外开销。
- 价值:把「一个大模型 + 一堆小适配器」变成可规模化多租户服务,是 LoRA 推理工业化(A/B 测试、个性化、多任务)的基石。
产业热点(具身智能公司 / 产业链速递 · 置顶)
- 【具身】宇树(688836·A股):G1 大升级发布(9.5 万起 / 25DoF),消费级人形再降门槛、自由度拉满;监管收紧拟上市人形门槛下,先发卡位价值凸显。
- 【具身】Skild AI:披露 ARR 破 1 亿美元、60+ 付费客户——具身基础模型「先变现」样本,验证「机器人大脑」订阅制可行。
- 【具身】Boston Dynamics:推迟 2027 IPO——头部玩家也选择延后证券化,行业估值进入冷静期。
- 【监管】:中国人形 IPO 监管收紧,拟上市门槛抬高,利好已上市/量产进度领先的玩家(宇树、智元、优必选)。
- 【产业链】小鹏 IRON:量产推进,全球首条高阶通用人形自动化产线已启用、核心工序自动化率超 80%。
- 【产业链】:谐波减速器等核心部件瓶颈 = 护城河,映射绿的谐波 688017 / 三花智控 002050 / 拓普集团 601689 / 机器人 ETF 华夏 562500——减速器、丝杠、关节编码器仍是国产化与产能的卡点。
⚠️ 产业动态不构成投资建议。
四、一句话结论
vLLM v0.29.1rc0(09-12)头号特性=投机解码 dual-key Gumbel-max 水印(#56122,生产合规/防伪),main 又落地 EPD 三段分离(Encoder–Prefill–Decode,#56657/#56786)让多模态视觉编码独立扩缩;SGLang 维持 v0.5.19 但 main 密集上新——mixed INT8 扩散嵌入 + Comfy NVFP4 编码器(MiniMax-H3 视频/音频扩散)、DFLASH for XPU(国产卡也能跑 DFlash)。三者皆无新 tag,主线是「投机解码可审计化 + 草稿开销被 NVIDIA 公式钉死(Speedup = E[L]×Ttarget/(Tdraft+Tverify),E[L] 随 D 饱和)」,对本人 OpenInfer/Qwen3-4B DFlash 的启示是优先 benchmark 不同 D 的 E[L]。论文侧 DayDreamer 把世界模型搬上真机(四足 1h 行走、被推 10min 适应)开创真实世界世界模型 RL 第三条路径,EAGLE(~3×)与 S-LoRA 把提速主线补到算子层,而宇树 G1 大升级、Skild ARR 破亿美元、谐波减速器瓶颈=护城河,正把具身「看懂 + 管动」逐一标价。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。