今天两边都是「把投机解码做得更细」的同一主题,但方向相反:SGLang 的 DFlash2 在提升草稿质量(让草稿 token 之间不再互相看不见),vLLM 则在拆一颗生产环境的雷(#52836 回退了一个会静默算错的 workspace 复用优化)。论文侧是 DeepMind Genie——用单张图生成可交互环境,动作标签全靠自监督发现。产业侧宇树本周挂牌,A 股人形第一股落地。
★ 今日最值得关注
SGLang #35371:DFlash2 —— 局部分组深度卷积 + 候选选择器(08-19 合入,+929 / −61)。
先看问题。DFlash 这一系的草稿头有个绕不开的约束:草稿块内的各个位置是并行生成的,位置 i 看不到位置 i−1 刚生成的草稿。也就是说,你在猜第 5 个 token 的时候,并不知道自己猜的第 4 个 token 是什么。这对自回归模型来说是个很强的结构性削弱——草稿越长,后半段越是在「盲猜」。
DFlash2 用两个互补的改动去补这个洞。
改动一:分组动态深度卷积。 在草稿块内部加一层沿位置维度的深度卷积,让提案位置能直接看到前序位置的表示:
out[i, c] = Σ_t (base[t, c] + δ[i, t, g(c)]) · x[i−t, c]
base 是可学习的基础卷积核,δ 是依赖当前位置 i 的动态增量(按通道分组 g(c) 共享),块边界处的 taps 清零以保证不跨块泄漏。好处很直接:提案位置不需要再额外跑一遍 backbone 就能看到前文表示,成本几乎只是一层廉价卷积,换来的是草稿质量的实质提升。
改动二:候选选择器。 传统做法是在每个槽位取 argmax,把草稿路径钉死成一条。DFlash2 改成每个槽位保留 top-K,然后按
edge(p→c) = ⟨A[p] ⊙ project(h), B[c]⟩ + unary[c]
从已验证的锚点出发,在候选图上走一条最优路径。T>0 采样时用逆 CDF 返回 K 个候选做无损验证——这一点很关键,它意味着提高采样温度不再以牺牲验证正确性为代价。
两项改动在 decode 阶段都被折进了草稿 CUDA graph,所以没有引入额外的 launch 开销。
为什么这条比一个百分比更值得看:过去两年投机解码的优化几乎全在「验证侧」——怎么少验、怎么早停、怎么把同步藏起来。DFlash2 是少见地把注意力放回了「草稿侧」。如果草稿本身质量上不去,验证侧无论怎么优化都是在给一个漏水的桶补水。这两个改动也是可移植的思路:「让并行生成的草稿互相可见」这个问题在所有 blockwise 草稿头里都存在,不只对 SGLang 成立。
一、AI 产业与论文热点
论文:Genie(DeepMind,110 亿参数,arXiv:2402.15391)
- 一句话定位:从单张图生成可交互环境的基础世界模型,训练不需要任何人工动作标签。
- 三段式结构:① Video Tokenizer(VQ-VAE)把视频帧压成离散 token;② Latent Action Model 自监督地「发现」动作——这是全篇最巧的一步,它不要求数据里带标注动作,而是从相邻帧的差异里反推出一个离散动作空间;③ Dynamics Model 用因果 Transformer 预测下一帧。
- 训练数据:3 万小时无标注游戏视频。
- 为什么重要:机器人 Sim2Real 最贵的不是算法,是环境。真机采集慢、易损、难复现;手工搭建仿真器又需要大量建模人力。Genie 提供的是第三条路——从一张图直接生成一个廉价、可无限并行、可玩的环境。对具身智能来说,这意味着 rollout 成本可以从「机器人小时」降到「GPU 小时」。Genie 2 已把这条路扩展到通用视频域。
算子:MQA(Multi-Query Attention,Shazeer 2019)
- 定位:所有 Query 头共享同一对 K/V,把推理时的 KV Cache 压缩 h 倍(h = 头数)。
- 在用模型:PaLM、LLaMA-2、Falcon。端侧 VLA 部署受益最明显。
- 关键数字:LLaMA-2-7B 的 KV Cache 从约 1.0 MB/token 降到 0.13 MB/token。
- 要注意的反面:这个收益不是免费的。MQA 本质上是在用「KV 头的多样性」换显存,小模型上的质量损失必须实测,不能因为大模型上掉点不明显就默认小模型也安全。端侧 VLA 恰好又多是 7B 以下的模型,这条尤其要当心。
性能优化:剪枝(Pruning)
- 定位:移除冗余权重 / 神经元 / 注意力头,直接压缩模型体积与计算量。
- 代表工作:SparseGPT(二阶近似,30~50% 稀疏几乎无损)、LLM-Pruner(结构化剪枝 + LoRA 恢复)、Sheared LLaMA(把剪枝本身当成一种训练目标)。
- 收益:LLaMA-2-7B 在 50% 稀疏下 perplexity 仅退化 7%;OpenVLA 7B 经 INT4 + 剪枝后可跑在 Jetson Orin Nano 上。
- 和蒸馏、量化的关系:三者是端侧部署的三种不同杠杆——量化改数值表示,剪枝改结构稀疏性,蒸馏改知识来源。OpenVLA 那条是三者的组合拳,也是目前具身端侧落地最现实的配方。
产业速递
- 宇树科技(688836):A 股人形机器人第一股预计本周挂牌,发行价 150.8 元 / 市值 610 亿,DeepSeek、腾讯、社保参与战配。映射方向:机器人 ETF、绿的谐波、三花智控。
- 智元机器人:预计 8 月港股挂牌,估值 400~500 亿港元,上半年出货 8400 台反超宇树。映射上纬新材(688585)。
- 共生知行:发布宇树 G1 驾驶卡丁车 Demo,DPC 端到端全身控制。技术风向标意义大于商业意义——它验证的是 VLA 路线在非结构化、需要连续全身协调的任务上是否成立。
- 北特科技(603009):特斯拉 Optimus 丝杠核心供应商,订单排至 9 月。海外龙头量产节奏向 A 股供应链传导的观测点。
- 行业整体:H1 全球人形出货 1.91 万台(+272%)、中国占 97%,双寡头格局形成。
二、vLLM & SGLang 社区跟踪
本周期双方均无新版本发布,主分支持续高频提交。
vLLM
- #52836(Bugfix,重要):回退「DSv4 eager workspace 复用」(#49236)。原因是跨 CUDA 流的缓冲区别名导致生产环境静默正确性问题——注意「静默」两个字,这类缺陷不会崩、不报错,只是偶尔算出错误结果。回退目标是分配器托管的缓冲区。
影响:跑 DSv4 且依赖该复用路径的团队应立即核对版本。 正确性缺陷的排查成本远高于那点内存复用收益。
- #51875(Core,重要):前缀缓存的
NONE_HASH默认改为固定种子。此前跨节点共享前缀缓存需要人工把各实例的PYTHONHASHSEEDpin 成同一个值,否则哈希不一致、缓存永远 miss。改完之后,跨节点 / 对象存储 / Mooncake 连接器开箱即可命中共享缓存。影响:PD 分离、KV 分层、多实例部署的运维复杂度直接下降一档。 这是那种「不产生百分比但让一堆人少熬一晚」的改动。
- #52512:GLM-5.2 不再误用 Dense MHA。#51368:修复 DSv4 mHC broadcast buffer 的 dummy load。#50493:Kimi-K3 支持 DCP 部分前缀命中。
- #52539:fused GDN MTP 支持 Qwen head ratios。#52681:升级 FlashInfer 至 0.6.17。另有大量 ROCm / MI325X 量化与内核启用。
SGLang
- #35371:DFlash2(见上文 ★)。
- #35375(Memory):把 CUDA graph pool 的空闲片段借给 EAGLE 整词表验证概率(开关
SGLANG_ENABLE_GRAPH_POOL_BORROW=1),降低投机解码的显存占用。思路很聪明——EAGLE 验证需要一块覆盖整词表的临时概率缓冲,而这恰好是 graph pool 里闲置显存能覆盖的形状。显存吃紧、想开 EAGLE 的可以试这个开关。 - #35214:DSV4 的 mhc post-pre fusion 默认开启。#35162:新增
deepseek_v4_flash_w8a8_8p_in32k_out1k_50ms低延迟配方——配方名本身就把约束写清楚了(8 卡、32K 输入 / 1K 输出、50ms 目标)。#35224:文档新增 DSV4 低延迟 PD 分离配方。 - #35049:传输中 abort 的延迟解码侧 KV 释放。#35396 / #35286:PD decode 预分配 SWA 驱逐下界断言。#35220:把 DSA PD + MTP + CP 的层切测试纳入 B300 基础套件——把最复杂的组合路径纳入常规测试,是这些配置敢上生产的前提。
常驻专题:Step 适配(仍无实质进展)
三个 Step MTP PR 全部 open 未合:vLLM #49490(Step-3.7-Flash MTP on MRv2,08-12 仍 open)、vLLM #40070(Step-3.5 MTP layer type,08-08 open)、SGLang #32325(Step-3.7-Flash-NVFP4 BF16 MTP shared head,07-24 open)。
StepFun-ai org 最近推送是 Step-Realtime-CLI(08-10),主力模型仓仍停在 Step-3.7-Flash 06-01 / Step-3.5-Flash 04-03,8 月无新开源模型。公开动态转向 AI 终端(STEPX / Step AOS)与商业化报道。
结论维持不变:MTP 是 Step 性能叙事的命脉,也是它最不稳的一块。模型卖点强依赖上游合入,而上游投入明显不在这一侧。
三、一句话结论
投机解码的优化重心正在从「验证侧省多少」转向「草稿侧造得好不好」——DFlash2 用一层深度卷积和一个 top-K 候选选择器,把「并行草稿互相看不见」这个结构性缺陷摆到了台面上;同日 vLLM #52836 的回退则提醒另一件事:省内存的优化如果引入了跨流别名,代价是静默算错。今天真正该动手的是两件事——跑 DSv4 的核对 #52836,做跨实例 KV 共享的升级到 #51875 之后的 main。
信息来源:SGLang PR #35371 / #35375 / #35214 / #35162 / #35224 / #35049 / #35396 / #35286 / #35220 / #32325;vLLM PR #52836 / #51875 / #52512 / #51368 / #50493 / #52539 / #52681 / #49490 / #40070;StepFun-ai org 仓库推送时间核对;阶跃星辰商业化报道(网易 / 蓝鲸,2026-08-15)。
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。