系列:每日AI热点

每日AI热点 · 2026-08-19:DFlash2 给草稿头装上「局部卷积 + 候选选择器」,投机解码从拼接受率转向拼草稿质量

今天两边都是「把投机解码做得更细」的同一主题,但方向相反:SGLang 的 DFlash2 在提升草稿质量(让草稿 token 之间不再互相看不见),vLLM 则在拆一颗生产环境的雷(#52836 回退了一个会静默算错的 workspace 复用优化)。论文侧是 DeepMind Genie——用单张图生成可交互环境,动作标签全靠自监督发现。产业侧宇树本周挂牌,A 股人形第一股落地。

★ 今日最值得关注

SGLang #35371:DFlash2 —— 局部分组深度卷积 + 候选选择器(08-19 合入,+929 / −61)。

先看问题。DFlash 这一系的草稿头有个绕不开的约束:草稿块内的各个位置是并行生成的,位置 i 看不到位置 i−1 刚生成的草稿。也就是说,你在猜第 5 个 token 的时候,并不知道自己猜的第 4 个 token 是什么。这对自回归模型来说是个很强的结构性削弱——草稿越长,后半段越是在「盲猜」。

DFlash2 用两个互补的改动去补这个洞。

改动一:分组动态深度卷积。 在草稿块内部加一层沿位置维度的深度卷积,让提案位置能直接看到前序位置的表示:

out[i, c] = Σ_t (base[t, c] + δ[i, t, g(c)]) · x[i−t, c]

base 是可学习的基础卷积核,δ 是依赖当前位置 i 的动态增量(按通道分组 g(c) 共享),块边界处的 taps 清零以保证不跨块泄漏。好处很直接:提案位置不需要再额外跑一遍 backbone 就能看到前文表示,成本几乎只是一层廉价卷积,换来的是草稿质量的实质提升。

改动二:候选选择器。 传统做法是在每个槽位取 argmax,把草稿路径钉死成一条。DFlash2 改成每个槽位保留 top-K,然后按

edge(p→c) = ⟨A[p] ⊙ project(h), B[c]⟩ + unary[c]

从已验证的锚点出发,在候选图上走一条最优路径。T>0 采样时用逆 CDF 返回 K 个候选做无损验证——这一点很关键,它意味着提高采样温度不再以牺牲验证正确性为代价。

两项改动在 decode 阶段都被折进了草稿 CUDA graph,所以没有引入额外的 launch 开销。

为什么这条比一个百分比更值得看:过去两年投机解码的优化几乎全在「验证侧」——怎么少验、怎么早停、怎么把同步藏起来。DFlash2 是少见地把注意力放回了「草稿侧」。如果草稿本身质量上不去,验证侧无论怎么优化都是在给一个漏水的桶补水。这两个改动也是可移植的思路:「让并行生成的草稿互相可见」这个问题在所有 blockwise 草稿头里都存在,不只对 SGLang 成立。

一、AI 产业与论文热点

论文:Genie(DeepMind,110 亿参数,arXiv:2402.15391)

算子:MQA(Multi-Query Attention,Shazeer 2019)

性能优化:剪枝(Pruning)

产业速递

二、vLLM & SGLang 社区跟踪

本周期双方均无新版本发布,主分支持续高频提交。

vLLM

SGLang

常驻专题:Step 适配(仍无实质进展)

三个 Step MTP PR 全部 open 未合:vLLM #49490(Step-3.7-Flash MTP on MRv2,08-12 仍 open)、vLLM #40070(Step-3.5 MTP layer type,08-08 open)、SGLang #32325(Step-3.7-Flash-NVFP4 BF16 MTP shared head,07-24 open)。

StepFun-ai org 最近推送是 Step-Realtime-CLI(08-10),主力模型仓仍停在 Step-3.7-Flash 06-01 / Step-3.5-Flash 04-03,8 月无新开源模型。公开动态转向 AI 终端(STEPX / Step AOS)与商业化报道。

结论维持不变:MTP 是 Step 性能叙事的命脉,也是它最不稳的一块。模型卖点强依赖上游合入,而上游投入明显不在这一侧。

三、一句话结论

投机解码的优化重心正在从「验证侧省多少」转向「草稿侧造得好不好」——DFlash2 用一层深度卷积和一个 top-K 候选选择器,把「并行草稿互相看不见」这个结构性缺陷摆到了台面上;同日 vLLM #52836 的回退则提醒另一件事:省内存的优化如果引入了跨流别名,代价是静默算错。今天真正该动手的是两件事——跑 DSv4 的核对 #52836,做跨实例 KV 共享的升级到 #51875 之后的 main。


信息来源:SGLang PR #35371 / #35375 / #35214 / #35162 / #35224 / #35049 / #35396 / #35286 / #35220 / #32325;vLLM PR #52836 / #51875 / #52512 / #51368 / #50493 / #52539 / #52681 / #49490 / #40070;StepFun-ai org 仓库推送时间核对;阶跃星辰商业化报道(网易 / 蓝鲸,2026-08-15)。

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。