系列:每日AI热点

每日AI热点 · 2026-08-13:投机解码开始「算账」——高并发下固定草稿数反亏 33%

今天两边各有一条主线。论文侧是「世界模型 + 长上下文注意力」:Dreamer V3 用一套固定超参在 150+ 任务上打平专用 SOTA,DeepSeek 的 CSA 把 1M token 上下文的 KV Cache 压到 V3.2 的 10%。工程侧则出现了一个更值得警惕的信号——投机解码第一次被公开量化为「可能亏本」。

★ 今日最值得关注

vLLM #47808:DSpark 置信度调度验证(08-12 合入 main)。

此前几乎所有投机解码的部署经验都建立在一个默认假设上:草稿数 k 越大越好,或者至少「开了不亏」。这个 PR 用实测把这个假设打穿了——在并发 c=256、GPU 已饱和时,固定 7 个草稿的 DSpark 比完全不投机还慢 33%。

原因不复杂,但很容易被忽略:验证 k 个草稿的成本随 k 线性增长,而接受 token 数受接受率上限约束、增长越来越慢。低并发时 GPU 有余量,验证开销被空闲时间吃掉,所以看起来「k 越大越赚」;一旦并发把 GPU 打满,验证开销就直接进关键路径,每多验一个草稿都是在挤占真实 decode 的算力。

场景固定 k=7自适应(按置信度)
低并发(c≤64)与自适应误差 ±3%基线
高并发(c=256)比不投机慢 33%主动把 accept length 从 ~3.9 降到 3.5,保住收益

实现上有三个细节值得记:Triton kernel 按各位置置信度累乘(cumprod)排序,选「每毫秒接受 token 数」最大的前缀;每个请求用 EMA 平滑(α=0.8)避免逐步抖动;decode 路径改成 varlen CUDA graph 以吃掉变长窗口的开销。

对部署的影响:高并发跑 DSpark 的服务,必须开自适应验证预算,否则「开了投机」这个动作本身就在拖慢你。反过来也别急着把 k 调到 1——低并发下两者误差只有 ±3%,真正的分水岭是 GPU 是否饱和,而不是 k 的绝对值。

一、AI 产业与论文热点

论文:Dreamer V3 —— 世界模型 RL 首次跨域通用

算子:CSA(DeepSeek V4 压缩稀疏注意力)

性能优化:知识蒸馏

Teacher 的 soft label 指导 Student,参数减 10~50×,精度损失 1~3%。代表工作:DeepSeek R1 蒸馏(671B→7B,MATH-500 58.8%→92.8%)、Meta Muse Glimmer(logit 蒸馏,SWE-Bench 76.0 + DFlash 3.1×)、DistilBERT(参数 −40% / 快 60% / 保留 97%)。对具身场景的意义很直接:蒸馏是 VLA 端侧部署的关键路径,云端大模型蒸馏成轻量版部署到 Jetson,GR00T 的「三计算机架构」就是这条路线。

产业速递

公司 / 事件关键数字解读
宇树科技(688836)IPO 8288 倍认购,DeepSeek 配售 1.41 亿,募资 60.99 亿A 股人形第一股的定价锚
智元机器人(映射 688585)WITA-Omni 85.21 分登顶 DailyOmni全模态 VLA 得到验证
慧仑科技(广汽孵化)超亿元融资,GoMate Mini 部署 50 台 / 运行 6.3 万公里车规级供应链迁移
行业整体2026H1 全球人形出货 1.91 万台(+272%),中国厂商占 97%,智元+宇树合计 75%高盛预测 2027 年 7.6 万台、2032 年 50.2 万台
大模型Meta 开源 Muse Glimmer(300 亿参数 Agent 模型,SWE-Bench 76.0);Grok 4.6 发布(Elo 超 GPT-5.6);英伟达开源 Alpamayo 2 Super(340 亿参数自动驾驶模型)开源 Agent / 自驾模型同步放量

二、vLLM & SGLang 社区跟踪

vLLM

SGLang

常驻专题:Step 系列适配(连续第 8 日无进展)

两个 MTP PR 仍 open 未合:vLLM #49642(draft,停 08-06,step3.7-flash 越界检查)、SGLang #32325(停 07-24,NVFP4 MTP shared-head)。StepFun-ai org 核心仓 Step-3.7-Flash 停 06-01、Step-3.5-Flash 停 04-03,最新 org 活动是 Step-Realtime-CLI(08-10)。

对照同窗口 Ling 3.0 Flash 的 MTP 已经合入——差距不在模型能力,在上游维护投入。结论不变:Step 的性能卖点强依赖 MTP 自带草稿,而 MTP 恰是最不稳的一块。

三、一句话结论

投机解码的叙事正在从「怎么提吞吐」转向「怎么算清楚这笔账」——vLLM #47808 给出了第一个公开的负收益数据点(c=256 时固定 k 比不投机慢 33%),配套的 SGLang #27689 / vLLM #51738 则在消灭验证路径上的同步开销;如果你在跑高并发 DSpark 却从没测过「关掉投机」的对照组,今天就该补上这个基线。


信息来源:vLLM v0.27.1 Release;vLLM PR #50424 / #47808 / #51726 / #51738 / #51311 / #51255 / #47017 / #49642;SGLang PR #33807 / #27689 / #34443 / #34524 / #33997 / #34642 / #32921 / #32325;StepFun-ai org。

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。