今天两边各有一条主线。论文侧是「世界模型 + 长上下文注意力」:Dreamer V3 用一套固定超参在 150+ 任务上打平专用 SOTA,DeepSeek 的 CSA 把 1M token 上下文的 KV Cache 压到 V3.2 的 10%。工程侧则出现了一个更值得警惕的信号——投机解码第一次被公开量化为「可能亏本」。
★ 今日最值得关注
vLLM #47808:DSpark 置信度调度验证(08-12 合入 main)。
此前几乎所有投机解码的部署经验都建立在一个默认假设上:草稿数 k 越大越好,或者至少「开了不亏」。这个 PR 用实测把这个假设打穿了——在并发 c=256、GPU 已饱和时,固定 7 个草稿的 DSpark 比完全不投机还慢 33%。
原因不复杂,但很容易被忽略:验证 k 个草稿的成本随 k 线性增长,而接受 token 数受接受率上限约束、增长越来越慢。低并发时 GPU 有余量,验证开销被空闲时间吃掉,所以看起来「k 越大越赚」;一旦并发把 GPU 打满,验证开销就直接进关键路径,每多验一个草稿都是在挤占真实 decode 的算力。
| 场景 | 固定 k=7 | 自适应(按置信度) |
|---|---|---|
| 低并发(c≤64) | 与自适应误差 ±3% | 基线 |
| 高并发(c=256) | 比不投机慢 33% | 主动把 accept length 从 ~3.9 降到 3.5,保住收益 |
实现上有三个细节值得记:Triton kernel 按各位置置信度累乘(cumprod)排序,选「每毫秒接受 token 数」最大的前缀;每个请求用 EMA 平滑(α=0.8)避免逐步抖动;decode 路径改成 varlen CUDA graph 以吃掉变长窗口的开销。
对部署的影响:高并发跑 DSpark 的服务,必须开自适应验证预算,否则「开了投机」这个动作本身就在拖慢你。反过来也别急着把 k 调到 1——低并发下两者误差只有 ±3%,真正的分水岭是 GPU 是否饱和,而不是 k 的绝对值。
一、AI 产业与论文热点
论文:Dreamer V3 —— 世界模型 RL 首次跨域通用
- 一句话定位:首个用单一固定超参数在 150+ 任务上达到或超越专用 SOTA 的世界模型 RL 算法。
- 核心思想三条:① 用 RSSM 学习环境动力学(确定性
h_t+ 离散随机z_t);② 用 symlog 变换统一跨域奖励尺度——这是「一套超参通用」能成立的关键,此前跨域调参的本质困难就是奖励量级差好几个数量级;③ 在 imagination 中 rollout 策略,不消耗真实交互。 - 为什么重要:具身智能的瓶颈是数据,业界常提的「10 亿小时数据缺口」靠真机采集补不上。世界模型生成合成数据是目前最被看好的路径。Dreamer V3 证明了这条路在算法层是可泛化的,而不只是在某个环境里调出来的孤例。
算子:CSA(DeepSeek V4 压缩稀疏注意力)
- 定位:把 O(L²) 注意力压到亚二次。V4 在 1M token 上只用 V3.2 的 27% FLOPs / 10% KV Cache。
- 在用模型:DeepSeek V4-Pro(61 层 CSA+HCA 交错,k=1024)、V4-Flash(43 层,k=512)。
- 三个关键点:① KV 压缩 m=4 → FP4 Lightning Indexer 做 top-k 稀疏 → 再叠 +128 token 滑动窗口;② HCA(m=128 稠密)与 CSA 交错,兼顾效率与表达力;③ FP4 粗筛的 recall 达 99.7%,这条最值得抄——它验证了「粗筛低精度 + 精算高精度」这个范式在注意力上是站得住的,而不只是量化领域的经验。
性能优化:知识蒸馏
Teacher 的 soft label 指导 Student,参数减 10~50×,精度损失 1~3%。代表工作:DeepSeek R1 蒸馏(671B→7B,MATH-500 58.8%→92.8%)、Meta Muse Glimmer(logit 蒸馏,SWE-Bench 76.0 + DFlash 3.1×)、DistilBERT(参数 −40% / 快 60% / 保留 97%)。对具身场景的意义很直接:蒸馏是 VLA 端侧部署的关键路径,云端大模型蒸馏成轻量版部署到 Jetson,GR00T 的「三计算机架构」就是这条路线。
产业速递
| 公司 / 事件 | 关键数字 | 解读 |
|---|---|---|
| 宇树科技(688836) | IPO 8288 倍认购,DeepSeek 配售 1.41 亿,募资 60.99 亿 | A 股人形第一股的定价锚 |
| 智元机器人(映射 688585) | WITA-Omni 85.21 分登顶 DailyOmni | 全模态 VLA 得到验证 |
| 慧仑科技(广汽孵化) | 超亿元融资,GoMate Mini 部署 50 台 / 运行 6.3 万公里 | 车规级供应链迁移 |
| 行业整体 | 2026H1 全球人形出货 1.91 万台(+272%),中国厂商占 97%,智元+宇树合计 75% | 高盛预测 2027 年 7.6 万台、2032 年 50.2 万台 |
| 大模型 | Meta 开源 Muse Glimmer(300 亿参数 Agent 模型,SWE-Bench 76.0);Grok 4.6 发布(Elo 超 GPT-5.6);英伟达开源 Alpamayo 2 Super(340 亿参数自动驾驶模型) | 开源 Agent / 自驾模型同步放量 |
二、vLLM & SGLang 社区跟踪
vLLM
- 版本:v0.27.1(08-11)补丁版,支持量化 DSpark Markov heads(#50424,草稿头
markov_w2可走 W4A16 量化)。跑 DSpark 的可以直接升级降本——草稿头此前是 FP 存储,量化后显存与带宽都省。 - 投机解码·经济性:#47808 置信度调度验证(见上文 ★)。
- 配置变更:#51726 把默认
_max_num_batched_tokens从 8192 提到 16384,单批 token 上限翻倍。吞吐会涨,但显存与调度压力同步上升,升级后必须重压max_num_seqs,否则容易在长输入流量下顶到显存墙。 - 性能 / 模型:#51738 再消灭一处 GPU↔CPU 同步;#51311 Kimi K3 Flash KDA out kernel(prefill 1.1~1.4×);#51255 原生 Dots3 NOTE 多模态;#47017 DeepSeek-V4 上 ROCm gfx11;#51668 Transformers 升 5.15.0。
SGLang
- PD 分离:#33807 支持 pipeline-parallel prefill + Mooncake staging buffer,长上下文 PD 分离的生产化又进一步。
- 投机解码·性能:#27689 FlashInfer MLA 去掉 spec-decode plan 里的阻塞 D2H 同步,每步延迟下降。这和 vLLM #51738 是同一主题——本周期两家都在系统性地清理关键路径上的同步点。
- Bug 修复·正确性:#34443 修 DSA 在 prefill-CP 投机解码的
num_splits崩溃;#34524 修 DFlash 滑窗注意力的因果默认值。开 DSA / DFlash + CP 的必须升级比对——这两个都是静默或崩溃型的正确性缺陷。 - 架构 / 多模态:#33997 升 FlashInfer 0.6.17 并清理 K3 临时 workaround,但 #33623 的 K3 MLA gate 融合被 #34642 同日 revert——K3 的融合内核仍在波动,别急着依赖。扩散侧提交密集(#32921 原生 SANA-Video T2V、MiniMax H3 LoRA、LTX-2 / ERNIE-Image / Krea-2 / Cosmos3)。
常驻专题:Step 系列适配(连续第 8 日无进展)
两个 MTP PR 仍 open 未合:vLLM #49642(draft,停 08-06,step3.7-flash 越界检查)、SGLang #32325(停 07-24,NVFP4 MTP shared-head)。StepFun-ai org 核心仓 Step-3.7-Flash 停 06-01、Step-3.5-Flash 停 04-03,最新 org 活动是 Step-Realtime-CLI(08-10)。
对照同窗口 Ling 3.0 Flash 的 MTP 已经合入——差距不在模型能力,在上游维护投入。结论不变:Step 的性能卖点强依赖 MTP 自带草稿,而 MTP 恰是最不稳的一块。
三、一句话结论
投机解码的叙事正在从「怎么提吞吐」转向「怎么算清楚这笔账」——vLLM #47808 给出了第一个公开的负收益数据点(c=256 时固定 k 比不投机慢 33%),配套的 SGLang #27689 / vLLM #51738 则在消灭验证路径上的同步开销;如果你在跑高并发 DSpark 却从没测过「关掉投机」的对照组,今天就该补上这个基线。
信息来源:vLLM v0.27.1 Release;vLLM PR #50424 / #47808 / #51726 / #51738 / #51311 / #51255 / #47017 / #49642;SGLang PR #33807 / #27689 / #34443 / #34524 / #33997 / #34642 / #32921 / #32325;StepFun-ai org。
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。