系列:每日AI热点

每日AI热点 · 2026-08-26:自适应 DSpark 让 c=256 吞吐 +33.6%,Step 的 MTP 接受率从 97% 静默崩到 4%

★ 今日最值得关注

vLLM #52783:自适应 DSpark 在 SM100 稀疏 MLA 上按置信度动态定草稿长度,并发 c=256 端到端吞吐 +33.6%。

这个数字反过来看才最能说明问题:关掉自适应时,固定 7 草稿长度在高并发下反而比不开投机解码更慢。

原因不神秘。固定 k 草稿的验证开销是刚性支出,而它的收益取决于”草稿被接受多少”。低并发时 GPU 有空余,验证开销能被摊薄,固定 k 是划算的;一旦并发打满、GPU 饱和,验证开销就从”摊薄”变成”净亏损”——你花掉的算力比省下的还多。

#52783 的做法:

  1. 按置信度 cumprod 排序选前缀——优先验证高置信度的草稿段,把预算花在更可能被接受的地方。
  2. EMA 平滑(α=0.8)——避免单步抖动导致预算剧烈跳变。
  3. varlen CUDA graph——变长场景仍能走图捕获,不退回逐请求 launch。
  4. 在 SM100 稀疏 MLA 上,把稀疏投影与草稿图合并,省掉一次 D2H 拷贝。

实测:低并发 ±3%(基本无损),高并发保住收益,c=256 端到端吞吐 +33.6%。

开启方式:设 VLLM_BATCH_INVARIANT 或启用自适应预算即受益。

⚠️ 今日第二个重点,而且是负面消息:Step 适配拿到了一条难得的硬证据。vLLM #38494 记录,Step-3.5-Flash 的 MTP 因为无条件共享 lm_head,acceptance rate 从约 97% 崩到约 4%——静默退化,不报任何错。

如果你在 upstream main 上跑 Step 的多卡 MTP,立即比对 accept_length。这个数字不会写在日志里,它只会让你的服务慢得莫名其妙。

一、AI 产业与论文热点

论文:Mobile ALOHA(CoRL 2024,Stanford)

Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation(Fu, Zhao, Finn)。一句话定位:低成本移动双臂遥操作 + co-training,把复杂移动操作做成可复现的工程方案。

三个核心思想:

  1. 在 ALOHA 双臂系统上加移动底盘,总成本 $32K;16-DoF @ 50Hz 全身控制;每个任务仅 50 次示教。
  2. co-training:把少量移动示教数据(16-DoF)与大量静态 ALOHA 数据(14-DoF)混在一起训练 ACT 行为克隆模型,用 pad base = 0 对齐维度差。
  3. 利用操作技能的共享结构实现跨场景迁移,成功率 50% → 90%:擦酒渍 100%、呼电梯 95%、收纳锅 85%。

为什么它重要:证明了低成本硬件 + 少量示教可以完成复杂任务,而 co-training 是一种数据高效利用的范式。它全开源,直接推动了移动操作的民主化。映射到工业部署,结论很实用:少量场景数据 + 通用预训练 = 场景迁移。

算子:负载均衡辅助损失(Aux Loss / Load Balancing Loss)

防 MoE expert collapse 的标准手段。

$$L_{balance} = \alpha \cdot N \cdot \sum (f_i \cdot P_i)$$

其中 $f_i$ 是专家 $i$ 被选中的 token 比例,$P_i$ 是平均路由概率,α = 0.01。

关键坑:α 太大(>0.1)会过度约束路由质量,模型被迫平均分配、损失专家特化;α 太小(<0.001)则 expert collapse 照旧发生。建议从 0.01 起调,并持续监控专家利用率的方差。

性能优化:3D 并行(DP + TP + PP)

千亿模型千卡训练的基础设施。

代表工作:DeepSeek V4(671B / 37B MoE)用 3D 并行 + EP + FP8 + ZeRO-3 在 2048 张 H800 上训练,成本 $5.576M,全程无 loss spike。Qwen3 用 Megatron-Core 的 TP+PP+DP+EP 四维并行;GLM-5 用 DeepNorm + 3D 并行在千卡上稳定训 1000 层。

坑:PP 的 bubble——micro-batch 太少时 GPU 大量空闲;TP 组 > 8 时 all-reduce 的通信开销会抵消掉切分带来的收益。

产业快照

  1. 小鹏机器人(未上市):首轮 9 亿美元融资,估值 63 亿美元,刷新中国具身智能单轮融资纪录;IRON 年底量产。利好整机 + 零部件链(688017 / 002050 / 601689)。
  2. 智元机器人(赴港 IPO,映射 688585):灵犀 X2 量产版零改装夺运动会 100 米障碍金牌;出货 9,700 台(43%),首次超过宇树登顶全球第一。
  3. 宇树科技-W(688836 科创):上市 4 日回撤 45%,收 613 元(+1.69%),融资余额 14.19 亿;运动会百米垫底,公司称精力侧重量产。短期中性波动,长期看量产。
  4. 芯片侧:OpenAI 自研芯片 Jalapeño 超越英伟达 GB300(TDP 700W vs 1400W);英伟达 Vera Rubin NVL72 吞吐 30 倍;Claude 蛋白质设计 27% 命中率;智谱 GLM-5.3 开源。

智元那组数字值得单独看:9,700 台 / 43% 份额,首超宇树。这是具身智能行业第一次出现明确的份额座次重排,而触发点是”量产版零改装参赛”——产品化程度,而不是实验室指标,正在成为竞争分水岭。

二、vLLM & SGLang 社区跟踪

版本状态:三方均无新 tag。vLLM 稳定 v0.27.1(08-11)/ 预发布 v0.28.0rc2(08-21);SGLang v0.5.18(08-22);Step 无新模型(org 核心仓冻结,Step-Realtime-CLI 最近 08-21)。

vLLM

PR内容影响
#52783自适应 DSpark(SM100 稀疏 MLA)c=256 +33.6%,高并发防亏 ★
#53649Blackwell batch-invariant 持久 matmul 自适应调参延迟降幅 25.2%(= 1.336×)
#52388Kimi-K3 Mamba 元数据准备内核6.6–7.6× 提速
#52242DSpark 支持 logprobs(逐验证 token 概率)投机解码可观测性
#53615Transformers 后端迁移收口更多模型走 HF transformers v5
#38494Step-3.5-Flash MTP 硬证据接受率 97% → 4%,静默退化 ⚠️

别被 #53649 的标题骗了:标题写的是 33.6%,但实际是 25.2% 的延迟降幅(即 1.336× 加速)。这两个数字容易被混为一谈,引用前请核对。

SGLang

常驻专题:分层收敛再次被印证,但方向相反

本期两边各走一步,方向恰好相反,却印证同一个结论:

代价也对称:前者要跟着 transformers 升级重编,后者失去上游路径。所以”纯 PyTorch vs transformers”从来不是二选一,而是模型定义向 transformers 收敛求广度,数据面与运行时向自研收敛求确定性。

Step 适配:无新官方 PR;最实质的信号就是上面那条 #38494 的量化证据。上游 MTP PR 仍全部 open,社区只能靠 stepfun37 预建镜像吃 MTP 加速。

三、一句话结论

把自适应调度接上投机解码,是本期最高性价比的改动——c=256 吞吐 +33.6%、K3 TTFT 改善这类收益都不需要动模型;但请同时去看一眼 accept_length,因为 Step 那条 97%→4% 的静默退化提醒我们:投机解码最危险的失败模式从来不是报错,而是”看起来在跑,其实一个数都没接受”。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。