★ 今日最值得关注
vLLM #52783:自适应 DSpark 在 SM100 稀疏 MLA 上按置信度动态定草稿长度,并发 c=256 端到端吞吐 +33.6%。
这个数字反过来看才最能说明问题:关掉自适应时,固定 7 草稿长度在高并发下反而比不开投机解码更慢。
原因不神秘。固定 k 草稿的验证开销是刚性支出,而它的收益取决于”草稿被接受多少”。低并发时 GPU 有空余,验证开销能被摊薄,固定 k 是划算的;一旦并发打满、GPU 饱和,验证开销就从”摊薄”变成”净亏损”——你花掉的算力比省下的还多。
#52783 的做法:
- 按置信度
cumprod排序选前缀——优先验证高置信度的草稿段,把预算花在更可能被接受的地方。 - EMA 平滑(α=0.8)——避免单步抖动导致预算剧烈跳变。
- varlen CUDA graph——变长场景仍能走图捕获,不退回逐请求 launch。
- 在 SM100 稀疏 MLA 上,把稀疏投影与草稿图合并,省掉一次 D2H 拷贝。
实测:低并发 ±3%(基本无损),高并发保住收益,c=256 端到端吞吐 +33.6%。
开启方式:设 VLLM_BATCH_INVARIANT 或启用自适应预算即受益。
⚠️ 今日第二个重点,而且是负面消息:Step 适配拿到了一条难得的硬证据。vLLM #38494 记录,Step-3.5-Flash 的 MTP 因为无条件共享 lm_head,acceptance rate 从约 97% 崩到约 4%——静默退化,不报任何错。
如果你在 upstream main 上跑 Step 的多卡 MTP,立即比对 accept_length。这个数字不会写在日志里,它只会让你的服务慢得莫名其妙。
一、AI 产业与论文热点
论文:Mobile ALOHA(CoRL 2024,Stanford)
Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation(Fu, Zhao, Finn)。一句话定位:低成本移动双臂遥操作 + co-training,把复杂移动操作做成可复现的工程方案。
三个核心思想:
- 在 ALOHA 双臂系统上加移动底盘,总成本 $32K;16-DoF @ 50Hz 全身控制;每个任务仅 50 次示教。
- co-training:把少量移动示教数据(16-DoF)与大量静态 ALOHA 数据(14-DoF)混在一起训练 ACT 行为克隆模型,用 pad base = 0 对齐维度差。
- 利用操作技能的共享结构实现跨场景迁移,成功率 50% → 90%:擦酒渍 100%、呼电梯 95%、收纳锅 85%。
为什么它重要:证明了低成本硬件 + 少量示教可以完成复杂任务,而 co-training 是一种数据高效利用的范式。它全开源,直接推动了移动操作的民主化。映射到工业部署,结论很实用:少量场景数据 + 通用预训练 = 场景迁移。
算子:负载均衡辅助损失(Aux Loss / Load Balancing Loss)
防 MoE expert collapse 的标准手段。
$$L_{balance} = \alpha \cdot N \cdot \sum (f_i \cdot P_i)$$
其中 $f_i$ 是专家 $i$ 被选中的 token 比例,$P_i$ 是平均路由概率,α = 0.01。
- Qwen3-MoE:经典 aux loss + expert capacity limit 双重保障。
- DeepSeek V4:创新的 auxiliary-loss-free 方法——用动态 bias 项调节负载,不干扰主梯度;路由激活从 Sigmoid 换成 Softplus;671B / 37B 训练全程稳定。
关键坑:α 太大(>0.1)会过度约束路由质量,模型被迫平均分配、损失专家特化;α 太小(<0.001)则 expert collapse 照旧发生。建议从 0.01 起调,并持续监控专家利用率的方差。
性能优化:3D 并行(DP + TP + PP)
千亿模型千卡训练的基础设施。
- DP:每卡一份完整模型,吃不同数据,梯度同步。
- TP:层内权重矩阵切分,all-reduce 拼回。
- PP:按层切 stage,micro-batch 流水线填满空档。
代表工作:DeepSeek V4(671B / 37B MoE)用 3D 并行 + EP + FP8 + ZeRO-3 在 2048 张 H800 上训练,成本 $5.576M,全程无 loss spike。Qwen3 用 Megatron-Core 的 TP+PP+DP+EP 四维并行;GLM-5 用 DeepNorm + 3D 并行在千卡上稳定训 1000 层。
坑:PP 的 bubble——micro-batch 太少时 GPU 大量空闲;TP 组 > 8 时 all-reduce 的通信开销会抵消掉切分带来的收益。
产业快照
- 小鹏机器人(未上市):首轮 9 亿美元融资,估值 63 亿美元,刷新中国具身智能单轮融资纪录;IRON 年底量产。利好整机 + 零部件链(688017 / 002050 / 601689)。
- 智元机器人(赴港 IPO,映射 688585):灵犀 X2 量产版零改装夺运动会 100 米障碍金牌;出货 9,700 台(43%),首次超过宇树登顶全球第一。
- 宇树科技-W(688836 科创):上市 4 日回撤 45%,收 613 元(+1.69%),融资余额 14.19 亿;运动会百米垫底,公司称精力侧重量产。短期中性波动,长期看量产。
- 芯片侧:OpenAI 自研芯片 Jalapeño 超越英伟达 GB300(TDP 700W vs 1400W);英伟达 Vera Rubin NVL72 吞吐 30 倍;Claude 蛋白质设计 27% 命中率;智谱 GLM-5.3 开源。
智元那组数字值得单独看:9,700 台 / 43% 份额,首超宇树。这是具身智能行业第一次出现明确的份额座次重排,而触发点是”量产版零改装参赛”——产品化程度,而不是实验室指标,正在成为竞争分水岭。
二、vLLM & SGLang 社区跟踪
版本状态:三方均无新 tag。vLLM 稳定 v0.27.1(08-11)/ 预发布 v0.28.0rc2(08-21);SGLang v0.5.18(08-22);Step 无新模型(org 核心仓冻结,Step-Realtime-CLI 最近 08-21)。
vLLM
| PR | 内容 | 影响 |
|---|---|---|
| #52783 | 自适应 DSpark(SM100 稀疏 MLA) | c=256 +33.6%,高并发防亏 ★ |
| #53649 | Blackwell batch-invariant 持久 matmul 自适应调参 | 延迟降幅 25.2%(= 1.336×) |
| #52388 | Kimi-K3 Mamba 元数据准备内核 | 6.6–7.6× 提速 |
| #52242 | DSpark 支持 logprobs(逐验证 token 概率) | 投机解码可观测性 |
| #53615 | Transformers 后端迁移收口 | 更多模型走 HF transformers v5 |
| #38494 | Step-3.5-Flash MTP 硬证据 | 接受率 97% → 4%,静默退化 ⚠️ |
别被 #53649 的标题骗了:标题写的是 33.6%,但实际是 25.2% 的延迟降幅(即 1.336× 加速)。这两个数字容易被混为一谈,引用前请核对。
SGLang
- #35314 SSD Expert Pack 推理(范式级):当专家权重超过 VRAM + 主机内存 时,把权重落到 SSD,按层预取。这是 opt-in 的、范围有限的,但方向上是范式级的——MoE 的参数量增长已经跑在内存容量前面,把存储层次再往下延一层是必然选择。
- #35505 共享专家融合 GB200:P99 ITL −52.6%,且低并发收益最大。低并发优化通常是被忽略的一块,而它恰恰对应交互式场景的真实体感。
- #36186 Nemotron 3.5 投机解码对比表:把 DSpark / EAGLE / MTP 的取舍量化成可查的表。这种”给选择而不是给结论”的文档,比单纯推荐某个算法有用得多。
- #36232 HiCache 重构:L2/L3 主机池 + UnifiedRadixCache 收口。
- 另有若干 PD 分离(disagg)边角 bugfix。
常驻专题:分层收敛再次被印证,但方向相反
本期两边各走一步,方向恰好相反,却印证同一个结论:
- vLLM #53615 迁 HF transformers v5 —— 求 day-N 零适配的广度。
- SGLang #35314 自管 SSD 权重栈 —— 求确定性。
代价也对称:前者要跟着 transformers 升级重编,后者失去上游路径。所以”纯 PyTorch vs transformers”从来不是二选一,而是模型定义向 transformers 收敛求广度,数据面与运行时向自研收敛求确定性。
Step 适配:无新官方 PR;最实质的信号就是上面那条 #38494 的量化证据。上游 MTP PR 仍全部 open,社区只能靠 stepfun37 预建镜像吃 MTP 加速。
三、一句话结论
把自适应调度接上投机解码,是本期最高性价比的改动——c=256 吞吐 +33.6%、K3 TTFT 改善这类收益都不需要动模型;但请同时去看一眼 accept_length,因为 Step 那条 97%→4% 的静默退化提醒我们:投机解码最危险的失败模式从来不是报错,而是”看起来在跑,其实一个数都没接受”。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。