系列:每日AI热点

每日AI热点 · 2026-09-20:GR00T N2 把机器人大脑从 VLA 升级为世界动作模型(新环境成功率翻倍);SGLang v0.5.20 HRRN 调度 TTFT 降 69%、NVIDIA Dynamo KV 感知路由 TTFT −50%

★ 今日最值得关注

NVIDIA GR00T N2 / DreamZero 世界动作模型(WAM):把机器人脑从「看图→出动作」的 VLA,升级成「先在脑内模拟出手后世界会怎样、再决定怎么动」——新任务 + 新环境成功率约 SOTA VLA 的 2×。 这是今天最值得记住的一条,因为它改写了「机器人大脑」的部件清单:世界模型从可选模块,变成了标配。

它和今天框架/性能两条线其实是同一句话的不同切面:框架在把草稿 KV、前缀缓存「跨节点 / 跨副本复用」,WAM 在把「未来视频帧预测」做成动作可行性的判据——都是把「难学的东西」换成「能用海量数据学的东西」:框架把 PD 的草稿 KV 复用做成默认原语,WAM 把「动作对不对」换成「视频预测对不对」(后者能用海量无标注视频学)。底层是同一个「复用已有能力、推到可用形态」的收口逻辑。

三层事实:

  1. WAM 的本质:VLA 是「看图→出动作」的无时间箭头映射,不知道动作后果;WAM 用共享 diffusion Transformer(~14B@7Hz)联合预测未来视频帧 + 动作,隐空间滚动 ẑ_{t+1}=f_θ(z_t,a_t),动作头走流匹配 ODE。判据很妙:想象出的未来画面正确 → 动作大概率可行;想象漂移 → 动作大概率失败。
  2. 结果:新任务 + 新环境成功率 ≈ SOTA VLA 的 2×,RoboArena + MolmoSpaces 双第一;新本体仅需 30 分钟 play data 迁移;失败模式从「动作错」变成「世界模型幻觉」(model-plant mismatch)——端侧算力门槛抬升,利好机器人芯片环节。
  3. 配套的工程降本:SGLang v0.5.20 的 #34565 分支点缓存(Agent / 多轮 / RAG 免费降本)+ NVIDIA Dynamo KV 感知路由(4 副本 TTFT −50%、命中 89%)把「重复 prefill」吃掉——和本人 OpenInfer / DFlash 同源:都在把「已算过的能力」尽量复用,让推理成本落在更优工作点。

值得单独说:WAM 把「世界模型」从论文里的可选模块推成机器人大脑标配,意味着端侧要跑得动这个 14B 的隐空间滚动 + 视频扩散——这正好和今天算子栏 KDA「固定状态无 KV 增长 → 端侧 VLA 长时程任务跑得动」、以及 09660.HK(地平线)的机器人芯片逻辑闭环。世界模型 + 省注意力 + 省 KV,是同一张具身算力账单的三行。

二、vLLM & SGLang 社区跟踪

版本状态:近 24h 无新版本,本期在 9/18–9/19 基础上补全 SGLang v0.5.20 细节 + 更正 vLLM v0.30.0rc2 修复归属。SGLang v0.5.20(9/18,190 commits / 713 PRs / 237 贡献者) 仍是窗口内唯一正式大版本;vLLM 稳定版仍 v0.29.0(09-08),发布线 v0.30.0rc2,0.30 线仅 bugfix 打磨。

vLLM(main · 0.30 线 NIXL 健壮性 + transformers 直跑)

版本 / 安全延续:

SGLang(v0.5.20 · HRRN 调度 + TRT-LLM Blackwell + Mamba SSM + 分支点缓存)

新特性 / 重大适配:

原理:#34565 统一前缀树 SWA 分支点缓存(Agent / 多轮 / RAG 免费降本)

我的判断:这条和 0919 的 #37709 DSpark under PD(草稿 KV 跨节点复用)、今天性能栏的 KV 感知路由(前缀块跨副本复用)是同一 DNA——都在「已算过的能力」上做复用原语。对本人 OpenInfer / Qwen3-4B DFlash,下一步可实测「分支点缓存 + 草稿 KV 复用」能否在单卡复现同档 E[L] 抬升。

常驻专题

PD 分离:vLLM #57570 净化 NIXL 计数;SGLang #37709 DSpark-under-PD + #28403 角色热切换双线领先;/v1/responses 默认不留存(PD 不能开)。

架构演进:SGLang v0.5.20 多点开花(前缀树 + 分支点、sampling masks overlap、TRT-LLM Blackwell、Mamba SSM、HRRN、Simulator);vLLM 0.30 打磨。

PyTorch vs transformers:无脱离 PR;边界信号延续(模型层 transformers、热点算子自研)。

Step 适配:vLLM stepfun37(MTP k=3)> SGLang dev(EAGLE draft=4),均 NVFP4 4 卡 + FP8 KV;StepAudio 3 端云协同成型;阶跃 IPO 进入审批阶段(媒体口径,未见公开招股书)。

三、AI 论文与产业热点

今日重点(1 句)

NVIDIA GR00T N2 / DreamZero 世界动作模型(WAM)把机器人脑从 VLA 升级为「先脑内模拟未来、再出手」——新环境成功率翻倍,世界模型从可选模块变标配、端侧算力门槛抬升利好机器人芯片;算子 KDA 让线性注意力全任务超 MLA、KV −75%、1M 上下文解码 6×,性能侧 NVIDIA Dynamo KV 感知路由 4 副本 TTFT −50%、命中 89% 与 PD 分离 / KV Offload 成三件套;产业面特斯拉 Optimus 新一轮中国供应链审厂、优必选柳州工厂投产、地瓜机器人 4 亿美元 C 轮利好 09660.HK——具身「补脑 + 落地」继续逐一标价。

论文核心(NVIDIA GR00T N2 / DreamZero 世界动作模型)

算子讲解:KDA(Kimi Delta Attention,月之暗面 arXiv:2510.26692)

性能优化:KV Cache-Aware Routing(前缀感知路由,NVIDIA Dynamo)

产业热点(具身公司 / 产业链速递 · 置顶)

⚠️ 产业动态不构成投资建议。

四、一句话结论

论文侧 NVIDIA GR00T N2 / DreamZero 世界动作模型(WAM)把机器人脑从 VLA 升级为「先脑内模拟未来、再出手」——新环境成功率约 2× SOTA VLA、世界模型变标配、端侧算力门槛抬升利好机器人芯片;算子 KDA 让线性注意力全任务超 MLA、KV −75%、1M 上下文解码 6×,性能侧 NVIDIA Dynamo KV 感知路由 4 副本 TTFT −50%、命中 89% 与 PD 分离 / KV Offload 成三件套;框架侧 SGLang v0.5.20 补细节——HRRN 调度(GLM-5.2 trace 较 FCFS TTFT 降 69%)、TRT-LLM Blackwell 较 FlashMLA prefill 1.2×/decode 1.45×、Mamba SSM 首支持、#34565 分支点缓存实测 TTFT −32%;vLLM 稳定版仍 v0.29.0 且背 CVE-2026-93436(修复 #55677 需 0.29.1+),另更正 rc2 修复归属 #57570、结论不变:别停在 v0.29.0,跟 main 或等 0.29.1+;产业侧特斯拉 Optimus 新一轮中国供应链审厂、优必选柳州工厂投产、地瓜机器人 4 亿美元 C 轮利好 09660.HK——具身「补脑 + 落地」继续逐一标价。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。