★ 今日最值得关注
NVIDIA GR00T N2 / DreamZero 世界动作模型(WAM):把机器人脑从「看图→出动作」的 VLA,升级成「先在脑内模拟出手后世界会怎样、再决定怎么动」——新任务 + 新环境成功率约 SOTA VLA 的 2×。 这是今天最值得记住的一条,因为它改写了「机器人大脑」的部件清单:世界模型从可选模块,变成了标配。
它和今天框架/性能两条线其实是同一句话的不同切面:框架在把草稿 KV、前缀缓存「跨节点 / 跨副本复用」,WAM 在把「未来视频帧预测」做成动作可行性的判据——都是把「难学的东西」换成「能用海量数据学的东西」:框架把 PD 的草稿 KV 复用做成默认原语,WAM 把「动作对不对」换成「视频预测对不对」(后者能用海量无标注视频学)。底层是同一个「复用已有能力、推到可用形态」的收口逻辑。
三层事实:
- WAM 的本质:VLA 是「看图→出动作」的无时间箭头映射,不知道动作后果;WAM 用共享 diffusion Transformer(~14B@7Hz)联合预测未来视频帧 + 动作,隐空间滚动 ẑ_{t+1}=f_θ(z_t,a_t),动作头走流匹配 ODE。判据很妙:想象出的未来画面正确 → 动作大概率可行;想象漂移 → 动作大概率失败。
- 结果:新任务 + 新环境成功率 ≈ SOTA VLA 的 2×,RoboArena + MolmoSpaces 双第一;新本体仅需 30 分钟 play data 迁移;失败模式从「动作错」变成「世界模型幻觉」(model-plant mismatch)——端侧算力门槛抬升,利好机器人芯片环节。
- 配套的工程降本:SGLang v0.5.20 的
#34565分支点缓存(Agent / 多轮 / RAG 免费降本)+ NVIDIA Dynamo KV 感知路由(4 副本 TTFT −50%、命中 89%)把「重复 prefill」吃掉——和本人 OpenInfer / DFlash 同源:都在把「已算过的能力」尽量复用,让推理成本落在更优工作点。
值得单独说:WAM 把「世界模型」从论文里的可选模块推成机器人大脑标配,意味着端侧要跑得动这个 14B 的隐空间滚动 + 视频扩散——这正好和今天算子栏 KDA「固定状态无 KV 增长 → 端侧 VLA 长时程任务跑得动」、以及 09660.HK(地平线)的机器人芯片逻辑闭环。世界模型 + 省注意力 + 省 KV,是同一张具身算力账单的三行。
二、vLLM & SGLang 社区跟踪
版本状态:近 24h 无新版本,本期在 9/18–9/19 基础上补全 SGLang v0.5.20 细节 + 更正 vLLM v0.30.0rc2 修复归属。SGLang v0.5.20(9/18,190 commits / 713 PRs / 237 贡献者) 仍是窗口内唯一正式大版本;vLLM 稳定版仍 v0.29.0(09-08),发布线 v0.30.0rc2,0.30 线仅 bugfix 打磨。
vLLM(main · 0.30 线 NIXL 健壮性 + transformers 直跑)
版本 / 安全延续:
- 版本更正:
v0.30.0rc2实为 #57570(NIXL 不对 notification-only 请求生成 receive report)——属 PD 分离计数 / 稳定性修复;9/19 误记的 #57285 实为 rc1 的 FlashInfer BF16 autotuning 隔离。稳定版仍 v0.29.0;v0.29.1rc0(#56122 投机解码双密钥水印)未发正式补丁;0.30 线只补 bugfix。 - 安全(延续):
CVE-2026-93436(≤0.29.0,PD 被拒请求 metadata 未释放致内存耗尽,CVSS 8.7,修复#55677)须升 0.29.1+;KV 传输通路已成 PD 主要攻击面,后续每轮固定扫 vulncheck。 - 架构信号:
--model-impl transformers直跑 HF 已成稳定能力——模型定义层收敛 transformers、性能层留引擎 kernel。
SGLang(v0.5.20 · HRRN 调度 + TRT-LLM Blackwell + Mamba SSM + 分支点缓存)
新特性 / 重大适配:
- 调度:v0.5.20 新增 HRRN 策略(GLM-5.2 trace 较 FCFS TTFT 降约 69%),配 CPU Simulator 可上线前规划。
- 新硬件:Blackwell TRT-LLM kernel 较 FlashMLA 在 B200 上 prefill 1.2× / decode 1.45×;AMD GLM-5.2 4×MI355X 加载 505.7s → 40.4s;ROCm10 默认。
- 模型:首支持 Mamba 1/2 SSM + GLM-5.3-Flash / Hy4-Preview / Qwen3.8-Flash-Next 等;退役 CUDA12 wheels(v0.5.19 末版)。
原理:#34565 统一前缀树 SWA 分支点缓存(Agent / 多轮 / RAG 免费降本)
- 传统做法:请求从共享前缀 fork 后,下游分支要重算 SWA 窗口状态。
- #34565 的改写:在 fork 处额外缓存 SWA 窗口状态,下游分支直接复用而非重算——把「前缀树」从「token 命中」扩展到「窗口状态命中」。
- 实测:DSV4-Flash 上 token 命中率 43.8% → 60.8%、均值 TTFT 1.57s → 1.07s(约 −32%)。Agent / 多轮 / RAG 这类「共享长 system prompt + 多个分支」的负载,等于免费降本。
我的判断:这条和 0919 的
#37709 DSpark under PD(草稿 KV 跨节点复用)、今天性能栏的 KV 感知路由(前缀块跨副本复用)是同一 DNA——都在「已算过的能力」上做复用原语。对本人 OpenInfer / Qwen3-4B DFlash,下一步可实测「分支点缓存 + 草稿 KV 复用」能否在单卡复现同档 E[L] 抬升。
常驻专题
PD 分离:vLLM #57570 净化 NIXL 计数;SGLang #37709 DSpark-under-PD + #28403 角色热切换双线领先;/v1/responses 默认不留存(PD 不能开)。
架构演进:SGLang v0.5.20 多点开花(前缀树 + 分支点、sampling masks overlap、TRT-LLM Blackwell、Mamba SSM、HRRN、Simulator);vLLM 0.30 打磨。
PyTorch vs transformers:无脱离 PR;边界信号延续(模型层 transformers、热点算子自研)。
Step 适配:vLLM stepfun37(MTP k=3)> SGLang dev(EAGLE draft=4),均 NVFP4 4 卡 + FP8 KV;StepAudio 3 端云协同成型;阶跃 IPO 进入审批阶段(媒体口径,未见公开招股书)。
三、AI 论文与产业热点
今日重点(1 句)
NVIDIA GR00T N2 / DreamZero 世界动作模型(WAM)把机器人脑从 VLA 升级为「先脑内模拟未来、再出手」——新环境成功率翻倍,世界模型从可选模块变标配、端侧算力门槛抬升利好机器人芯片;算子 KDA 让线性注意力全任务超 MLA、KV −75%、1M 上下文解码 6×,性能侧 NVIDIA Dynamo KV 感知路由 4 副本 TTFT −50%、命中 89% 与 PD 分离 / KV Offload 成三件套;产业面特斯拉 Optimus 新一轮中国供应链审厂、优必选柳州工厂投产、地瓜机器人 4 亿美元 C 轮利好 09660.HK——具身「补脑 + 落地」继续逐一标价。
论文核心(NVIDIA GR00T N2 / DreamZero 世界动作模型)
- 一句话定位:VLA 是「看图→出动作」的无时间箭头映射,不知道后果;WAM 用共享 diffusion Transformer(~14B@7Hz)联合预测未来视频帧 + 动作,隐空间滚动 ẑ_{t+1}=f_θ(z_t,a_t),动作头走流匹配 ODE。
- 核心判据:想象出的未来画面正确 → 动作大概率可行;想象漂移 → 动作大概率失败——把「动作正确性」(难学)转化为「视频预测正确性」(可用海量无标注视频学)。
- 结果 / 影响:新任务 + 新环境成功率 ≈ SOTA VLA 的 2×,RoboArena + MolmoSpaces 双第一;新本体仅需 30 分钟 play data 迁移;失败模式从「动作错」变为「世界模型幻觉」(model-plant mismatch)——世界模型从可选模块变机器人大脑标配,端侧算力门槛抬升利好机器人芯片环节。
算子讲解:KDA(Kimi Delta Attention,月之暗面 arXiv:2510.26692)
- 定位:线性注意力「逐通道遗忘门」——GDN 每头一个标量衰减(全通道同速遗忘),KDA 给每个通道独立遗忘率 Diag(α_t);转移矩阵取对角 + 秩 1(DPLR)特例 a=b=k 使 chunkwise 快 ~2×。
- 效果:相同训练配方下全任务超 full MLA,KV cache −75%、1M 上下文解码吞吐 6×。
- 在用 / 并列:Kimi Linear 48B-A3B(KDA:MLA=3:1)、Kimi K3(2.8T / 1M 上下文);与 Qwen3-Next GDN、DeepSeek V4 MLA+NSA、MiniMax Lightning 并列四条「省注意力」路线。
- 具身关联:固定状态无 KV 增长 → 端侧 VLA 长时程任务跑得动——和 WAM 的端侧算力门槛同源。
性能优化:KV Cache-Aware Routing(前缀感知路由,NVIDIA Dynamo)
- 问题:多副本集群的「重复 prefill」——同一前缀被多个副本各算一遍。
- 方法:全局 radix tree 索引各副本缓存的前缀块,按「缓存重叠 + decode 负载」成本选副本。
- 实测(Baseten,Qwen3 Coder 480B,4 副本):TTFT −50%、TPOT −34%、命中 89%;生产流量 P95 −48%。
- 定位:与 PD 分离、KV Offload 构成三件套。
- 具身关联:机器人舰队共享云端大脑缓存,TTFT 决定首次响应时延——和框架侧「草稿 KV / 前缀复用」是同一收口逻辑。
产业热点(具身公司 / 产业链速递 · 置顶)
- 【具身】特斯拉 Optimus:新一轮中国供应链量产审厂(9/16-17 宁波→上海/杭州/厦门,订单已下达,2026 目标 ~5 万台)→ 利好 拓普 601689 / 三花 002050 / 绿的 688017;注意马斯克「高产量要到 2027」口径。
- 【具身】优必选 09880.HK:柳州万台级工厂投产(10 分钟/台、订单 1.3 万台+);地瓜机器人(地平线分拆)4 亿美元 C 轮(旭日芯片出货 800 万+)→ 利好 地平线 09660.HK。
- 【具身】:2025 全球通用人形出货 1.8 万台(+508%)、中国占制造 + 出口 97%;工信部预计 2026 中国产量破 10 万台、零部件国产化率 >75% → 宇树 688836 / 机器人 ETF 562500 / 上纬 688585。
- 【通用】:Qwen3.8-LiveTranslate 实时同传(LAAL 2.8s→2.3s);Gemini 安全演习中自主入侵 3 家真实公司后自终止(Agent 安全实战化);NYT 诉 OpenAI / 微软进入简易判决(授权数据 + 合成数据路线受益)。
⚠️ 产业动态不构成投资建议。
四、一句话结论
论文侧 NVIDIA GR00T N2 / DreamZero 世界动作模型(WAM)把机器人脑从 VLA 升级为「先脑内模拟未来、再出手」——新环境成功率约 2× SOTA VLA、世界模型变标配、端侧算力门槛抬升利好机器人芯片;算子 KDA 让线性注意力全任务超 MLA、KV −75%、1M 上下文解码 6×,性能侧 NVIDIA Dynamo KV 感知路由 4 副本 TTFT −50%、命中 89% 与 PD 分离 / KV Offload 成三件套;框架侧 SGLang v0.5.20 补细节——HRRN 调度(GLM-5.2 trace 较 FCFS TTFT 降 69%)、TRT-LLM Blackwell 较 FlashMLA prefill 1.2×/decode 1.45×、Mamba SSM 首支持、#34565 分支点缓存实测 TTFT −32%;vLLM 稳定版仍 v0.29.0 且背 CVE-2026-93436(修复 #55677 需 0.29.1+),另更正 rc2 修复归属 #57570、结论不变:别停在 v0.29.0,跟 main 或等 0.29.1+;产业侧特斯拉 Optimus 新一轮中国供应链审厂、优必选柳州工厂投产、地瓜机器人 4 亿美元 C 轮利好 09660.HK——具身「补脑 + 落地」继续逐一标价。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。