★ 今日最值得关注
vLLM #53247:按架构调优的 batch-invariant persistent matmul,RTX 4090D / H20 解码内核约 3×。
选它是因为,这是今天唯一一条零业务改动就能拿到数量级收益的改动。
原理不复杂。batch-invariant 内核的核心契约是「同一形状只编一次 CUDA graph,然后跨请求复用」——它天然适合 persistent matmul 这种反复被同一批形状调用的热点。这个 PR 做的关键一步,是为 4090D / H20 这类消费级与工作站级卡预调 tile / block 配置。为什么说这一步值钱:decode 阶段恰恰是带宽与 kernel launch 双双受限的区间,既没有大的计算密度去摊薄启动开销,又受制于 HBM 往返。把 tile/block 调对之后,单步延迟大幅下降,实测约 3×。
开启方式:VLLM_BATCH_INVARIANT。不改模型、不改算子、不改服务代码。
值得留意的另一面:它和今天的 #52193(TP>1 投机解码 workspace 取 max hidden dim)是同一类工作——把已有机制打磨到真正能落地。本期没有任何大版本发布,价值全在这些细节里。如果你的升级策略是「等 tag 再动」,那这半个月你会错过一堆这样的收益。
一、AI 产业与论文热点
论文:ACT(Action Chunking with Transformers,ICRA 2023,Stanford)
具身智能动作控制的基石工作。核心做法是用 Transformer 一次性预测未来 k 个动作块,把”低频观测”与”高频控制”解耦开——观测每秒来不了几帧,但控制必须 50Hz 地跑,动作块正好补上这个频率差。
两个关键设计:
- cVAE 建模动作的多模态分布,避免回归到均值。这一点对操作任务几乎是决定性的:同一个视觉观测下”从左边绕”和”从右边绕”都正确,取平均得到的却是”从中间撞上去”。
- Temporal Ensemble 平滑 chunk 边界,解决相邻动作块在接缝处的抖动。
如今现代 VLA(RT-1 / π0 / OpenVLA)的动作生成模块,基本都是它的变体。
算子:Chunked Prefill
vLLM / SGLang 的核心推理机制:把长 prompt 切成块,逐块累加进 KV Cache,允许长 prefill 与短 decode 交错执行,消除长序列对短请求的阻塞效应。
数学上靠在线 softmax 保证分块结果与全量 prefill 严格等价——这是它能被放心默认开启的前提,不是近似。
落到具身场景:VLA 的多帧视觉指令轻松到 2K+ tokens,不做分块的话,机器人会在”看懂画面”这个阶段整体卡死,后面的解码全被堵住。
性能优化:Prefix Caching
Radix Tree 自动检测共享前缀,让 KV Cache 做到「算一次、用多次」。SGLang 实测:多轮对话吞吐提升 2.2×,代码生成任务提升 3.5×。
与 PagedAttention 结合后支持 copy-on-write 数据隔离——不同请求共享同一份物理前缀,但各自写入时不影响别人。对 VLA 的多任务场景尤其合适:同一批任务共享的视觉前缀可以直接复用。
产业:具身智能”量产 + 上市 + 破纪录”三重催化
| 公司 | 关键动作 | 数字 |
|---|---|---|
| 宇树科技(688836) | IPO 后募投方向 | 累计产量约 1.8 万台;20.22 亿投向具身大模型,首次超过本体投入 |
| 智元机器人 | 启动港股 IPO | 目标估值 400–500 亿港元,A 股映射 688585 上纬新材 |
| 天工 Ultra | 人形机器人运动会 | 1500 米夺冠,2 分 21 秒 63,破人类世界纪录 |
| 银河通用 / 越疆(WRC) | 路线对垒 | “一脑多能” vs “一脑多体”,打破”一机一模型”枷锁 |
| 优必选(09880.HK) | 汽车机器人采购中标 | 9,051 万元,全球人形机器人单笔最大订单 |
最值得琢磨的是宇树那条:募投资金投向首次从本体转向具身大模型。这是整机厂商对价值分配的一次公开表态——硬件不再是壁垒,大脑才是。
二、vLLM & SGLang 社区跟踪
版本基线:vLLM v0.27.1(08-11)/ v0.28.0rc2(08-21),SGLang v0.5.18(08-22)。近 72h 三方均无新 tag,动态集中在 main。
vLLM
| PR | 类别 | 内容 | 影响 |
|---|---|---|---|
| #53247 | 性能·内核 | batch-invariant persistent matmul,为 4090D/H20 预调 tile/block | 解码内核约 3× ★ |
| #52193 | Bug修复·投机解码 | 投机解码在 TP>1 下 workspace 取 target/draft 最大 hidden dim | 修多卡 MTP/DFlash 形状错配 |
| #52157 | 新特性·投机解码 | 支持 varlen trtllm-gen decode 自适应验证 | 接受长度与高温质量提升 |
| #52676 | 性能·内核 | 为 Qwen3.6 启用融合 QK-norm + partial MRoPE + gate | 降低 HBM 往返 |
| #53165 | Bug修复·多模态 | 修混合 CLIP/SigLIP pooling 文本编码 | 多模态稳健性 |
#52193 值得单独说一句。它是 Step-3.7-Flash 在 TP=8 上开 MTP 的关键正确性修复:草稿模型与目标模型的 hidden dim 不一致时,旧逻辑按单一维度分配 workspace,多卡 MTP / DFlash 起服即崩。改成取两者最大值之后稳起。
这类 bug 的讨厌之处在于——它不产生错误答案,它让你根本起不来,而报错信息往往指向完全不相干的形状断言。
另外 #52157 把自适应验证铺到了 trtllm-gen 路径的变长场景,与 DFlash2 的自适应验证主线形成呼应。投机解码的”固定草稿长度”正在被逐条路径淘汰掉。
SGLang
- #36204(量化·文档)Ling-3.0-flash DSpark 在 H200 上四种量化全部验证通过:BF16 / FP8 / NVFP4 / INT4。影响很直接——量化档位不用再二选一,选便宜的那档就行。
- #35719(Bug修复·投机解码·量化)AMD 修 Qwen3.5 MTP 丢弃 fused shared-expert 权重:MI3xx 上”MTP + 量化”会静默丢权重,已修复。关键词是”静默”——不报错,只是悄悄少算了共享专家。
- #35840(PD分离·量化)为 inkling + mxfp8 KV 添加 PD 回归测试:低位 KV + PD 分离这种组合终于有 CI 守着了。
- #36035 / #36061(量化·多模态)扩散模型支持组件级量化覆盖 + 混合 Comfy NVFP4/INT8 层:视频生成类负载的量化粒度细化到组件级。
SGLang 这一天的主题很清楚:把”能不能跑”推向”在各种量化档位下都能跑对”。扩散侧的组件级量化尤其值得注意——图像/视频生成里不同组件对量化的敏感度差异极大,一刀切整模量化一直是个妥协。
三、一句话结论
今天没有新版本,但 #53247 让 4090D/H20 用一条环境变量换到约 3× 解码内核,#52193 让多卡投机解码不再起服即崩——没有 tag 的日子里,真正值钱的正是这类”不产生 headline 但改变可用性”的提交。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。