系列:每日AI热点

每日AI热点 · 2026-08-25:vLLM 交出 4090D/H20 约 3× 解码内核,SGLang 把 DSpark 验证铺到四种量化

★ 今日最值得关注

vLLM #53247:按架构调优的 batch-invariant persistent matmul,RTX 4090D / H20 解码内核约 3×。

选它是因为,这是今天唯一一条零业务改动就能拿到数量级收益的改动。

原理不复杂。batch-invariant 内核的核心契约是「同一形状只编一次 CUDA graph,然后跨请求复用」——它天然适合 persistent matmul 这种反复被同一批形状调用的热点。这个 PR 做的关键一步,是为 4090D / H20 这类消费级与工作站级卡预调 tile / block 配置。为什么说这一步值钱:decode 阶段恰恰是带宽与 kernel launch 双双受限的区间,既没有大的计算密度去摊薄启动开销,又受制于 HBM 往返。把 tile/block 调对之后,单步延迟大幅下降,实测约 3×。

开启方式:VLLM_BATCH_INVARIANT。不改模型、不改算子、不改服务代码。

值得留意的另一面:它和今天的 #52193(TP>1 投机解码 workspace 取 max hidden dim)是同一类工作——把已有机制打磨到真正能落地。本期没有任何大版本发布,价值全在这些细节里。如果你的升级策略是「等 tag 再动」,那这半个月你会错过一堆这样的收益。

一、AI 产业与论文热点

论文:ACT(Action Chunking with Transformers,ICRA 2023,Stanford)

具身智能动作控制的基石工作。核心做法是用 Transformer 一次性预测未来 k 个动作块,把”低频观测”与”高频控制”解耦开——观测每秒来不了几帧,但控制必须 50Hz 地跑,动作块正好补上这个频率差。

两个关键设计:

如今现代 VLA(RT-1 / π0 / OpenVLA)的动作生成模块,基本都是它的变体。

算子:Chunked Prefill

vLLM / SGLang 的核心推理机制:把长 prompt 切成块,逐块累加进 KV Cache,允许长 prefill 与短 decode 交错执行,消除长序列对短请求的阻塞效应。

数学上靠在线 softmax 保证分块结果与全量 prefill 严格等价——这是它能被放心默认开启的前提,不是近似。

落到具身场景:VLA 的多帧视觉指令轻松到 2K+ tokens,不做分块的话,机器人会在”看懂画面”这个阶段整体卡死,后面的解码全被堵住。

性能优化:Prefix Caching

Radix Tree 自动检测共享前缀,让 KV Cache 做到「算一次、用多次」。SGLang 实测:多轮对话吞吐提升 2.2×,代码生成任务提升 3.5×。

与 PagedAttention 结合后支持 copy-on-write 数据隔离——不同请求共享同一份物理前缀,但各自写入时不影响别人。对 VLA 的多任务场景尤其合适:同一批任务共享的视觉前缀可以直接复用。

产业:具身智能”量产 + 上市 + 破纪录”三重催化

公司关键动作数字
宇树科技(688836)IPO 后募投方向累计产量约 1.8 万台;20.22 亿投向具身大模型,首次超过本体投入
智元机器人启动港股 IPO目标估值 400–500 亿港元,A 股映射 688585 上纬新材
天工 Ultra人形机器人运动会1500 米夺冠,2 分 21 秒 63,破人类世界纪录
银河通用 / 越疆(WRC)路线对垒“一脑多能” vs “一脑多体”,打破”一机一模型”枷锁
优必选(09880.HK)汽车机器人采购中标9,051 万元,全球人形机器人单笔最大订单

最值得琢磨的是宇树那条:募投资金投向首次从本体转向具身大模型。这是整机厂商对价值分配的一次公开表态——硬件不再是壁垒,大脑才是。

二、vLLM & SGLang 社区跟踪

版本基线:vLLM v0.27.1(08-11)/ v0.28.0rc2(08-21),SGLang v0.5.18(08-22)。近 72h 三方均无新 tag,动态集中在 main。

vLLM

PR类别内容影响
#53247性能·内核batch-invariant persistent matmul,为 4090D/H20 预调 tile/block解码内核约 3× ★
#52193Bug修复·投机解码投机解码在 TP>1 下 workspace 取 target/draft 最大 hidden dim修多卡 MTP/DFlash 形状错配
#52157新特性·投机解码支持 varlen trtllm-gen decode 自适应验证接受长度与高温质量提升
#52676性能·内核为 Qwen3.6 启用融合 QK-norm + partial MRoPE + gate降低 HBM 往返
#53165Bug修复·多模态修混合 CLIP/SigLIP pooling 文本编码多模态稳健性

#52193 值得单独说一句。它是 Step-3.7-Flash 在 TP=8 上开 MTP 的关键正确性修复:草稿模型与目标模型的 hidden dim 不一致时,旧逻辑按单一维度分配 workspace,多卡 MTP / DFlash 起服即崩。改成取两者最大值之后稳起。

这类 bug 的讨厌之处在于——它不产生错误答案,它让你根本起不来,而报错信息往往指向完全不相干的形状断言。

另外 #52157 把自适应验证铺到了 trtllm-gen 路径的变长场景,与 DFlash2 的自适应验证主线形成呼应。投机解码的”固定草稿长度”正在被逐条路径淘汰掉。

SGLang

SGLang 这一天的主题很清楚:把”能不能跑”推向”在各种量化档位下都能跑对”。扩散侧的组件级量化尤其值得注意——图像/视频生成里不同组件对量化的敏感度差异极大,一刀切整模量化一直是个妥协。

三、一句话结论

今天没有新版本,但 #53247 让 4090D/H20 用一条环境变量换到约 3× 解码内核,#52193 让多卡投机解码不再起服即崩——没有 tag 的日子里,真正值钱的正是这类”不产生 headline 但改变可用性”的提交。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。