系列:每日AI热点

每日AI热点 · 2026-09-10:vLLM v0.29.0 终于发正式版(MRV2 全量默认 + Mamba 前缀缓存 −9~25% TTFT),SGLang 维持 v0.5.19

★ 今日最值得关注

vLLM v0.29.0 终于发正式版(594 commits / 277 贡献者,MRV2 全量默认 + Mamba 前缀缓存 −9~25% TTFT + 按请求统计投机解码接受率)——上周还卡在候选期空转,本周把生产可用的新东西真正交到手上;SGLang 维持 v0.5.19,Step-3.7-Flash 部署生态成熟。

三层事实:

  1. vLLM v0.29.0 正式版发布(594 commits / 277 贡献者),取代 8/24 的 v0.28.0。上周(0907 期)它还停在 rc1→rc4 候选期、始终没有正式 tag,本周终于正式 tag——上周担心的”候选期空转、稳定版带安全公告”在本版里被正式线取代。
  2. MRV2 收官后的第一批真性能红利:Model Runner V2 成为所有模型默认执行路径(#53183);batch-sharded sampling(#50465)把每步 logits 显存降到 1/TP;Mamba 前缀缓存带来 9%–25% TTFT 改善(#52789);--per-request-spec-decode-metrics(#48915)让你终于能按请求量化验证投机解码接受率。
  3. 破坏性变更反向信号:FlexOlmo / Olmo3 / Hunyuan V1 / VL 迁回 Transformers 后端(#53615),旧 api_server 启动命令废弃改 vllm serve。这与 0901 期 vLLM”把 bitsandbytes 外置、往外推 transformers”的方向相反——本期是”长尾复用 transformers 省维护”。

可执行结论:vLLM 用户先在 staging 验 parity 后升级(594 commits 跨度大,MRV2 全量默认会改变执行路径);上周”能不能上生产”的疑问,本周随正式版有了答案——但 0901 期那些安全公告(视频解码器显存耗尽 / chat-audio 解压炸弹)仍建议升级到 0.29.0 来收口,而不是停在被取代的 0.28.0。

值得单独说:本周对比是上周的反转——0907 期是”SGLang 发版、vLLM 卡候选”,本周 vLLM 终于把正式版交出来。但注意一个微妙信号:vLLM 本期出现了”迁回 Transformers 后端”,而 0901 期是”往外推”。结论很清楚——头部模型自研 PyTorch 栈,长尾模型复用 transformers,按热度分层,没有单一方向。

二、vLLM & SGLang 社区跟踪

版本状态:vLLM v0.29.0(正式版,594 commits / 277 贡献者) 取代 8/24 的 v0.28.0;SGLang v0.5.19(09-05,786 PR / 214 贡献者) 仍为最新稳定版,近 72h 无新 tag。

vLLM v0.29.0

新特性 / 架构演进:

破坏性变更:

变更PR影响
FlexOlmo / Olmo3 / Hunyuan V1 / VL 迁回 Transformers 后端#53615旧 api_server 启动命令废弃改 vllm serve;依赖这些模型的需重验
旧 api_server 启动命令废弃—启动脚本需改 vllm serve
vLLM Ascend v0.26.0rc1 新增 Step-3.5 / 3.7 Flash 于 Ascend 950—华为昇腾侧 Step 适配跟上

SGLang v0.5.19

新特性:

重要 PR(9/6–9/9):sgl-router bucket-aware policy domains + native cache indexing(缓存亲和路由,生产化关键件);ROCm DSA indexer top-k 精确化;diffusion mixed INT8 + Comfy NVFP4 encoder;Qwen3.8 Flash 适配。

原理:batch-sharded sampling(#50465)

vLLM v0.29.0 收官 MRV2 后第一条典型性能红利。

机制:每张卡只算 1/TP 词表分片的 logits,本地做局部采样,最后一次轻量通信汇总结果。显存随 TP 线性下降——TP 越大省得越多。

启示:用户完全无感(采样结果一致),但大 TP 部署的吞吐与显存峰值明显改善。这正是 MRV2 收官后”吃性能红利”的典型——不是新增算子,而是把执行路径的冗余收掉。

我的判断:MRV2 全量默认之后,vLLM 的优化重心从”加特性”转向”收路径”——batch-sharded sampling、Mamba 前缀缓存都是这个逻辑。对部署侧的意义是:升级 0.29.0 不只是拿新功能,更是在更省显存的执行路径上跑,同样的卡能塞下更大的 batch。

常驻专题

PD 分离:vLLM Kimi-K3 DCP with DSpark + DCP partial prefix cache;SGLang v0.5.19 DCP 默认 MLA + 9/6 sgl-router 缓存亲和路由(生产化关键件)。

架构演进:state-space / hybrid 模型前缀缓存与 KV 迁移成新焦点(呼应 Agentic 负载);稀疏 MLA(SM100)、Qwen3.8 MTP、W4A8 MoE。

纯 PyTorch vs transformers:本期反向信号——vLLM 把 FlexOlmo / Olmo3 / Hunyuan 迁回 Transformers 后端(复用够好、省维护);结论翻转:头部模型自研 PyTorch、长尾复用 transformers,按热度分层。

Step 适配:vLLM 一等公民(stepfun37 镜像 + MTP + NVFP4 4 卡)> SGLang(dev 镜像 + EAGLE);Ascend 950 已支持 Step-3.5 / 3.7 Flash;多模态原生视觉 / 视频 / 语音架构成型。

三、AI 论文与产业热点

今日重点(1 句)

PaLM-E 用”把图像 / 文本 / 机器人本体状态统一成同一套 token 喂给 562B 大模型”的极简方案,证明具身智能 = 大模型 + 多模态输入,把人形竞争焦点钉死在”大脑的数据效率”上。

论文核心(PaLM-E / Google Research, 2023, arXiv:2303.03378)

算子讲解:NSA 原生稀疏注意力(DeepSeek V4)

性能优化:Medusa 多头推测解码(arXiv:2401.10774, ICLR 2024, Meta)

产业热点(具身智能公司 / 产业链速递)

⚠️ 产业动态不构成投资建议。

四、一句话结论

vLLM v0.29.0 终于把正式版交出来(594 commits,MRV2 全量默认 + Mamba 前缀缓存 −9~25% TTFT + 按请求量化投机解码),把上周”卡候选、稳定版带雷”的悬念收掉,但本期也露出”迁回 Transformers 后端”的反向信号——头部自研、长尾复用,按热度分层;SGLang 维持 v0.5.19、Step-3.7-Flash 生态成熟;论文侧 PaLM-E 用统一 token 把具身钉在「大脑的数据效率」,NSA 原生稀疏注意力与 Medusa 多头推测解码给出可抄的工程作业,而智元踩球行走、宇树全自主搏击、京东 300 万台采购、小鹏首条产线,正把具身这条主线逐个标上价格。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。