★ 今日最值得关注
vLLM v0.29.0 终于发正式版(594 commits / 277 贡献者,MRV2 全量默认 + Mamba 前缀缓存 −9~25% TTFT + 按请求统计投机解码接受率)——上周还卡在候选期空转,本周把生产可用的新东西真正交到手上;SGLang 维持 v0.5.19,Step-3.7-Flash 部署生态成熟。
三层事实:
- vLLM v0.29.0 正式版发布(594 commits / 277 贡献者),取代 8/24 的 v0.28.0。上周(0907 期)它还停在 rc1→rc4 候选期、始终没有正式 tag,本周终于正式 tag——上周担心的”候选期空转、稳定版带安全公告”在本版里被正式线取代。
- MRV2 收官后的第一批真性能红利:Model Runner V2 成为所有模型默认执行路径(#53183);batch-sharded sampling(#50465)把每步 logits 显存降到 1/TP;Mamba 前缀缓存带来 9%–25% TTFT 改善(#52789);
--per-request-spec-decode-metrics(#48915)让你终于能按请求量化验证投机解码接受率。 - 破坏性变更反向信号:FlexOlmo / Olmo3 / Hunyuan V1 / VL 迁回 Transformers 后端(#53615),旧
api_server启动命令废弃改vllm serve。这与 0901 期 vLLM”把 bitsandbytes 外置、往外推 transformers”的方向相反——本期是”长尾复用 transformers 省维护”。
可执行结论:vLLM 用户先在 staging 验 parity 后升级(594 commits 跨度大,MRV2 全量默认会改变执行路径);上周”能不能上生产”的疑问,本周随正式版有了答案——但 0901 期那些安全公告(视频解码器显存耗尽 / chat-audio 解压炸弹)仍建议升级到 0.29.0 来收口,而不是停在被取代的 0.28.0。
值得单独说:本周对比是上周的反转——0907 期是”SGLang 发版、vLLM 卡候选”,本周 vLLM 终于把正式版交出来。但注意一个微妙信号:vLLM 本期出现了”迁回 Transformers 后端”,而 0901 期是”往外推”。结论很清楚——头部模型自研 PyTorch 栈,长尾模型复用 transformers,按热度分层,没有单一方向。
二、vLLM & SGLang 社区跟踪
版本状态:vLLM v0.29.0(正式版,594 commits / 277 贡献者) 取代 8/24 的 v0.28.0;SGLang v0.5.19(09-05,786 PR / 214 贡献者) 仍为最新稳定版,近 72h 无新 tag。
vLLM v0.29.0
新特性 / 架构演进:
- Model Runner V2 成为所有模型默认执行路径(#53183)——MRV2 收官,执行路径统一。
- batch-sharded sampling(#50465):每张卡只算 1/TP 词表分片的 logits、本地局部采样、一次轻量通信汇总,显存随 TP 线性下降;大 TP 部署吞吐提升、用户无感(见原理部分)。
- Mamba 前缀缓存带来 9%–25% TTFT 改善(#52789);新增
prefix_cache_retention_intervalCLI。 --per-request-spec-decode-metrics(#48915):按请求输出投机解码接受率,终于能量化验证加速。- 新增模型:Hy4-preview / Qwen3.8-Flash-Next / Kimi K3 NVFP4。
破坏性变更:
| 变更 | PR | 影响 |
|---|---|---|
| FlexOlmo / Olmo3 / Hunyuan V1 / VL 迁回 Transformers 后端 | #53615 | 旧 api_server 启动命令废弃改 vllm serve;依赖这些模型的需重验 |
旧 api_server 启动命令废弃 | — | 启动脚本需改 vllm serve |
| vLLM Ascend v0.26.0rc1 新增 Step-3.5 / 3.7 Flash 于 Ascend 950 | — | 华为昇腾侧 Step 适配跟上 |
SGLang v0.5.19
新特性:
- beam search 经
beam_width落地(暂不与投机 / PD 分离 / DP attention / HiCache 混用)。 - Unified Radix Tree 强制默认(此前已在 0907 期标记)。
- AMD Lean attention 把 GLM-5.2 分离式 decode 压到 8 ms/token;
--enable-layernorm-sp;W4A8 MoE 在 Hopper +12%(延续 0907 期)。
重要 PR(9/6–9/9):sgl-router bucket-aware policy domains + native cache indexing(缓存亲和路由,生产化关键件);ROCm DSA indexer top-k 精确化;diffusion mixed INT8 + Comfy NVFP4 encoder;Qwen3.8 Flash 适配。
原理:batch-sharded sampling(#50465)
vLLM v0.29.0 收官 MRV2 后第一条典型性能红利。
机制:每张卡只算 1/TP 词表分片的 logits,本地做局部采样,最后一次轻量通信汇总结果。显存随 TP 线性下降——TP 越大省得越多。
启示:用户完全无感(采样结果一致),但大 TP 部署的吞吐与显存峰值明显改善。这正是 MRV2 收官后”吃性能红利”的典型——不是新增算子,而是把执行路径的冗余收掉。
我的判断:MRV2 全量默认之后,vLLM 的优化重心从”加特性”转向”收路径”——batch-sharded sampling、Mamba 前缀缓存都是这个逻辑。对部署侧的意义是:升级 0.29.0 不只是拿新功能,更是在更省显存的执行路径上跑,同样的卡能塞下更大的 batch。
常驻专题
PD 分离:vLLM Kimi-K3 DCP with DSpark + DCP partial prefix cache;SGLang v0.5.19 DCP 默认 MLA + 9/6 sgl-router 缓存亲和路由(生产化关键件)。
架构演进:state-space / hybrid 模型前缀缓存与 KV 迁移成新焦点(呼应 Agentic 负载);稀疏 MLA(SM100)、Qwen3.8 MTP、W4A8 MoE。
纯 PyTorch vs transformers:本期反向信号——vLLM 把 FlexOlmo / Olmo3 / Hunyuan 迁回 Transformers 后端(复用够好、省维护);结论翻转:头部模型自研 PyTorch、长尾复用 transformers,按热度分层。
Step 适配:vLLM 一等公民(stepfun37 镜像 + MTP + NVFP4 4 卡)> SGLang(dev 镜像 + EAGLE);Ascend 950 已支持 Step-3.5 / 3.7 Flash;多模态原生视觉 / 视频 / 语音架构成型。
三、AI 论文与产业热点
今日重点(1 句)
PaLM-E 用”把图像 / 文本 / 机器人本体状态统一成同一套 token 喂给 562B 大模型”的极简方案,证明具身智能 = 大模型 + 多模态输入,把人形竞争焦点钉死在”大脑的数据效率”上。
论文核心(PaLM-E / Google Research, 2023, arXiv:2303.03378)
- 一句话定位:把文本 / 图像(ViT)/ 本体状态(MLP)投影成同一序列,做标准交叉熵 next-token 预测,输出同时含文本与离散动作 token——VLA / 世界模型路线的奠基作。
- 核心思想①:多模态嵌入注入——
e_img = ViT(I)、e_state = MLP(s)与文本 token 拼接;训练目标与普通 LLM 完全一致(仅交叉熵、无辅助损失、无独立策略网络)。 - 核心思想②:动作离散化——连续关节角分箱成 token,与文本 / 特殊 token 同词表联合预测。
- 核心思想③:多任务混合训练(VQA + 描述 + VLM + VLA);562B 规模出现正迁移——联合训练各项更好、无灾难遗忘。
- 影响:随模型增大 VLA 成功率单调上升(12× 缩放,OK-Robot 桌面操作 91%);2026 年智元 / 宇树”大脑之争”的方法论源头。
算子讲解:NSA 原生稀疏注意力(DeepSeek V4)
- 定位:用”压缩 + 选择 + 滑动窗口”三条并行可训练分支替代单一稠密注意力,长序列复杂度从 O(n²) 降到稀疏,64k 解码加速 11.6×、HBM 访问降 ~11×。
- 机制:压缩分支打块重要性分数 → top-N 块精细注意力(软、可微、梯度可流);可学习门控融合三路。
- 坑:稀疏必须**“原生可训练”**,
argmax硬选会断梯度。
性能优化:Medusa 多头推测解码(arXiv:2401.10774, ICLR 2024, Meta)
- 定位:在目标模型最后隐藏态挂多个 MLP head,每个并行预测未来第 k 个 token,构草稿树一次验证接受多条,无需独立草稿模型。
- 收益:比 EAGLE 更简单、比小草稿模型省显存,相对自回归 2–3×。
- 具身关联:降 VLA 解码时延让机器人更跟手;KV 量化 + Medusa 让端侧 VLA 跑板载算力。
产业热点(具身智能公司 / 产业链速递)
- 【具身】智元 AGILE2.0(9/10 当日):端到端感控一体,灵犀 X2 首次自主踩球行走 → 利好智元控股平台【上纬新材 688585】、机器人 ETF;映射”小脑 → 大脑”进阶。
- 【具身】宇树 UnifoLM-X2-1.0(9/7):世界-动作大模型实现人形全自主搏击 → 宇树(688836)技术锚;与 DeepSeek 合作补大脑。
- 【具身】京东物理 AI 加速计划(9/9):5 年采购 300 万台机器人 / 100 万无人车 / 10 万无人机 + 80 产业基地 → 利好执行器(三花智控 002050 / 拓普集团 601689)、减速器(绿的谐波 688017)、机器人 ETF(159039 / 159530)。
- 【具身】小鹏机器人:全球首条高阶通用人形产线启用、首台 IRON 下线;首轮融资超 9 亿美元刷新中国具身单轮纪录 → 映射 A 股供应链。
- 【具身】Defiance 美国首只中国人形机器人 ETF(9/4):前十大含绿的谐波 / 三花 / 拓普 / 汇川 / 宁德 → 中国供应链成全球被押注对象。
⚠️ 产业动态不构成投资建议。
四、一句话结论
vLLM v0.29.0 终于把正式版交出来(594 commits,MRV2 全量默认 + Mamba 前缀缓存 −9~25% TTFT + 按请求量化投机解码),把上周”卡候选、稳定版带雷”的悬念收掉,但本期也露出”迁回 Transformers 后端”的反向信号——头部自研、长尾复用,按热度分层;SGLang 维持 v0.5.19、Step-3.7-Flash 生态成熟;论文侧 PaLM-E 用统一 token 把具身钉在「大脑的数据效率」,NSA 原生稀疏注意力与 Medusa 多头推测解码给出可抄的工程作业,而智元踩球行走、宇树全自主搏击、京东 300 万台采购、小鹏首条产线,正把具身这条主线逐个标上价格。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。