系列:每日AI热点

每日AI热点 · 2026-09-07:SGLang v0.5.19 发版(786 PR,W4A8 MoE +12%/DeepEP v2),vLLM 卡在 0.29.0 候选期且稳定版曝两则安全公告

★ 今日最值得关注

SGLang 发 v0.5.19(786 PR / 214 贡献者,本周最大特性包),vLLM 卡在 0.29.0 候选期且稳定版曝两则安全公告——「谁更稳」本周答案很清楚。

三层事实:

  1. SGLang v0.5.19(09-05)正式发版:端侧 / Hopper 量化(W4A8 MoE +12%)、DeepEP v2 让 decode 跑进 CUDA graph(含跨节点)、LayerNorm 序列并行省 prefill、投机 kernel 提速 1.3–1.8×(DSA)/ MTP verify-and-commit −45%~63%。
  2. vLLM 仍停在 0.29.0 候选期:rc1(09-02,CUTLASS MoE 填充路由越界修复)→ rc4(TRT-LLM ragged prefill 同步 bug),始终没有正式 tag,稳定版还是 08-26 的 v0.28.0。
  3. 而 vLLM 稳定版带着两则安全公告:视频解码器显存耗尽(PyNvVideoCodec GPU 后端即使软解启动也会吃显存,未鉴权调用可崩溃 worker)+ chat-audio 解压炸弹(影响 >= 0.24.0)。

可执行结论:跑多模态的 vLLM 用户先补安全(升级修补版 + 强制鉴权 / 配额 + 拒绝调用方控制的解码后端 + 多模态路由单独限流);要不要切到 SGLang v0.5.19 的新特性,等 0.29.0 正式发版再比——现在 vLLM 的「新东西」都在候选期里,不该上生产。

值得单独说:本周的对比很典型——SGLang 在发版节奏和特性密度上都压了 vLLM 一头,但 vLLM 的隐患在「已发布的稳定版」里。前者是「等不等得到」,后者是「已经在线上的雷」。优先扫雷。

二、vLLM & SGLang 社区跟踪

版本状态:SGLang v0.5.19(09-05) 正式发版;vLLM 稳定版仍 v0.28.0(08-26),0.29.0 候选(rc1→rc4,无正式 tag)。

SGLang v0.5.19

新特性:

vLLM(0.29.0 候选 + 安全公告)

0.29.0 候选进度:rc1(09-02,CUTLASS MoE 填充路由越界修复)→ rc4(TRT-LLM ragged prefill 同步 bug)。无正式 tag,稳定版仍为 v0.28.0。

安全公告(运维必读):

原理:Lean attention(AMD)

长 decode batch 时把原本空闲的 CU 利用起来 → MI355X 上 GLM-5.2 分离式 decode 23 ms → 8 ms/输出 token。

启示:decode 是 memory-bound,算力吃不饱;「提高利用率」比「减少 FLOPs」更划算。先判断 compute-bound 还是 memory-bound,再决定优化方向。

我的判断:本周几条主线(Lean attention / LayerNorm SP / Unified Radix Tree)本质都是收回浪费的算力与重复计算——不是算得更快,而是别让空闲的硬件闲着。这条「利用率」线,比任何单点算子的 FLOPs 优化都更值得长期盯。

常驻专题

PD 分离:DCP 上 Blackwell 默认 MLA 后端(trtllm_mla),128K 下 8×B200 纯 TP 约 680 tok/s 撞墙,DCP 随并发继续扩展。

投机解码:DSA v2 / KDA 融合提速;beam search 暂不兼容。

量化:W4A8 MoE on Hopper,DSv4-Flash +12%。

硬件:AMD 本周最大赢家(Lean attention + LayerNorm SP),MI355X 上的 decode 利用被盘活。

Step 适配:无新适配 PR,step-3.7-flash 仍经阿里云百炼直供。

三、AI 论文与产业热点

今日重点(1 句)

Google DeepMind 把「会思考的具身推理模型」与「通用 VLA」拼成 agentic 系统(Gemini Robotics 1.5),通用机器人范式再进一步;同步深挖 DeepSeek V4 的 MoE 门控与 Lookahead 无损解码两大工程利器。

论文核心(Gemini Robotics 1.5 / GR-ER 1.5)

算子讲解:MoE 门控亲和度 Sigmoid → Sqrt(Softplus) + 无辅助损失专家偏置(DeepSeek V4)

性能优化:Lookahead Decoding(前瞻解码,ICML 2024)

产业热点(具身智能公司 / 产业链速递)

四、一句话结论

SGLang v0.5.19 以 786 PR 的密度把端侧量化(+12%)、DeepEP v2 解码进 CUDA graph、投机 kernel 提速送到手上,而 vLLM 还在 0.29.0 候选期里空转、且稳定版带着两则安全公告——本周先扫雷再谈升级;论文侧 Gemini Robotics 1.5 把「思考 VLM + 通用 VLA」钉成 agentic 范式、DeepSeek V4 的 Sqrt(Softplus) 门控与 Lookahead 解码给出可抄的工程作业,而优必选万台交付、智元冲港股、宇树估值回归,正把具身这条主线逐个标上价格。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。