★ 今日最值得关注
SGLang 发 v0.5.19(786 PR / 214 贡献者,本周最大特性包),vLLM 卡在 0.29.0 候选期且稳定版曝两则安全公告——「谁更稳」本周答案很清楚。
三层事实:
- SGLang v0.5.19(09-05)正式发版:端侧 / Hopper 量化(W4A8 MoE +12%)、DeepEP v2 让 decode 跑进 CUDA graph(含跨节点)、LayerNorm 序列并行省 prefill、投机 kernel 提速 1.3–1.8×(DSA)/ MTP verify-and-commit −45%~63%。
- vLLM 仍停在 0.29.0 候选期:rc1(09-02,CUTLASS MoE 填充路由越界修复)→ rc4(TRT-LLM ragged prefill 同步 bug),始终没有正式 tag,稳定版还是 08-26 的 v0.28.0。
- 而 vLLM 稳定版带着两则安全公告:视频解码器显存耗尽(PyNvVideoCodec GPU 后端即使软解启动也会吃显存,未鉴权调用可崩溃 worker)+ chat-audio 解压炸弹(影响 >= 0.24.0)。
可执行结论:跑多模态的 vLLM 用户先补安全(升级修补版 + 强制鉴权 / 配额 + 拒绝调用方控制的解码后端 + 多模态路由单独限流);要不要切到 SGLang v0.5.19 的新特性,等 0.29.0 正式发版再比——现在 vLLM 的「新东西」都在候选期里,不该上生产。
值得单独说:本周的对比很典型——SGLang 在发版节奏和特性密度上都压了 vLLM 一头,但 vLLM 的隐患在「已发布的稳定版」里。前者是「等不等得到」,后者是「已经在线上的雷」。优先扫雷。
二、vLLM & SGLang 社区跟踪
版本状态:SGLang v0.5.19(09-05) 正式发版;vLLM 稳定版仍 v0.28.0(08-26),0.29.0 候选(rc1→rc4,无正式 tag)。
SGLang v0.5.19
新特性:
- W4A8 MoE on Hopper:MXFP4 专家 + FP8 激活,DeepSeek-V4-Flash 输出吞吐 +12%,GSM8K 精度不变(需 FlashInfer 0.6.18)。
- DeepEP v2:
--moe-a2a-backend deepep_v2,ElasticBuffer 固定 buffer → decode 可跑 CUDA graph(含跨节点)。 - LayerNorm 序列并行:
--enable-layernorm-sp,Qwen3-8B prefill H100 −3.5% / B200 −5.6%,TP 越大省越多。 - 投机 kernel 提速:DSA prefill top-k v2,B200 1.3–1.8×;KDA 融合接受
SGLANG_OPT_KDA_FUSED_ACCEPT_STATE=1,MTP verify-and-commit −45%~63%,逐位一致。 - Unified Radix Tree 默认化(破坏性变更 #35081)。
- Beam search:传
beam_width拿回 n 条最优序列;暂不与投机解码 / PD 分离 / DP attention / HiCache 混用(#31626)。 - 新模型:Qwen3.8(2.4T-A95B)、Qwen3.8-27B、dots3.note、Ling-3.0-flash/tiny、Spark2.5、MiniCPM-SALA、Granite 4.2、LongCat-Image-Edit。
vLLM(0.29.0 候选 + 安全公告)
0.29.0 候选进度:rc1(09-02,CUTLASS MoE 填充路由越界修复)→ rc4(TRT-LLM ragged prefill 同步 bug)。无正式 tag,稳定版仍为 v0.28.0。
安全公告(运维必读):
- 视频解码器显存耗尽:请求经
media_io_kwargs.video.video_backend选中 PyNvVideoCodec GPU 后端,即使服务端以软解启动、未预留显存;未鉴权调用可致 worker 崩溃。 - chat-audio 解压炸弹:影响 >= 0.24.0。
- 缓解:升级修补版;强制鉴权 + 配额、拒绝调用方控制的解码后端、反向代理限制请求体、多模态路由单独限流。
原理:Lean attention(AMD)
长 decode batch 时把原本空闲的 CU 利用起来 → MI355X 上 GLM-5.2 分离式 decode 23 ms → 8 ms/输出 token。
启示:decode 是 memory-bound,算力吃不饱;「提高利用率」比「减少 FLOPs」更划算。先判断 compute-bound 还是 memory-bound,再决定优化方向。
我的判断:本周几条主线(Lean attention / LayerNorm SP / Unified Radix Tree)本质都是收回浪费的算力与重复计算——不是算得更快,而是别让空闲的硬件闲着。这条「利用率」线,比任何单点算子的 FLOPs 优化都更值得长期盯。
常驻专题
PD 分离:DCP 上 Blackwell 默认 MLA 后端(trtllm_mla),128K 下 8×B200 纯 TP 约 680 tok/s 撞墙,DCP 随并发继续扩展。
投机解码:DSA v2 / KDA 融合提速;beam search 暂不兼容。
量化:W4A8 MoE on Hopper,DSv4-Flash +12%。
硬件:AMD 本周最大赢家(Lean attention + LayerNorm SP),MI355X 上的 decode 利用被盘活。
Step 适配:无新适配 PR,step-3.7-flash 仍经阿里云百炼直供。
三、AI 论文与产业热点
今日重点(1 句)
Google DeepMind 把「会思考的具身推理模型」与「通用 VLA」拼成 agentic 系统(Gemini Robotics 1.5),通用机器人范式再进一步;同步深挖 DeepSeek V4 的 MoE 门控与 Lookahead 无损解码两大工程利器。
论文核心(Gemini Robotics 1.5 / GR-ER 1.5)
- 一句话定位:组合「具身推理思考模型 GR-ER 1.5(VLM)」与「通用 VLA GR 1.5」,让机器人先规划 / 思考、再行动,并跨本体零样本迁移技能。
- 核心思想(3 行):① Motion Transfer 用 ALOHA / 双臂 Franka / Apollo 人形异构数据联合训练,统一运动表示 → 零样本跨本体迁移;② Embodied Thinking 在输出动作前生成自然语言思考轨迹 h_{1:t-1} 拼回上下文(a_t = f_VLA(o_t, i, h, θ));③ GR-ER 1.5 在 15 个具身推理基准登顶 SOTA。
- 影响:agentic 系统长时程任务进度分接近 80%(单独 Thinking VLA 仅 44%),强化「大脑 = VLM 推理 + VLA 动作」范式,利好具身智能软件 / 数据 / 模型层。
算子讲解:MoE 门控亲和度 Sigmoid → Sqrt(Softplus) + 无辅助损失专家偏置(DeepSeek V4)
- 定位:同时解路由打分与负载均衡。
- 公式:V4 用 s_i = √(softplus(u·e_i)) 替代 V3 的 σ(u·e_i)(防大 logit 饱和 → 梯度消失);无辅助损失偏置 b_i 仅加路由打分、每步 过载 −= γ / 欠载 += γ 闭环(零梯度);共享专家吸收通用常识。
- 在用:DeepSeek V4 / V4-Pro(384 routed + 1 shared、激活 6)、Qwen3-MoE、MiniMax;坑:偏置 buffer 须
requires_grad=False且与优化器解耦,Top-K 用偏置分数、gate 用原始分数(两分数分离是关键)。
性能优化:Lookahead Decoding(前瞻解码,ICML 2024)
- 定位:解自回归串行时延瓶颈,且不依赖草稿模型 / 数据存储。
- 机制:把解码视作非线性方程组、Jacobi 定点迭代并行预测;Lookahead 分支(2D 窗口 W×N 收集 n-gram)+ Verification 分支(并行验证接受最长前缀);无损,解码步数 ∝ log(FLOPs/步)。
- 收益:单卡 1.5–2.3×(MT-bench 1.8×),代码多卡 Lookahead Parallelism 达 4×,兼容 FlashAttention 再 +20%;具身关联:缩短 VLA 动作解码时延、无需草稿模型易部署端侧。
产业热点(具身智能公司 / 产业链速递)
- 优必选(09880.HK)|9/16 启动 U1 万台级量产交付(订单 13361、全年 > 1 万台,行业最大单一批量)|利好整机 + 执行器/减速器(三花 002050 / 拓普 601689 / 绿的 688017)。
- 智元机器人(冲港股 IPO 400–500 亿港元)|上半年出货 9700 登顶全球第一、工业订单绑定(龙旗 / 富临精工)|映射上纬新材(688585 · 智元控股)。
- 宇树科技(688836)|上市后市值蒸发超 2100 亿、股价腰斩属估值回归(2025 营收 +335%、扣非净利 6 亿非恶化)|监控标的提示高波动。
- 量产元年成色:2026H1 全球人形出货 2.2 万(+300%) / 中国占 97%,但真实「干活」< 20%,估值由技术 Beta 转交付 Alpha。
- 模型 / 资本:Gemini Robotics 1.5 发布;DeepSeek V4 成推理标杆;人形赛道半年融资破千亿。
四、一句话结论
SGLang v0.5.19 以 786 PR 的密度把端侧量化(+12%)、DeepEP v2 解码进 CUDA graph、投机 kernel 提速送到手上,而 vLLM 还在 0.29.0 候选期里空转、且稳定版带着两则安全公告——本周先扫雷再谈升级;论文侧 Gemini Robotics 1.5 把「思考 VLM + 通用 VLA」钉成 agentic 范式、DeepSeek V4 的 Sqrt(Softplus) 门控与 Lookahead 解码给出可抄的工程作业,而优必选万台交付、智元冲港股、宇树估值回归,正把具身这条主线逐个标上价格。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。