系列:每日AI热点

每日AI热点 · 2026-09-19:SGLang v0.5.20 发布(713 PR / 237 人),#37709 DSpark under PD 打通草稿 KV 跨节点复用;Decision Transformer 立起 VLA「动作即 token」思想鼻祖

★ 今日最值得关注

SGLang v0.5.20(9/18 22:41 发布,190 commits / 713 PRs / 237 贡献者)——窗口内唯一正式大版本,远超 vLLM 同期还在 rc2 打磨的节奏。 其中 #37709 DSpark under PD 直接关联本人的 OpenInfer / DFlash / DSpark 主线,#34565 SWA 分支点缓存 实测 TTFT −32%。vLLM 这边则是「稳定版原地、发布线补 bugfix」的节奏,且 v0.29.0 仍背着两个 CVE——和前几周「别停在 v0.29.0、跟 main 或等 0.29.1」的结论完全一致。

它和今天的论文主线其实是同一条:框架把草稿 KV 跨节点复用、建模把动作当 token——都是「复用已有能力、推到可用形态」的收口动作。Decision Transformer(2021)正是今天所有 VLA「动作即 token」的思想鼻祖(control = generation)。框架侧让草稿 KV 跑通跨节点、建模侧把动作当 token,底层是同一件事的不同切面。

三层事实:

  1. SGLang v0.5.20 是窗口内唯一大版本(713 PRs / 237 贡献者 ≫ vLLM 的 rc2 打磨):day-0 新模型一口气铺满——GLM-5.3-Flash(#36507/#38621)、Hy4-Preview(#36805)、Qwen3.8-Flash-Next(#37500)、K2 Horizon(#37654/#38033)、Nanbeige4.2(#32151)、SenseNova-U1.5-8B-MoT 扩散(#36606)、FastH3(#37480)、VDN-H3(#37903)。不是「补几个 PR」,是「发布节奏明显快于 vLLM」。
  2. #37709 DSpark under PD(与 OpenInfer/DFlash 同源):一次 DCP1 prefill 把它的 DSpark draft KV 直传给 DCP-N decode,Kimi-Linear 这类混合模型得以在「分离式 + 上下文并行」拓扑里跑 DSpark;8×B300 NIXL / Mooncake 验证至 256K 输入。把草稿 KV 的跨节点传输做成可复用工程范式,和本人 Qwen3-4B DFlash 同源。
  3. #34565 统一前缀树 SWA 分支点缓存实测 TTFT −32%:共享 system prompt 下 token 命中率 43.8%→60.8%、均值 TTFT 1.57s→1.07s(约 −32%);可选外部 linker(#37381)经 Mooncake / UMBP 寻址共享全局内存池。再叠 sampling masks overlap 调度(#36630/#36631):Qwen3-8B decode 吞吐 batch1 +17%、batch64 +52%。

可执行结论:如果你跑分离式 PD,SGLang v0.5.20 的 #37709 是「把 DSpark 草稿 KV 传输做成默认路径」的信号——「跨节点复用草稿 KV」直接改写投机解码的拓扑假设;对本人 OpenInfer / Qwen3-4B DFlash,方向一致:跨节点草稿 KV 复用是同一条 tradeoff 的下一个工程形态。vLLM 用户侧:升到 0.29.1+——PD 元数据 CVE-2026-93436(CVSS 8.7)就落在 KV 传输通路上,这是 PD 当前的主要攻击面。

值得单独说:vLLM v0.29.0 仍背着 CVE-2025-30165 和更严重的 CVE-2026-93436(PD 分离被拒请求 metadata 未释放,CVSS 8.7,修复 #55677),后者需升级 0.29.1+。KV 传输通路已成 PD 主要攻击面,后续每轮固定扫 vulncheck。结论很硬:别停在 v0.29.0,跟 main 或等 0.29.1+。

二、vLLM & SGLang 社区跟踪

版本状态:SGLang v0.5.20(9/18 22:41,190 commits / 713 PRs / 237 贡献者)——窗口内唯一正式大版本,发布节奏明显快于 vLLM;vLLM 稳定版仍 v0.29.0(09-08/09-09),发布线推进到 v0.30.0rc2(约 9/19,较 9/18 的 rc1 补 NIXL bugfix #57285),另有 v0.30.0rc1(9/18)、v0.29.1rc0(9/13)、proto-v0.2.0(9/17)。本期增量主要来自 main 分支 + SGLang 正式发版,vLLM 无新稳定特性。

vLLM(main · 0.30 线 BF16 autotuning + NIXL 健壮性)

版本 / 特性延续:

SGLang(v0.5.20 · day-0 模型 + DSpark-under-PD + SWA 缓存)

新特性 / 重大适配:

原理:#37709 DSpark under PD(草稿 KV 跨节点复用,与 OpenInfer/DFlash 同源)

常驻专题

PD 分离:SGLang 双线领先——#37709 DSpark-under-PD(DCP1→DCP-N 草稿 KV 传输)+ 前一日 #28403 角色热切换(KV pool 角色无关)。vLLM 侧 0.30 线继续 NIXL bugfix。

架构演进:SGLang 统一前缀树 + SWA 分支点缓存(#34565,命中率 +17pp / TTFT −32%)+ sampling masks overlap 调度(#36630/#36631,decode +17~52%);vLLM 0.30 聚焦 autotuning / bugfix。

PyTorch vs transformers:边界重新分层——vLLM --model-impl transformers 直跑 HF;SGLang 新模型仍以「cookbook + HF 权重」双轨。结论:模型定义层收敛 transformers,性能层留引擎 kernel。

Step 适配:框架侧无新合入;Step-3.7-Flash(198B/11B/256K/~400TPS)部署仍 vLLM stepfun37+MTP 一等公民 > SGLang dev+EAGLE,NVFP4 4 卡;IPO 仍未见正式递表。

三、AI 论文与产业热点

今日重点(1 句)

陈丽丽等的 Decision Transformer(UC Berkeley/FAIR,arXiv:2106.01345,2021)把强化学习重构成「条件序列建模」——control=generation,是今天所有 VLA(RT-2/π0/OpenVLA)「动作即 token」的思想鼻祖,宇树/优必选/智元/小鹏的「大脑」都是其放大版;与此同时 FP8 与 SmoothQuant 补全量化链路,产业面「特斯拉 Optimus 中国审厂冲千台/周、但 Counterpoint 称 2026H1 全球出货 2.2 万台仅 13% 真进厂」正是同一条「本体补脑、落地滞后」瓶颈的另一面——而宇树发 UnifoLM-WLA-1.0、优必选柳州工厂投产、地瓜机器人 4 亿美元 C 轮(利好 09660.HK),正把具身「补脑 + 落地」逐一标价。

论文核心(Decision Transformer · Chen et al., arXiv:2106.01345)

算子讲解:FP8 数据格式与量化

性能优化:SmoothQuant(arXiv:2211.10438)

产业热点(具身公司 / 产业链速递 · 置顶)

⚠️ 产业动态不构成投资建议。

四、一句话结论

框架侧 SGLang v0.5.20(9/18,713 PRs / 237 贡献者,窗口内唯一大版本)——#37709 DSpark under PD 让一次 DCP1 prefill 把草稿 KV 直传 DCP-N decode(与 OpenInfer/DFlash Qwen3-4B 同源),#34565 SWA 分支点缓存实测 TTFT −32%,sampling masks overlap 调度 decode +17~52%;vLLM 稳定版仍 v0.29.0 但带两个 CVE(含 PD 元数据 CVE-2026-93436 CVSS 8.7,修复 #55677,需 0.29.1+)、发布线推进到 v0.30.0rc2——结论不变:别停在 v0.29.0,跟 main 或等 0.29.1+。论文侧 Decision Transformer(arXiv:2106.01345)把强化学习重构成条件序列建模(control=generation),立起今天所有 VLA「动作即 token」思想鼻祖,FP8 与 SmoothQuant 补全量化链路;产业侧特斯拉 Optimus 中国审厂冲千台/周、但 Counterpoint 称 2026H1 仅 13% 真进厂,宇树发 UnifoLM-WLA-1.0、优必选柳州工厂投产、地瓜机器人 4 亿美元 C 轮利好 09660.HK——把具身「补脑 + 落地」逐一标价。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。