★ 今日最值得关注
SGLang v0.5.20(9/18 22:41 发布,190 commits / 713 PRs / 237 贡献者)——窗口内唯一正式大版本,远超 vLLM 同期还在 rc2 打磨的节奏。 其中 #37709 DSpark under PD 直接关联本人的 OpenInfer / DFlash / DSpark 主线,#34565 SWA 分支点缓存 实测 TTFT −32%。vLLM 这边则是「稳定版原地、发布线补 bugfix」的节奏,且 v0.29.0 仍背着两个 CVE——和前几周「别停在 v0.29.0、跟 main 或等 0.29.1」的结论完全一致。
它和今天的论文主线其实是同一条:框架把草稿 KV 跨节点复用、建模把动作当 token——都是「复用已有能力、推到可用形态」的收口动作。Decision Transformer(2021)正是今天所有 VLA「动作即 token」的思想鼻祖(control = generation)。框架侧让草稿 KV 跑通跨节点、建模侧把动作当 token,底层是同一件事的不同切面。
三层事实:
- SGLang v0.5.20 是窗口内唯一大版本(713 PRs / 237 贡献者 ≫ vLLM 的 rc2 打磨):day-0 新模型一口气铺满——GLM-5.3-Flash(
#36507/#38621)、Hy4-Preview(#36805)、Qwen3.8-Flash-Next(#37500)、K2 Horizon(#37654/#38033)、Nanbeige4.2(#32151)、SenseNova-U1.5-8B-MoT 扩散(#36606)、FastH3(#37480)、VDN-H3(#37903)。不是「补几个 PR」,是「发布节奏明显快于 vLLM」。 - #37709 DSpark under PD(与 OpenInfer/DFlash 同源):一次 DCP1 prefill 把它的 DSpark draft KV 直传给 DCP-N decode,Kimi-Linear 这类混合模型得以在「分离式 + 上下文并行」拓扑里跑 DSpark;8×B300 NIXL / Mooncake 验证至 256K 输入。把草稿 KV 的跨节点传输做成可复用工程范式,和本人 Qwen3-4B DFlash 同源。
- #34565 统一前缀树 SWA 分支点缓存实测 TTFT −32%:共享 system prompt 下 token 命中率 43.8%→60.8%、均值 TTFT 1.57s→1.07s(约 −32%);可选外部 linker(
#37381)经 Mooncake / UMBP 寻址共享全局内存池。再叠 sampling masks overlap 调度(#36630/#36631):Qwen3-8B decode 吞吐 batch1 +17%、batch64 +52%。
可执行结论:如果你跑分离式 PD,SGLang v0.5.20 的 #37709 是「把 DSpark 草稿 KV 传输做成默认路径」的信号——「跨节点复用草稿 KV」直接改写投机解码的拓扑假设;对本人 OpenInfer / Qwen3-4B DFlash,方向一致:跨节点草稿 KV 复用是同一条 tradeoff 的下一个工程形态。vLLM 用户侧:升到 0.29.1+——PD 元数据 CVE-2026-93436(CVSS 8.7)就落在 KV 传输通路上,这是 PD 当前的主要攻击面。
值得单独说:vLLM v0.29.0 仍背着 CVE-2025-30165 和更严重的 CVE-2026-93436(PD 分离被拒请求 metadata 未释放,CVSS 8.7,修复
#55677),后者需升级 0.29.1+。KV 传输通路已成 PD 主要攻击面,后续每轮固定扫 vulncheck。结论很硬:别停在 v0.29.0,跟 main 或等 0.29.1+。
二、vLLM & SGLang 社区跟踪
版本状态:SGLang v0.5.20(9/18 22:41,190 commits / 713 PRs / 237 贡献者)——窗口内唯一正式大版本,发布节奏明显快于 vLLM;vLLM 稳定版仍 v0.29.0(09-08/09-09),发布线推进到 v0.30.0rc2(约 9/19,较 9/18 的 rc1 补 NIXL bugfix #57285),另有 v0.30.0rc1(9/18)、v0.29.1rc0(9/13)、proto-v0.2.0(9/17)。本期增量主要来自 main 分支 + SGLang 正式发版,vLLM 无新稳定特性。
vLLM(main · 0.30 线 BF16 autotuning + NIXL 健壮性)
版本 / 特性延续:
- 版本:稳定版仍 v0.29.0;发布线推进到 v0.30.0rc2(rc1→rc2 仅补 NIXL bugfix
#57285);0.30 线聚焦 FlashInfer BF16 autotuning 隔离 与 NIXL 健壮性,无新稳定特性;--model-impl transformers直跑 HF 实现仍是主线信号。 - 安全(延续 9/18):v0.29.0 受
CVE-2025-30165(1 条);CVE-2026-93436(CVSS 8.7,PD 分离被拒请求 metadata 未释放,修复#55677)需升级 0.29.1+。KV 传输通路已成 PD 主要攻击面,后续每轮固定扫 vulncheck。
SGLang(v0.5.20 · day-0 模型 + DSpark-under-PD + SWA 缓存)
新特性 / 重大适配:
- day-0 新模型:GLM-5.3-Flash(
#36507/#38621)、Hy4-Preview(#36805)、Qwen3.8-Flash-Next(#37500)、K2 Horizon(#37654/#38033)、Nanbeige4.2(#32151)、SenseNova-U1.5-8B-MoT 扩散(#36606)、FastH3(#37480)、VDN-H3(#37903);影响=新模型 day-0 支持仍由 SGLang 领跑。 - Sampling masks(
#36630/#36631):return_sampling_mask每步返回抽样支撑集 + logp,RL 训练器可重放 rollout 无需重建 top-k/top-p;overlap 调度下 Qwen3-8B decode 吞吐 batch1 +17%、batch64 +52%。 - 统一前缀树 SWA 分支点缓存(
#34565):共享 system prompt 下 token 命中率 43.8%→60.8%、均值 TTFT 1.57s→1.07s(约 −32%);可选外部 linker(#37381)经 Mooncake / UMBP 寻址共享全局内存池。 - DSpark under PD(
#37709):DCP1 prefill 把 DSpark draft KV 传给 DCP-N decode;Kimi-Linear 在分离式 + 上下文并行拓扑跑 DSpark;8×B300 NIXL / Mooncake 验证至 256K 输入。 - 其他:Responses API storage 改 opt-in(
#39122,PD 部署不能开);SGLang Simulator(#33824,纯 CPU 预测 TTFT 误差 ~6%);移除 strategy-based prefill CP v1。
原理:#37709 DSpark under PD(草稿 KV 跨节点复用,与 OpenInfer/DFlash 同源)
- 传统做法:DSpark 在 PD 分离下只在 decode 侧跑投机,prefill 与 decode 各管各的 KV。
- #37709 的改写:让一次 DCP1 prefill 把它的 DSpark draft KV 直接 transfer 给 DCP-N decode,使 Kimi-Linear 这类混合模型能在「分离式 + 上下文并行」拓扑里跑 DSpark——把草稿 KV 的跨节点传输变成可复用工程范式,与 OpenInfer / DFlash(Qwen3-4B)同源。
- 我的判断:价值不在「重发一遍 KV」,而在「把草稿 KV 传输做成默认路径原语」——和 0913 的「VRAM 分层池化」、0916 的「DFlash2 抬 E[L]」、0917 的「融合 kernel + NVFP4 压缩 KV」同源:都在 tradeoff 上找最优工作点。对本人 OpenInfer / Qwen3-4B DFlash,下一步应实测「DCP1→DCP-N 草稿 KV 传输」能否在单卡上复现同样的 E[L] 抬升。
常驻专题
PD 分离:SGLang 双线领先——#37709 DSpark-under-PD(DCP1→DCP-N 草稿 KV 传输)+ 前一日 #28403 角色热切换(KV pool 角色无关)。vLLM 侧 0.30 线继续 NIXL bugfix。
架构演进:SGLang 统一前缀树 + SWA 分支点缓存(#34565,命中率 +17pp / TTFT −32%)+ sampling masks overlap 调度(#36630/#36631,decode +17~52%);vLLM 0.30 聚焦 autotuning / bugfix。
PyTorch vs transformers:边界重新分层——vLLM --model-impl transformers 直跑 HF;SGLang 新模型仍以「cookbook + HF 权重」双轨。结论:模型定义层收敛 transformers,性能层留引擎 kernel。
Step 适配:框架侧无新合入;Step-3.7-Flash(198B/11B/256K/~400TPS)部署仍 vLLM stepfun37+MTP 一等公民 > SGLang dev+EAGLE,NVFP4 4 卡;IPO 仍未见正式递表。
三、AI 论文与产业热点
今日重点(1 句)
陈丽丽等的 Decision Transformer(UC Berkeley/FAIR,arXiv:2106.01345,2021)把强化学习重构成「条件序列建模」——control=generation,是今天所有 VLA(RT-2/π0/OpenVLA)「动作即 token」的思想鼻祖,宇树/优必选/智元/小鹏的「大脑」都是其放大版;与此同时 FP8 与 SmoothQuant 补全量化链路,产业面「特斯拉 Optimus 中国审厂冲千台/周、但 Counterpoint 称 2026H1 全球出货 2.2 万台仅 13% 真进厂」正是同一条「本体补脑、落地滞后」瓶颈的另一面——而宇树发 UnifoLM-WLA-1.0、优必选柳州工厂投产、地瓜机器人 4 亿美元 C 轮(利好 09660.HK),正把具身「补脑 + 落地」逐一标价。
论文核心(Decision Transformer · Chen et al., arXiv:2106.01345)
- 一句话定位:把强化学习重构成「条件序列建模」——不拟合价值函数、不算策略梯度,而是用 GPT 式因果 Transformer 以 Return-to-Go(RTG,未来累计回报) 为 prompt 自回归生成动作,数学上 control = generation。
- 离线 RL 天然适配:无 bootstrapping、无价值高估、稀疏奖励不崩,在 Atari/Gym/Key-to-Door 匹配或超越 CQL/BCQ。
- VLA 血统:它是今天所有 VLA「把动作当 token」的思想鼻祖——RT-2、π0、OpenVLA 都是其直系;宇树/优必选/智元/小鹏的「大脑」则是其工程放大版。框架侧让草稿 KV 跨节点复用、建模侧把动作当 token,底层是同一收口逻辑。
算子讲解:FP8 数据格式与量化
- 定位:8-bit 浮点,Hopper/Blackwell 上 matmul 吞吐是 FP16 的 2×、带宽/显存减半。E4M3(前向/权重)与 E5M2(梯度)两种格式,靠 per-tensor/per-block scaling + 随机舍入 落地,MXFP8 用一组元素共享 scale。
- 使用:DeepSeek V4/V4.1、Qwen3、MiniMax 大规模使用。
- 区分:与「性能优化」栏讲过的 GPTQ/AWQ(权重-only INT 量化)不同,FP8 是 matmul 本身低精度——正是 0917 的
#56935融合 kernel + NVFP4 压缩 KV、以及 SGLang FP4 packing 所落在的「更低精度」主线。
性能优化:SmoothQuant(arXiv:2211.10438)
- 问题:LLM 激活少数通道数值极大(离群值),导致激活无法量化。
- 方法:用平滑因子
s_j = max(|X_j|)^α / max(|W_j|)^(1-α)把离群值从激活「转移」到权重,使双方都落入 INT8,做到 W8A8 而精度损失 <1%、推理提速约 1.5–2×。 - 定位:它是 INT8 第一步,FP8 是更激进的下一站。与 0917「把调度成本移进 kernel、用更低精度 KV」同源——都在把精度账做薄。
产业热点(具身公司 / 产业链速递 · 置顶)
- 【具身】特斯拉 Optimus:中国供应链审厂(宁波/上海,9 月底冲 1000 台/周、2026 约 5 万台),丰田拟 40 万台 进厂。
- 【具身】Counterpoint:2026H1 全球人形出货 2.2 万台(+300%)、前五全中国,但 60%+ 在「表演」、真进厂仅 13% → 与「中标 ≠ 商业收入」同线。
- 【具身】宇树 688836:发 UnifoLM-WLA-1.0 基础模型(6B / 64 任务 / 7 项开源最佳)。
- 【具身】优必选 09880.HK:柳州万台级工厂投产、U1 启动交付。
- 【具身】地瓜机器人(地平线分拆):4 亿美元 C 轮 → 利好 09660.HK。
- 【具身】:它石/松延/智元「集体补脑」;机器人峰会杭州;监管对次新爆炒出手。
- 【通用】:智谱 50 亿美元 融资、华为昇腾 960、OpenAI 对齐失效实录、10Y 美债破 5%。
⚠️ 产业动态不构成投资建议。
四、一句话结论
框架侧 SGLang v0.5.20(9/18,713 PRs / 237 贡献者,窗口内唯一大版本)——#37709 DSpark under PD 让一次 DCP1 prefill 把草稿 KV 直传 DCP-N decode(与 OpenInfer/DFlash Qwen3-4B 同源),#34565 SWA 分支点缓存实测 TTFT −32%,sampling masks overlap 调度 decode +17~52%;vLLM 稳定版仍 v0.29.0 但带两个 CVE(含 PD 元数据 CVE-2026-93436 CVSS 8.7,修复 #55677,需 0.29.1+)、发布线推进到 v0.30.0rc2——结论不变:别停在 v0.29.0,跟 main 或等 0.29.1+。论文侧 Decision Transformer(arXiv:2106.01345)把强化学习重构成条件序列建模(control=generation),立起今天所有 VLA「动作即 token」思想鼻祖,FP8 与 SmoothQuant 补全量化链路;产业侧特斯拉 Optimus 中国审厂冲千台/周、但 Counterpoint 称 2026H1 仅 13% 真进厂,宇树发 UnifoLM-WLA-1.0、优必选柳州工厂投产、地瓜机器人 4 亿美元 C 轮利好 09660.HK——把具身「补脑 + 落地」逐一标价。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。