关于本期来源:今天只有 vLLM / SGLang 社区跟踪摘要,没有对应的 AI 论文与产业热点日报。因此本期只有推理基础设施部分,产业与论文一节从缺。
★ 今日最值得关注
阶跃星辰于 09-20 发布新一代旗舰基座 Step 5 Preview:600B 总参 / 27B 激活超稀疏 MoE、100 万上下文、AA 综合智能指数开源前三,权重定于 10-15 开源——是本期最大进展;它真正该记住的不是「600B 有多大」,而是「阶跃把激活压到 27B(约 4.5%)」,比 GLM-5.3-Flash(18B) / DeepSeek-V4.1-Flash(8-16B) 都更激进。
这是今天最该进你容量规划的一条——因为它把 MoE 部署的账单结构说清楚了:总参只决定权重存储显存,激活参才决定每 token 的 FLOPs 与 KV 增速,部署账单由激活参而非总参决定。
三层事实:
- 模型是什么:Step 5 Preview 走 600B 总参 / 27B 激活超稀疏 MoE,100 万上下文,Artificial Analysis 综合智能指数开源前三;权重 10-15 才开源,当前可部署旗舰仍是 Step-3.7-Flash。
- 部署经济学:总参决定权重存储显存,激活参决定每 token FLOPs 与 KV 增速——账单由激活参定。阶跃把激活压到 27B(约 4.5%),比 GLM-5.3-Flash(18B) / DeepSeek-V4.1-Flash(8-16B) 更激进;EP 分组按 27B 规划、1M 上下文 KV 仍是显存主项、更低激活 → 更高单卡吞吐与更低每 token 成本(即「帕累托边界外推」的落脚点)。
- 待实测的边界:权重 10-15 才开源,上述为架构口径推断,实测数据要等开源后;框架适配(vLLM stepfun / SGLang dev 对 Step 5 的 MTP/EAGLE)也要等开源才落地。
可执行结论:做 MoE 服务时,按激活参而非总参规划 EP 分组与单卡吞吐;100 万上下文下 KV 才是显存天花板,显存预算先留给 KV;10-15 开源后第一时间实测「27B 激活 + 1M KV」的真实成本曲线,再决定压舱石机型。
值得强调:这条和本人 OpenInfer / Qwen3-4B DFlash 同源——都是在「更低激活 + 复用草稿 KV」上把每 token 成本推到更优工作点。阶跃把激活压到 27B,意味着同样的卡能跑更高并发、单位智能更便宜;这正是推测解码在「接受更多 token」之外的另一条降本主线(结构侧降本)。等 Step 5 开源,可实测其超稀疏门控与 DFlash 草稿网络能否叠加出同档 E[L] 抬升。
二、vLLM & SGLang 社区跟踪
本期无 AI 论文与产业热点来源(见开头说明),以下为推理基础设施部分。
版本状态:09-20 → 09-21 窗口内 无新稳定 tag。vLLM 稳定版仍 v0.29.0(09-08,594 commits / 277 人);0.30 线推进到 rc2(09-19,#57570 NIXL notification-only 接收修复),仍 bugfix 打磨、无新大特性。SGLang v0.5.20(09-18,190 commits / 713 PRs / 237 贡献者) 仍是窗口内唯一正式大版本。
vLLM(main · 0.30 线 NIXL 健壮性 + transformers 直跑)
版本 / 安全延续:
- 版本:
v0.30.0rc2实为 #57570(NIXL 不对 notification-only 请求生成 receive report)——属 PD 分离计数 / 稳定性修复;稳定版仍 v0.29.0;v0.29.1rc0(#56122 投机解码双密钥水印)未发正式补丁;0.30 线只补 bugfix。 - 安全(延续):
CVE-2026-93436(≤0.29.0,PD 分离下被拒请求 KV metadata 未释放致内存耗尽,CVSS 8.7,修复#55677)须升 0.29.1+;当前仅 rc0 含修复,生产 PD 部署勿停在 v0.29.0。KV 传输通路已成 PD 主要攻击面,后续每轮固定扫 vulncheck。 - 架构信号:
--model-impl transformers直跑 HF 已成稳定能力——模型定义层收敛 transformers、性能层留引擎 kernel。
SGLang(v0.5.20 · sampling masks overlap + responses opt-in + CUDA12 退役)
新特性 / 重大适配:
- RL 重放:v0.5.20 的
return_sampling_mask(#36630 / #36631)让 RL 训练精确重放 rollout——overlap 调度下 Qwen3-8B decode 吞吐 batch1 +17%、batch64 +52%,把「采样掩码」做成可回放的确定原语。 - 破坏性变更:
/v1/responses存储改 opt-in(#39122,PD 部署不能开);CUDA12 wheels 退役(#38404) + prefill CP v1 移除(Breaking)——旧驱动团队须按基础设施迁移处理。 - 模型:本周期新增 8 模型族(GLM-5.3-Flash / Hy4-Preview / Qwen3.8-Flash-Next / K2 Horizon / Nanbeige4.2 + 扩散 SenseNova-U1.5-8B-MoT / FastH3 / VDN-H3)。
原理:Step 5 Preview 的「激活参决定账单」——600B 总参 / 27B 激活超稀疏 MoE
- 传统误判:看到「600B」就按 600B 估显存与算力——错,总参只决定权重存储显存。
- 正确的账单拆法:总参 → 权重存储显存;激活参 → 每 token 的 FLOPs 与 KV 增速。所以部署账单由激活参而非总参定。
- 阶跃的激进度:把激活压到 27B(约 4.5%),比 GLM-5.3-Flash(18B) / DeepSeek-V4.1-Flash(8-16B) 更激进。含义:EP 按 27B 规划、1M 上下文 KV 仍是显存主项、更低激活 → 更高单卡吞吐与更低每 token 成本——「帕累托边界外推」的落脚点。
- 待实测:权重 10-15 才开源,上述为架构口径推断,等开源后实测「27B 激活 + 1M KV」的真实成本曲线。
我的判断:把「激活参决定账单」记成一条铁律,MoE 选型与压舱石机型都按它重算。它和今天 SGLang
sampling masks overlap(让 RL 重放 rollout、decode +52%)、以及本人 OpenInfer / DFlash 是同一收口逻辑——都在「更低激活 + 复用已算能力」上把每 token 成本推到更优工作点。等 Step 5 开源,可实测其超稀疏门控与 DFlash 草稿网络能否叠加同档 E[L] 抬升。
常驻专题
| 专题 | 今日状态 |
|---|---|
| PD 分离 | vLLM #57570 净化 NIXL 计数;SGLang #37709 DSpark-under-PD + #28403 角色热切换双线领先;/v1/responses opt-in 使 PD 更干净 |
| 架构演进 | SGLang 前缀树分支点缓存 #34565 + sampling masks overlap 调度 + HRRN(−69% TTFT) + DSpark-under-PD;vLLM 0.30 聚焦 autotuning / NIXL bugfix |
| PyTorch vs transformers | 无脱离 PR;边界信号延续(vLLM --model-impl transformers 直跑 HF),模型层 transformers、热点算子自研 |
| Step 适配 | Step 5 Preview 09-20 发布但权重 10-15 开源、框架适配待开源后;当前可部署旗舰仍 Step-3.7-Flash(vLLM stepfun37 MTP > SGLang dev EAGLE,NVFP4 4 卡) |
运维与安全
- 版本底线:
CVE-2026-93436(≤0.29.0,PD 被拒请求 KV metadata 未释放致内存耗尽,CVSS 8.7,修复#55677)须升 0.29.1+(目前仅 rc0 含修复);生产 PD 部署勿停在 v0.29.0。 - 破坏性变更:SGLang CUDA12 wheels 退役(#38404) + prefill CP v1 移除(Breaking);
/v1/responses改 opt-in(#39122,PD 不能开)——旧驱动团队按基础设施迁移处理。
三、一句话结论
阶跃星辰 09-20 发布旗舰 Step 5 Preview(600B 总参 / 27B 激活超稀疏 MoE、100 万上下文、AA 综合智能开源前三,权重 10-15 开源)是本期最大进展,核心不是「600B 有多大」而是「激活压到 27B(约 4.5%)、比 GLM-5.3-Flash/DeepSeek-V4.1-Flash 更激进」——MoE 部署账单由激活参而非总参决定,EP 按 27B 规划、1M KV 才是显存天花板;框架侧 SGLang v0.5.20 的 return_sampling_mask 让 RL 精确重放 rollout(overlap 下 Qwen3-8B decode batch1 +17%/batch64 +52%),/v1/responses 改 opt-in、CUDA12 通道退役 + prefill CP v1 移除(Breaking),本周期新增 8 模型族;vLLM 稳定版仍 v0.29.0 且背 CVE-2026-93436(修复 #55677 需 0.29.1+,目前仅 rc0),结论不变:生产 PD 部署勿停在 v0.29.0,跟 main 或等 0.29.1+;本期无 AI 论文与产业热点日报,论文与产业一节从缺——但「激活参决定账单」这条铁律值得单独记进容量规划。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。