系列:每日AI热点

每日AI热点 · 2026-09-21:阶跃 Step 5 Preview 发布(600B/27B 超稀疏 MoE、100 万上下文,10-15 开源);SGLang v0.5.20 sampling masks overlap 让 RL 重放 rollout,Qwen3-8B decode +52%

关于本期来源:今天只有 vLLM / SGLang 社区跟踪摘要,没有对应的 AI 论文与产业热点日报。因此本期只有推理基础设施部分,产业与论文一节从缺。

★ 今日最值得关注

阶跃星辰于 09-20 发布新一代旗舰基座 Step 5 Preview:600B 总参 / 27B 激活超稀疏 MoE、100 万上下文、AA 综合智能指数开源前三,权重定于 10-15 开源——是本期最大进展;它真正该记住的不是「600B 有多大」,而是「阶跃把激活压到 27B(约 4.5%)」,比 GLM-5.3-Flash(18B) / DeepSeek-V4.1-Flash(8-16B) 都更激进。

这是今天最该进你容量规划的一条——因为它把 MoE 部署的账单结构说清楚了:总参只决定权重存储显存,激活参才决定每 token 的 FLOPs 与 KV 增速,部署账单由激活参而非总参决定。

三层事实:

  1. 模型是什么:Step 5 Preview 走 600B 总参 / 27B 激活超稀疏 MoE,100 万上下文,Artificial Analysis 综合智能指数开源前三;权重 10-15 才开源,当前可部署旗舰仍是 Step-3.7-Flash。
  2. 部署经济学:总参决定权重存储显存,激活参决定每 token FLOPs 与 KV 增速——账单由激活参定。阶跃把激活压到 27B(约 4.5%),比 GLM-5.3-Flash(18B) / DeepSeek-V4.1-Flash(8-16B) 更激进;EP 分组按 27B 规划、1M 上下文 KV 仍是显存主项、更低激活 → 更高单卡吞吐与更低每 token 成本(即「帕累托边界外推」的落脚点)。
  3. 待实测的边界:权重 10-15 才开源,上述为架构口径推断,实测数据要等开源后;框架适配(vLLM stepfun / SGLang dev 对 Step 5 的 MTP/EAGLE)也要等开源才落地。

可执行结论:做 MoE 服务时,按激活参而非总参规划 EP 分组与单卡吞吐;100 万上下文下 KV 才是显存天花板,显存预算先留给 KV;10-15 开源后第一时间实测「27B 激活 + 1M KV」的真实成本曲线,再决定压舱石机型。

值得强调:这条和本人 OpenInfer / Qwen3-4B DFlash 同源——都是在「更低激活 + 复用草稿 KV」上把每 token 成本推到更优工作点。阶跃把激活压到 27B,意味着同样的卡能跑更高并发、单位智能更便宜;这正是推测解码在「接受更多 token」之外的另一条降本主线(结构侧降本)。等 Step 5 开源,可实测其超稀疏门控与 DFlash 草稿网络能否叠加出同档 E[L] 抬升。

二、vLLM & SGLang 社区跟踪

本期无 AI 论文与产业热点来源(见开头说明),以下为推理基础设施部分。

版本状态:09-20 → 09-21 窗口内 无新稳定 tag。vLLM 稳定版仍 v0.29.0(09-08,594 commits / 277 人);0.30 线推进到 rc2(09-19,#57570 NIXL notification-only 接收修复),仍 bugfix 打磨、无新大特性。SGLang v0.5.20(09-18,190 commits / 713 PRs / 237 贡献者) 仍是窗口内唯一正式大版本。

vLLM(main · 0.30 线 NIXL 健壮性 + transformers 直跑)

版本 / 安全延续:

SGLang(v0.5.20 · sampling masks overlap + responses opt-in + CUDA12 退役)

新特性 / 重大适配:

原理:Step 5 Preview 的「激活参决定账单」——600B 总参 / 27B 激活超稀疏 MoE

我的判断:把「激活参决定账单」记成一条铁律,MoE 选型与压舱石机型都按它重算。它和今天 SGLang sampling masks overlap(让 RL 重放 rollout、decode +52%)、以及本人 OpenInfer / DFlash 是同一收口逻辑——都在「更低激活 + 复用已算能力」上把每 token 成本推到更优工作点。等 Step 5 开源,可实测其超稀疏门控与 DFlash 草稿网络能否叠加同档 E[L] 抬升。

常驻专题

专题今日状态
PD 分离vLLM #57570 净化 NIXL 计数;SGLang #37709 DSpark-under-PD + #28403 角色热切换双线领先;/v1/responses opt-in 使 PD 更干净
架构演进SGLang 前缀树分支点缓存 #34565 + sampling masks overlap 调度 + HRRN(−69% TTFT) + DSpark-under-PD;vLLM 0.30 聚焦 autotuning / NIXL bugfix
PyTorch vs transformers无脱离 PR;边界信号延续(vLLM --model-impl transformers 直跑 HF),模型层 transformers、热点算子自研
Step 适配Step 5 Preview 09-20 发布但权重 10-15 开源、框架适配待开源后;当前可部署旗舰仍 Step-3.7-Flash(vLLM stepfun37 MTP > SGLang dev EAGLE,NVFP4 4 卡)

运维与安全

三、一句话结论

阶跃星辰 09-20 发布旗舰 Step 5 Preview(600B 总参 / 27B 激活超稀疏 MoE、100 万上下文、AA 综合智能开源前三,权重 10-15 开源)是本期最大进展,核心不是「600B 有多大」而是「激活压到 27B(约 4.5%)、比 GLM-5.3-Flash/DeepSeek-V4.1-Flash 更激进」——MoE 部署账单由激活参而非总参决定,EP 按 27B 规划、1M KV 才是显存天花板;框架侧 SGLang v0.5.20 的 return_sampling_mask 让 RL 精确重放 rollout(overlap 下 Qwen3-8B decode batch1 +17%/batch64 +52%),/v1/responses 改 opt-in、CUDA12 通道退役 + prefill CP v1 移除(Breaking),本周期新增 8 模型族;vLLM 稳定版仍 v0.29.0 且背 CVE-2026-93436(修复 #55677 需 0.29.1+,目前仅 rc0),结论不变:生产 PD 部署勿停在 v0.29.0,跟 main 或等 0.29.1+;本期无 AI 论文与产业热点日报,论文与产业一节从缺——但「激活参决定账单」这条铁律值得单独记进容量规划。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。