系列:每日AI热点

每日AI热点 · 2026-09-26:vLLM 守 v0.30.0 并切 v0.30.1rc0(补 AMD MI355 NVFP4);Step-5-Preview-BF16 权重低调现 HF 成窗口最值关注国产推理进展;MAE 奠基自监督视觉前端

★ 今日最值得关注

vLLM 稳守年度大版本 v0.30.0(9/21-22,762 commits / 315 贡献者)并切出 v0.30.1rc0(9/23,补 AMD MI355 致密 NVFP4 + MoRI kernel 镜像 #58281),SGLang 仍停留 v0.5.20(main 活跃未发新版);窗口内最值得关注的国产推理生态进展,是阶跃 Step-5-Preview-BF16 权重低调现 HF(TypeSafeAI),社区已给出 vLLM/SGLang --trust-remote-code --reasoning-parser stepfun 的 day-0 命令(⚠️ 归属未确认、数字自报、缺独立基准)。 今天最该进容量规划的一条,是 vLLM 把「硬件量化对等(AMD NVFP4)」也补进了 0.30 线,而 Step 侧在框架正式适配前先以社区权重热身。

这其实和今天 Fast Start(常驻权重缓存守护进程把冷启动从 checkpoint 重载变成一次 IPC 映射)是同一句话的两种写法:框架两头都在「把难扛的东西换成能复用的层」——权重常驻显存、重启只做 IPC 映射;量化下探到 NVFP4 / MXFP8 KV / FP4,让不同硬件走同一条低精度路径。

三层事实:

  1. 版本是什么:vLLM 主线 v0.30.0 仍为 PD 分离生产推荐升级目标(承载 CVE-2026-93436 修复),v0.30.1rc0 仅补 AMD MI355 致密 NVFP4 + MoRI kernel 镜像(#58281),维持与 NVIDIA 量化对等;SGLang 近 72h 无新 tag、仍 v0.5.20。
  2. 冷启动怎么解(延续):Fast Start 常驻每 GPU 权重缓存守护进程——引擎重启经 --load-format ipc_cache 走 CUDA IPC 映射 TP 分片权重,H200 上引擎初始化 28.9s→8.2s、CUDA Graph 捕获 12s→2s,把灰度/自愈/热更的运维成本往下压(本窗口无新改动,但仍是 v0.30 线最该落地的原语)。
  3. 国产推理进展:Step-5-Preview-BF16 权重现 HF(TypeSafeAI),社区给 day-0 命令但归属/数字未确认;Step-3.7-Flash 仍是生产主力(vLLM stepfun37 + MTP > SGLang dev + EAGLE,NVFP4 4 卡)——框架侧正式适配 PR 仍待 Step 开源倒计时(10/15)后涌现。

可执行结论:AMD 用户可上 v0.30.1rc0 的 NVFP4;生产 PD 继续锚定 v0.30.0;想试 Step-5-Preview-BF16 先按社区 day-0 命令小流量验证、别把自报数字当基准;冷启动敏感服务把 Fast Start 写进重启 SOP。

值得强调:Fast Start 把「权重常驻显存、重启只做 IPC 映射」做成原语,正好和本人 OpenInfer / Qwen3-4B DFlash 同源——都是在「复用已有能力、解耦生命周期」上把成本推到更优工作点。Step-5-Preview-BF16 以社区权重先于官方适配冒头,则把 0921「激活参数决定账单」那句话又往前推了一步:27B 激活的 600B 稀疏 MoE 一旦框架侧合入,性价比账要重算。

二、vLLM & SGLang 社区跟踪

版本状态:窗口内 vLLM 主线 v0.30.0(9/21-22,762 commits / 315 贡献者 / 104 新)是 PD 分离生产推荐升级目标;SGLang 近 72h 无新 release,最新稳定版仍为 v0.5.20(9/18,713 PRs / 237 贡献者),main 分支持续活跃(9/25 扩散 SRT 提示增强、kv-hints 信封、sgl-router 重组、移除 HiRadixCache),但无新 tag。

vLLM(v0.30.0 · Fast Start + V4.1-Flash day-0 + HiSparse + 双键水印 → v0.30.1rc0 AMD NVFP4)

版本 / 安全落地:

SGLang(v0.5.20 · 分支点缓存 + sampling masks + DSpark-under-PD + 扩散 SRT 增强)

性能 / 硬件(延续 v0.5.20):

原理:Fast Start(权重生命周期解耦)

我的判断:Fast Start 把「权重常驻显存、重启只做 IPC 映射」做成原语,和本人 OpenInfer / DFlash「复用已算能力」是同一收口逻辑;本窗口 vLLM 又把它和 AMD NVFP4 量化对等补进 0.30 线,等于「生命周期解耦 + 低精度路径」两条降本线都铺平。

常驻专题

PD 分离:vLLM v0.30.0 落地 CVE-2026-93436 修复 + HiSparse,v0.30.1rc0 补 AMD NVFP4;SGLang 维持 DSpark-under-PD(#37709)+ PD 角色热切换(#28403)+ KV 校验和(#39500),本期新增 kv-hints 信封进请求传输层(#38891) 埋 KV 亲和路由新机制;Step 侧暂无官方 PD 配方。

架构演进:vLLM 0.30:Fast Start(重启优化)+ HiSparse(稀疏 MLA 主机 KV 层)+ 双键水印 + MRV2 全 Graph;SGLang 0.5.20:分支点缓存 + sampling mask overlap + DSpark-under-PD + 扩散 SRT 增强;量化下探 NVFP4 / MXFP8 KV / FP4。

PyTorch vs transformers:本窗口无脱离 PR;vLLM --model-impl transformers + SGLang Transformers 后备方案页延续「模型层收敛 transformers、性能层留引擎 kernel」边界重分层;代价仍高,仅超大规模定制划算。

Step 适配:Step-5-Preview-BF16 权重现 HF(TypeSafeAI),社区给 vLLM/SGLang --trust-remote-code --reasoning-parser stepfun day-0 命令(⚠️ 归属未确认、数字自报、缺独立基准);Step-3.7-Flash 仍生产主力(vLLM stepfun37 + MTP > SGLang dev + EAGLE,NVFP4 4 卡)。

三、AI 论文与产业热点

今日重点(1 句)

MAE 把 BERT 式掩码建模搬到视觉(75% 高掩码率 + 非对称编码器-解码器,ViT 经像素重建学到通用表征),成今天 VLA/世界模型视觉前端的基础范式之一;算子侧 GLA(门控线性注意力)把自注意力降到 O(N·d²) 线性、用固定隐状态矩阵替 KV cache;性能侧 NIXL(NVIDIA Inference XL)让 PD 分离下 KV 跨 GPU/CPU/NVMe/网络零拷贝搬运;产业侧智元第 2 万台交付长隆、特斯拉 Optimus 长三角审厂收官首批约 5000 台订单、地瓜机器人 4 亿美元 C 轮直接利好地平线。

论文核心(MAE · He et al., Meta FAIR, CVPR 2022)

算子讲解:GLA(Gated Linear Attention,门控线性注意力)

性能优化:NIXL KV 传输(NVIDIA Inference XL)

产业热点(具身公司 / 产业链速递 · 置顶)

⚠️ 产业动态不构成投资建议。

四、一句话结论

vLLM 稳守年度大版本 v0.30.0(762 commits / 315 贡献者,承载 CVE-2026-93436 修复,PD 分离生产推荐升级目标)并切出 v0.30.1rc0(9/23,补 AMD MI355 致密 NVFP4 + MoRI kernel 镜像 #58281,维持与 NVIDIA 量化对等);SGLang 近 72h 无新 tag、仍 v0.5.20(分支点缓存 DSV4-Flash 命中 43.8%→60.8%、sampling masks overlap Qwen3-8B +17%~+52%、DSpark-under-PD、Simulator 预测 TTFT 误差 ~6%),main 活跃打磨扩散 SRT / kv-hints 信封;窗口内最值关注的国产推理进展是 Step-5-Preview-BF16 权重低调现 HF(社区给 day-0 命令、归属未确认);论文侧 MAE(75% 掩码 + 非对称编解码,ViT-L 87.8% top-1)奠基自监督视觉前端、成 VLA/世界模型「眼睛」源头,算子 GLA 把注意力降到 O(N·d²) 线性、NIXL 让 PD 分离 KV 跨节点零拷贝搬运;产业侧智元第 2 万台交付长隆、特斯拉 Optimus 长三角审厂收官首批约 5000 台订单、地瓜机器人 4 亿美元 C 轮直接利好地平线——具身「补脑 + 落地」继续逐一标价。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。