★ 今日最值得关注
vLLM 稳守年度大版本 v0.30.0(9/21-22,762 commits / 315 贡献者)并切出 v0.30.1rc0(9/23,补 AMD MI355 致密 NVFP4 + MoRI kernel 镜像 #58281),SGLang 仍停留 v0.5.20(main 活跃未发新版);窗口内最值得关注的国产推理生态进展,是阶跃 Step-5-Preview-BF16 权重低调现 HF(TypeSafeAI),社区已给出 vLLM/SGLang --trust-remote-code --reasoning-parser stepfun 的 day-0 命令(⚠️ 归属未确认、数字自报、缺独立基准)。 今天最该进容量规划的一条,是 vLLM 把「硬件量化对等(AMD NVFP4)」也补进了 0.30 线,而 Step 侧在框架正式适配前先以社区权重热身。
这其实和今天 Fast Start(常驻权重缓存守护进程把冷启动从 checkpoint 重载变成一次 IPC 映射)是同一句话的两种写法:框架两头都在「把难扛的东西换成能复用的层」——权重常驻显存、重启只做 IPC 映射;量化下探到 NVFP4 / MXFP8 KV / FP4,让不同硬件走同一条低精度路径。
三层事实:
- 版本是什么:vLLM 主线 v0.30.0 仍为 PD 分离生产推荐升级目标(承载 CVE-2026-93436 修复),v0.30.1rc0 仅补 AMD MI355 致密 NVFP4 + MoRI kernel 镜像(
#58281),维持与 NVIDIA 量化对等;SGLang 近 72h 无新 tag、仍 v0.5.20。 - 冷启动怎么解(延续):Fast Start 常驻每 GPU 权重缓存守护进程——引擎重启经
--load-format ipc_cache走 CUDA IPC 映射 TP 分片权重,H200 上引擎初始化 28.9s→8.2s、CUDA Graph 捕获 12s→2s,把灰度/自愈/热更的运维成本往下压(本窗口无新改动,但仍是 v0.30 线最该落地的原语)。 - 国产推理进展:Step-5-Preview-BF16 权重现 HF(TypeSafeAI),社区给 day-0 命令但归属/数字未确认;Step-3.7-Flash 仍是生产主力(vLLM
stepfun37+ MTP > SGLangdev+ EAGLE,NVFP4 4 卡)——框架侧正式适配 PR 仍待 Step 开源倒计时(10/15)后涌现。
可执行结论:AMD 用户可上 v0.30.1rc0 的 NVFP4;生产 PD 继续锚定 v0.30.0;想试 Step-5-Preview-BF16 先按社区 day-0 命令小流量验证、别把自报数字当基准;冷启动敏感服务把 Fast Start 写进重启 SOP。
值得强调:Fast Start 把「权重常驻显存、重启只做 IPC 映射」做成原语,正好和本人 OpenInfer / Qwen3-4B DFlash 同源——都是在「复用已有能力、解耦生命周期」上把成本推到更优工作点。Step-5-Preview-BF16 以社区权重先于官方适配冒头,则把 0921「激活参数决定账单」那句话又往前推了一步:27B 激活的 600B 稀疏 MoE 一旦框架侧合入,性价比账要重算。
二、vLLM & SGLang 社区跟踪
版本状态:窗口内 vLLM 主线 v0.30.0(9/21-22,762 commits / 315 贡献者 / 104 新)是 PD 分离生产推荐升级目标;SGLang 近 72h 无新 release,最新稳定版仍为 v0.5.20(9/18,713 PRs / 237 贡献者),main 分支持续活跃(9/25 扩散 SRT 提示增强、kv-hints 信封、sgl-router 重组、移除 HiRadixCache),但无新 tag。
vLLM(v0.30.0 · Fast Start + V4.1-Flash day-0 + HiSparse + 双键水印 → v0.30.1rc0 AMD NVFP4)
版本 / 安全落地:
- 版本:
v0.30.0(9/21-22)承载 CVE-2026-93436 修复(PD 分离下被拒请求 KV metadata 未释放致内存耗尽,CVSS 8.7,修复#55677)——仍为 PD 分离生产部署的推荐升级目标;v0.30.1rc0(9/23)仅补 AMD MI355 致密 NVFP4 + MoRI kernel 镜像(#58281),维持与 NVIDIA 量化对等。 - 新特性(冷启动):Fast Start 持久化每 GPU 权重缓存守护进程——引擎重启经
--load-format ipc_cache走 CUDA IPC 映射 TP 分片权重,H200 上引擎初始化 28.9s→8.2s、CUDA Graph 捕获 12s→2s(本窗口无新改动,仍是 v0.30 线最该落地的原语)。 - 性能:Gemma 4 多模态前缀 3.23× E2E(RTX PRO 6000);AMD ROCm 打包 W4A16 中位 TPOT −26.4%;Kimi K3 混合批次 +5.2~7.7% E2E;RL sampling mask GPU 压缩恢复至无 mask 的 2~3% 内。
- Breaking:scale-out 改
--enable-scale-out显式开;移除 GPTQ g_idx;Mamba 缓存 弃用;YaRN 对齐 Transformers(max_model_len或变);默认音频重采样器改 torchaudio——升级前回归配置。
SGLang(v0.5.20 · 分支点缓存 + sampling masks + DSpark-under-PD + 扩散 SRT 增强)
性能 / 硬件(延续 v0.5.20):
- 性能:统一基数树分支点缓存(DSV4-Flash 命中率 43.8%→60.8%、TTFT 1.57s→1.07s≈−32%,#34565);
sampling masks overlap调度(Qwen3-8B decode batch1 +17% / batch64 +52%,#36630/36631);DSpark-under-PD(8×B300 256K);SGLang Simulator(CPU 预测 TTFT 误差 ~6%,#33824);Responses API 存储 opt-in(#39122)。 - main 活跃:9/25 扩散 SRT 提示增强、kv-hints 信封、sgl-router 重组、移除 HiRadixCache——暂无需升级,盯 v0.5.21 候选。
原理:Fast Start(权重生命周期解耦)
- Fast Start:权重在引擎外由常驻守护进程以「后量化、TP 分片」形态常驻 GPU 显存,重启时仅经 CUDA IPC 把显存指针映射给新引擎进程,跳过磁盘→HBM 重载与重量化——把冷启动成本从 checkpoint 加载转移到一次 IPC 映射,对灰度/自愈/热更严重降运维成本(#54921)。
我的判断:Fast Start 把「权重常驻显存、重启只做 IPC 映射」做成原语,和本人 OpenInfer / DFlash「复用已算能力」是同一收口逻辑;本窗口 vLLM 又把它和 AMD NVFP4 量化对等补进 0.30 线,等于「生命周期解耦 + 低精度路径」两条降本线都铺平。
常驻专题
PD 分离:vLLM v0.30.0 落地 CVE-2026-93436 修复 + HiSparse,v0.30.1rc0 补 AMD NVFP4;SGLang 维持 DSpark-under-PD(#37709)+ PD 角色热切换(#28403)+ KV 校验和(#39500),本期新增 kv-hints 信封进请求传输层(#38891) 埋 KV 亲和路由新机制;Step 侧暂无官方 PD 配方。
架构演进:vLLM 0.30:Fast Start(重启优化)+ HiSparse(稀疏 MLA 主机 KV 层)+ 双键水印 + MRV2 全 Graph;SGLang 0.5.20:分支点缓存 + sampling mask overlap + DSpark-under-PD + 扩散 SRT 增强;量化下探 NVFP4 / MXFP8 KV / FP4。
PyTorch vs transformers:本窗口无脱离 PR;vLLM --model-impl transformers + SGLang Transformers 后备方案页延续「模型层收敛 transformers、性能层留引擎 kernel」边界重分层;代价仍高,仅超大规模定制划算。
Step 适配:Step-5-Preview-BF16 权重现 HF(TypeSafeAI),社区给 vLLM/SGLang --trust-remote-code --reasoning-parser stepfun day-0 命令(⚠️ 归属未确认、数字自报、缺独立基准);Step-3.7-Flash 仍生产主力(vLLM stepfun37 + MTP > SGLang dev + EAGLE,NVFP4 4 卡)。
三、AI 论文与产业热点
今日重点(1 句)
MAE 把 BERT 式掩码建模搬到视觉(75% 高掩码率 + 非对称编码器-解码器,ViT 经像素重建学到通用表征),成今天 VLA/世界模型视觉前端的基础范式之一;算子侧 GLA(门控线性注意力)把自注意力降到 O(N·d²) 线性、用固定隐状态矩阵替 KV cache;性能侧 NIXL(NVIDIA Inference XL)让 PD 分离下 KV 跨 GPU/CPU/NVMe/网络零拷贝搬运;产业侧智元第 2 万台交付长隆、特斯拉 Optimus 长三角审厂收官首批约 5000 台订单、地瓜机器人 4 亿美元 C 轮直接利好地平线。
论文核心(MAE · He et al., Meta FAIR, CVPR 2022)
- 一句话定位:自监督视觉预训练奠基作——让视觉 Transformer 像 BERT 一样通过「填空」学通用表征;75% 高掩码率 + 非对称编码器-解码器 是它和早先视觉自监督最关键的区别。
- 核心思想:224×224 图像切 16×16 patch(196 个),随机 mask 75%,仅把 25% 可见 patch 输入重型 ViT 编码器,再用轻量解码器重建全部 patch 像素;loss 只算被 mask 的 patch——让编码器只从少量可见 token 推断全局结构。
- 影响:训练 FLOPs 约完整 ViT 的 1/3,ViT-L ImageNet fine-tune 达 87.8% top-1,密集预测显著优于监督预训练;启发 DINOv2/v3、SigLIP 2,成 OpenVLA / π0 / GR00T 视觉前端候选(机器人「眼睛」的源头之一)。
算子讲解:GLA(Gated Linear Attention,门控线性注意力)
- 定位:把自注意力从 O(N²·d) 二次 降到 O(N·d²) 线性,用固定 d×d 隐状态矩阵 替代 KV cache——长序列显存与算力一起线性化。
- 在用模型:Qwen3.5 / Qwen3-Next(Gated DeltaNet,36 线性 + 12 全注意力 3:1)、MiniMax Lightning Attention、Mamba/S6 同族。
- 关键点:
S_t = S_{t-1} ⊙ g_t + k_t v_t^T,o_t = (S_t q_t) ⊙ z_t;门控g_t控历史衰减、z_t控输出;适合端侧 VLA 长历史低时延推理(无 KV 累积、固定状态)。
性能优化:NIXL KV 传输(NVIDIA Inference XL)
- 定位:PD 分离架构下 KV cache 跨 GPU / CPU / NVMe / 网络 的高效搬运中间件——KV 不用再塞进单卡显存,decode 侧按需拉取。
- 代表工作:NVIDIA Dynamo KV Router + NIXL;vLLM / SGLang 社区接入中。
- 收益:统一
nixl_agentAPI、零拷贝 + RDMA / CUDA IPC、异步预取 overlap,TTFT 后 KV 搬运开销降到几乎不可见;支持多机器人云-边协同推理(KV 在边端就近复用)。
产业热点(具身公司 / 产业链速递 · 置顶)
- 【具身】智元机器人:第 2 万台 交付长隆、首期 300+ 台 常驻乐园 → 利好 上纬新材 688585。
- 【具身】特斯拉 Optimus:长三角审厂收官、首批约 5000 台 订单 → 利好 拓普 601689 / 三花 002050 / 绿的 688017 / 均胜 600699 / 机器人 ETF 562500。
- 【具身】地瓜机器人:地平线分拆,完成 4 亿美元 C 轮 → 地平线机器人-W 09660.HK 直接利好。
- 【通用】小鹏:第二代 VLA 推送 MONA Ultra SE,4D 时空感知 + 响应提升 300% → 小鹏汽车-W / 地平线 09660.HK。
- 【通用】宇树:王兴兴指当前核心瓶颈是「几毫米匹配误差」,具身 ChatGPT 时刻需 80% 陌生场景完成 80% 任务。
⚠️ 产业动态不构成投资建议。
四、一句话结论
vLLM 稳守年度大版本 v0.30.0(762 commits / 315 贡献者,承载 CVE-2026-93436 修复,PD 分离生产推荐升级目标)并切出 v0.30.1rc0(9/23,补 AMD MI355 致密 NVFP4 + MoRI kernel 镜像 #58281,维持与 NVIDIA 量化对等);SGLang 近 72h 无新 tag、仍 v0.5.20(分支点缓存 DSV4-Flash 命中 43.8%→60.8%、sampling masks overlap Qwen3-8B +17%~+52%、DSpark-under-PD、Simulator 预测 TTFT 误差 ~6%),main 活跃打磨扩散 SRT / kv-hints 信封;窗口内最值关注的国产推理进展是 Step-5-Preview-BF16 权重低调现 HF(社区给 day-0 命令、归属未确认);论文侧 MAE(75% 掩码 + 非对称编解码,ViT-L 87.8% top-1)奠基自监督视觉前端、成 VLA/世界模型「眼睛」源头,算子 GLA 把注意力降到 O(N·d²) 线性、NIXL 让 PD 分离 KV 跨节点零拷贝搬运;产业侧智元第 2 万台交付长隆、特斯拉 Optimus 长三角审厂收官首批约 5000 台订单、地瓜机器人 4 亿美元 C 轮直接利好地平线——具身「补脑 + 落地」继续逐一标价。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。