系列:每日AI热点

每日AI热点 · 2026-09-25:vLLM v0.30.0 年度大版本发布(762 commits、Fast Start 持久化权重缓存 + HiSparse 主机 KV 溢出,CVE-2026-93436 修复落地);DINOv3 7B 冻结视觉骨干首超弱监督 SOTA

★ 今日最值得关注

vLLM 于 9/22 发布年度大版本 v0.30.0(762 commits / 315 贡献者)——本期唯一重大版本更新,把 Fast Start 持久化权重缓存守护进程、DeepSeek-V4.1-Flash day-0 支持、HiSparse 主机驻留 KV 溢出与双键 Gumbel-max 水印一并落地,且正式修复 CVE-2026-93436,成为 PD 分离生产部署的推荐升级目标(取代此前仅 rc0 的状态)。 今天最该进容量规划的一条,是它把「引擎冷启动」和「PD 安全」两块长期痛点一起收了口。

这其实和今天 HiSparse(稀疏 MLA 解码把 KV 页溢出到 pinned host 内存)是同一句话的两种写法:框架在把「权重生命周期」和「KV 存储」从引擎进程解耦,让冷启动与显存压力各找各的兜底层——都在「把难扛的东西换成能复用的层」。

三层事实:

  1. 版本是什么:v0.30.0(9/22,762 commits / 315 人)承载 CVE-2026-93436 修复,是 PD 分离生产部署的推荐升级版本;相较此前「仅 rc0 含修复、生产 PD 不能停在 v0.29.0」的悬空状态,现在有了正式落地版本。
  2. 冷启动怎么解:Fast Start 常驻每 GPU 权重缓存守护进程——引擎重启经 --load-format ipc_cache 走 CUDA IPC 映射 TP 分片权重,H200 上引擎初始化 28.9s→8.2s,现已覆盖 FP4 与多节点 TP;本质是「权重生命周期与引擎进程解耦」,把冷启动成本从 checkpoint 磁盘→HBM 重载转移到一次 IPC 映射。
  3. 稀疏与安全的兜底:HiSparse 把稀疏 MLA 解码的 KV 页在 GPU 压力下溢出到 pinned host 内存(top-k 未命中走每请求 GPU hot buffer,经 HiSparseConnector 启用并暴露 Prometheus 计数);双键 Gumbel-max 水印带密钥 PRF、每请求 opt-out,双键变体兼容投机解码。

可执行结论:生产 PD 部署从「等 0.29.1+」转为「直接升 v0.30.0」;冷启动敏感的在线服务把 Fast Start 纳入重启 SOP;稀疏长上下文负载用 HiSparse 把 host 内存当 KV 兜底层,先确认 CUDA Graph replay 兼容与 Prometheus 计数接入。

值得强调:Fast Start 把「权重常驻显存、重启只做 IPC 映射」做成原语,正好和本人 OpenInfer / Qwen3-4B DFlash 同源——都是在「复用已有能力、解耦生命周期」上把成本推到更优工作点。HiSparse 把稀疏 KV 溢出到 host 内存,则把 0913 那套「VRAM 分池」思路从显存内推到显存外;等 v0.30.0 实测,可看 Fast Start + HiSparse 能否在单卡复现同档冷启动/显存降本。

二、vLLM & SGLang 社区跟踪

版本状态:窗口内 vLLM v0.30.0(9/22,762 commits / 315 贡献者)是本期唯一正式大版本;SGLang 近 72h 无新 release,最新稳定版仍为 v0.5.20(9/18,713 PRs / 237 贡献者),main 分支持续活跃(9/24 AMD MI355X disagg nightly 迁 ROCm 10 等),但无新 tag。

vLLM(v0.30.0 · Fast Start + V4.1-Flash day-0 + HiSparse + 双键水印)

版本 / 安全落地:

SGLang(v0.5.20 · 分支点缓存 + sampling masks + DSpark-under-PD)

性能 / 硬件(延续 v0.5.20):

原理:Fast Start(权重生命周期解耦)+ HiSparse(稀疏 KV 三级溢出)

我的判断:这两条把「权重」和「KV」分别解耦出引擎进程——Fast Start 解耦权重、HiSparse 解耦稀疏 KV——和本人 OpenInfer / DFlash「复用已算能力」是同一收口逻辑。下一步可实测「Fast Start 冷启动 + HiSparse host 兜底」能否在单卡复现同档降本。

常驻专题

PD 分离:vLLM v0.30.0 已成 CVE-2026-93436 的修复落地版本(PD 分离生产升级目标);HiSparse 把 KV 溢出到 host 内存,间接缓解 disagg 下 decode 侧显存压力;SGLang 维持 v0.5.20 的 DSpark-under-PD(#37709)+ PD 角色热切换(#28403)+ KV 校验和(#39500),main 继续打磨。

架构演进:vLLM 0.30:Fast Start(重启优化)、HiSparse(稀疏 MLA 主机 KV 层)、双键水印+投机解码、MRV2 图捕获期 GC 冻结(捕获 12s→2s)、在线接受估计器把自适应验证扩到所有 draft-model 投机解码器;SGLang 0.5.20 以采样掩码+分支点缓存+DSV4 Blackwell 内核多点开花。

PyTorch vs transformers:本期无脱离 PR;信号延续边界重新分层——vLLM 有 --model-impl transformers 直跑 HF 实现、SGLang 文档新增「Transformers 后备方案」页,模型定义层收敛到 transformers、性能层留在引擎 kernel。横向结论:别再把「自研模型实现」当性能前提,只有热点算子值得自研。

Step 适配:Step-3.7-Flash 部署路径稳定(vLLM stepfun37 镜像 + MTP num_speculative_tokens=3;SGLang dev-step-3.7-flash + 多层 EAGLE;NVFP4 4 卡,FP8 KV);Step 5 Preview(600B/27B、1M 上下文、原生文本+视觉,AA 综合智能 44 居开源前三)权重定于 10/15 开源,适配 PR 届时才会涌现,当前框架侧无合入。

三、AI 论文与产业热点

今日重点(1 句)

Meta DINOv3 用 Gram anchoring 保住密集特征,让 7B 冻结视觉骨干首次全面超越弱监督 SOTA——机器人「眼睛」多了免标注默认选项;算子侧 Muon(Newton-Schulz 正交化)把各方向均匀推动、MegaBlocks 无丢弃 MoE(块稀疏 GEMM)删掉 capacity_factor,把训练与推理成本一起往下压;产业侧特斯拉 Optimus 长三角审厂收官、首批约 5000 台订单落地。

论文核心(DINOv3 · Meta FAIR,arXiv:2508.10104)

算子讲解:Muon 优化器(Newton-Schulz 正交化)

性能优化:MegaBlocks 无丢弃 MoE(块稀疏 GEMM)

产业热点(具身公司 / 产业链速递 · 置顶)

⚠️ 产业动态不构成投资建议。

四、一句话结论

vLLM 9/22 发布年度大版本 v0.30.0(762 commits / 315 贡献者)——Fast Start 持久化每 GPU 权重缓存守护进程(CUDA IPC 映射,H200 引擎初始化 28.9s→8.2s)、DeepSeek-V4.1-Flash day-0 支持(MXFP8 KV 存 SM100)、HiSparse 主机驻留 KV 溢出与双键 Gumbel-max 水印一并落地,且正式修复 CVE-2026-93436,成为 PD 分离生产升级目标(取代此前仅 rc0 状态);SGLang 近 72h 无新 tag、仍 v0.5.20(分支点缓存 DSV4-Flash 命中 43.8%→60.8%、sampling masks overlap +17%~+52%、DSpark-under-PD、B200 Blackwell 1.2×/1.45×)继续领跑;论文侧 Meta DINOv3(7B 自监督、Gram anchoring)让冻结视觉骨干首超弱监督 SOTA 成机器人免标注默认「眼睛」,算子 Muon(Newton-Schulz 正交化)与 MegaBlocks 无丢弃 MoE(块稀疏 GEMM)压训练与推理成本,产业侧特斯拉 Optimus 长三角审厂收官、首批约 5000 台订单落地——具身「补脑 + 落地」继续逐一标价。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。