★ 今日最值得关注
vLLM 于 9/22 发布年度大版本 v0.30.0(762 commits / 315 贡献者)——本期唯一重大版本更新,把 Fast Start 持久化权重缓存守护进程、DeepSeek-V4.1-Flash day-0 支持、HiSparse 主机驻留 KV 溢出与双键 Gumbel-max 水印一并落地,且正式修复 CVE-2026-93436,成为 PD 分离生产部署的推荐升级目标(取代此前仅 rc0 的状态)。 今天最该进容量规划的一条,是它把「引擎冷启动」和「PD 安全」两块长期痛点一起收了口。
这其实和今天 HiSparse(稀疏 MLA 解码把 KV 页溢出到 pinned host 内存)是同一句话的两种写法:框架在把「权重生命周期」和「KV 存储」从引擎进程解耦,让冷启动与显存压力各找各的兜底层——都在「把难扛的东西换成能复用的层」。
三层事实:
- 版本是什么:v0.30.0(9/22,762 commits / 315 人)承载 CVE-2026-93436 修复,是 PD 分离生产部署的推荐升级版本;相较此前「仅 rc0 含修复、生产 PD 不能停在 v0.29.0」的悬空状态,现在有了正式落地版本。
- 冷启动怎么解:Fast Start 常驻每 GPU 权重缓存守护进程——引擎重启经
--load-format ipc_cache走 CUDA IPC 映射 TP 分片权重,H200 上引擎初始化 28.9s→8.2s,现已覆盖 FP4 与多节点 TP;本质是「权重生命周期与引擎进程解耦」,把冷启动成本从 checkpoint 磁盘→HBM 重载转移到一次 IPC 映射。 - 稀疏与安全的兜底:HiSparse 把稀疏 MLA 解码的 KV 页在 GPU 压力下溢出到 pinned host 内存(top-k 未命中走每请求 GPU hot buffer,经 HiSparseConnector 启用并暴露 Prometheus 计数);双键 Gumbel-max 水印带密钥 PRF、每请求 opt-out,双键变体兼容投机解码。
可执行结论:生产 PD 部署从「等 0.29.1+」转为「直接升 v0.30.0」;冷启动敏感的在线服务把 Fast Start 纳入重启 SOP;稀疏长上下文负载用 HiSparse 把 host 内存当 KV 兜底层,先确认 CUDA Graph replay 兼容与 Prometheus 计数接入。
值得强调:Fast Start 把「权重常驻显存、重启只做 IPC 映射」做成原语,正好和本人 OpenInfer / Qwen3-4B DFlash 同源——都是在「复用已有能力、解耦生命周期」上把成本推到更优工作点。HiSparse 把稀疏 KV 溢出到 host 内存,则把 0913 那套「VRAM 分池」思路从显存内推到显存外;等 v0.30.0 实测,可看 Fast Start + HiSparse 能否在单卡复现同档冷启动/显存降本。
二、vLLM & SGLang 社区跟踪
版本状态:窗口内 vLLM v0.30.0(9/22,762 commits / 315 贡献者)是本期唯一正式大版本;SGLang 近 72h 无新 release,最新稳定版仍为 v0.5.20(9/18,713 PRs / 237 贡献者),main 分支持续活跃(9/24 AMD MI355X disagg nightly 迁 ROCm 10 等),但无新 tag。
vLLM(v0.30.0 · Fast Start + V4.1-Flash day-0 + HiSparse + 双键水印)
版本 / 安全落地:
- 版本:
v0.30.0(9/22)承载 CVE-2026-93436 修复(PD 分离下被拒请求 KV metadata 未释放致内存耗尽,CVSS 8.7,修复#55677)——成为 PD 分离生产部署的推荐升级目标,取代此前「仅 rc0 含修复」的悬空状态。 - 新特性(冷启动):Fast Start 持久化每 GPU 权重缓存守护进程——引擎重启经
--load-format ipc_cache走 CUDA IPC 映射 TP 分片权重,H200 上引擎初始化 28.9s→8.2s,现已覆盖 FP4 与多节点 TP;本质是「权重生命周期与引擎进程解耦」。 - 新模型:DeepSeek-V4.1-Flash day-0 支持——整 KV 经 FlashMLA V4.1 以 MXFP8 存于 SM100,配套 DeepGEMM Mega-mHC 与异步 Engram 预取(Engram DP 分片)。
- 新特性(稀疏 / 安全):HiSparse 主机驻留层——稀疏 MLA 解码在 GPU 压力下把 KV 页溢出到 pinned host 内存,top-k 未命中走每请求 GPU hot buffer,经 HiSparseConnector 启用并暴露 Prometheus 计数;双键 Gumbel-max 水印——生成+检测带密钥 PRF、每请求 opt-out,双键变体兼容投机解码,Rust 前端转发每请求控制。
SGLang(v0.5.20 · 分支点缓存 + sampling masks + DSpark-under-PD)
性能 / 硬件(延续 v0.5.20):
- 性能:统一基数树分支点缓存(DSV4-Flash 命中率 43.8%→60.8%、TTFT 1.57s→1.07s)、
sampling masks overlap调度(Qwen3-8B decode +17%~+52%)、DSpark-under-PD、TRT-LLM 注意力内核覆盖 DSV4 Blackwell(B200 prefill ≈1.2× / decode ≈1.45×)。 - 硬件:v0.5.20 退役 CUDA12 通道、Intel XPU 进发布镜像、ROCm 加载 GLM-5.2 505.7s→40.4s。
原理:Fast Start(权重生命周期解耦)+ HiSparse(稀疏 KV 三级溢出)
- Fast Start:权重在引擎外由常驻守护进程以「后量化、TP 分片」形态常驻 GPU 显存,重启时仅经 CUDA IPC 把显存指针映射给新引擎进程,跳过磁盘→HBM 重载——把冷启动成本从 checkpoint 加载转移到一次 IPC 映射。
- HiSparse:稀疏注意力的 top-k 即「工作集描述符」,把每选中位置映射到 resident GPU page / 请求级 GPU hot buffer / pinned host pool 三级,resident 命中在 hot-cache 查找前返回,全程 GPU 侧且兼容 CUDA Graph replay。
我的判断:这两条把「权重」和「KV」分别解耦出引擎进程——Fast Start 解耦权重、HiSparse 解耦稀疏 KV——和本人 OpenInfer / DFlash「复用已算能力」是同一收口逻辑。下一步可实测「Fast Start 冷启动 + HiSparse host 兜底」能否在单卡复现同档降本。
常驻专题
PD 分离:vLLM v0.30.0 已成 CVE-2026-93436 的修复落地版本(PD 分离生产升级目标);HiSparse 把 KV 溢出到 host 内存,间接缓解 disagg 下 decode 侧显存压力;SGLang 维持 v0.5.20 的 DSpark-under-PD(#37709)+ PD 角色热切换(#28403)+ KV 校验和(#39500),main 继续打磨。
架构演进:vLLM 0.30:Fast Start(重启优化)、HiSparse(稀疏 MLA 主机 KV 层)、双键水印+投机解码、MRV2 图捕获期 GC 冻结(捕获 12s→2s)、在线接受估计器把自适应验证扩到所有 draft-model 投机解码器;SGLang 0.5.20 以采样掩码+分支点缓存+DSV4 Blackwell 内核多点开花。
PyTorch vs transformers:本期无脱离 PR;信号延续边界重新分层——vLLM 有 --model-impl transformers 直跑 HF 实现、SGLang 文档新增「Transformers 后备方案」页,模型定义层收敛到 transformers、性能层留在引擎 kernel。横向结论:别再把「自研模型实现」当性能前提,只有热点算子值得自研。
Step 适配:Step-3.7-Flash 部署路径稳定(vLLM stepfun37 镜像 + MTP num_speculative_tokens=3;SGLang dev-step-3.7-flash + 多层 EAGLE;NVFP4 4 卡,FP8 KV);Step 5 Preview(600B/27B、1M 上下文、原生文本+视觉,AA 综合智能 44 居开源前三)权重定于 10/15 开源,适配 PR 届时才会涌现,当前框架侧无合入。
三、AI 论文与产业热点
今日重点(1 句)
Meta DINOv3 用 Gram anchoring 保住密集特征,让 7B 冻结视觉骨干首次全面超越弱监督 SOTA——机器人「眼睛」多了免标注默认选项;算子侧 Muon(Newton-Schulz 正交化)把各方向均匀推动、MegaBlocks 无丢弃 MoE(块稀疏 GEMM)删掉 capacity_factor,把训练与推理成本一起往下压;产业侧特斯拉 Optimus 长三角审厂收官、首批约 5000 台订单落地。
论文核心(DINOv3 · Meta FAIR,arXiv:2508.10104)
- 一句话定位:一个冻结不动的视觉骨干在约 60 基准 / 15 任务上匹配或超过 SigLIP 2 等弱监督 SOTA——7B 参数 × 17 亿无标注图的自监督模型,证明「冻结骨干也能当通用视觉前端」。
- 核心思想:① 师生自蒸馏(EMA teacher)+ DINO/iBOT/Koleo 无标注配方;② Gram anchoring——把学生 patch 特征的 Gram 矩阵(patch 两两相似结构)锚定到早期 checkpoint,只约束相似结构不约束绝对值,治好「训练越久局部特征越糊」;③ 恒定 lr 1M 步 + Gram 阶段 + 高分辨率后训练(外推 4096²+)+ 多学生蒸馏(ConvNeXt 小杯端侧友好)。
- 影响:ADE20k 53.0→63.0 mIoU、ImageNet 线性探针 88.2%;可作 VLA 视觉前端(OpenVLA 的 DINOv2 可换 DINOv3),NASA JPL 火星机器人已用 DINO。
算子讲解:Muon 优化器(Newton-Schulz 正交化)
- 定位:AdamW 忽略矩阵奇异方向结构,Muon 对动量做正交化更新让各方向均匀推动;Moonlight 约 52% FLOPs 打平 AdamW。
- 在用模型:Kimi K2(MuonClip,1.04T/15.5T tokens 零 loss spike)、GLM-4.5(除词嵌入全用,NS 5 步/μ=0.95/RMS 0.2)、Moonlight。
- 关键点:只管 2D 隐层权重;大 batch 需 QK-Clip / QK-Norm 抑制 logit 爆炸。
性能优化:MegaBlocks 无丢弃 MoE(块稀疏 GEMM)
- 定位:解决 MoE「容量丢弃 or padding 浪费」两难,把 MoE FFN 重写为块稀疏 GEMM删掉
capacity_factor。 - 代表工作:MegaBlocks(MLSys 2023)+ 现代 grouped GEMM / DeepGEMM Mega MoE(FP8×FP4 单 mega-kernel)。
- 收益:比 Tutel 最优配置快 40%、比 Megatron-LM 稠密快 2.4×、零 token 丢弃。
产业热点(具身公司 / 产业链速递 · 置顶)
- 【具身】特斯拉 Optimus:拓普/三花/均胜升级认证量产伙伴、首批约 5000 台订单下达、9 月底 1000 台/周、2026 年约 5 万台 → 利好 拓普 601689 / 三花 002050 / 均胜 600699 / 绿的 688017 / 机器人 ETF 562500。
- 【具身】融资换挡:宇树上市后机构暂停新整机项目、监管抬 IPO 门槛、梅卡曼德超购 3800 倍仍破发 → 中性偏谨慎 上纬 688585 / 宇树 688836,资金转向上游关节/灵巧手/世界模型。
- 【具身】量价:2026 H1 全球人形出货 1.91 万台(+272%) 中国占 97%+;宇树 R1 双臂 26,900 元起、自家均价三年 59.3 万→16.7 万。
- 【通用】:DeepSeek ARR 破 $10 亿 + 传沪上市募 500 亿/估值 5000 亿(API 已提价 2.3-4.5×);OpenAI Agent 首次确认侵入政府系统(澳洲 Medicare);Gemini 4 进后训练、阿里规划 5-10 万亿参数 Qwen。
⚠️ 产业动态不构成投资建议。
四、一句话结论
vLLM 9/22 发布年度大版本 v0.30.0(762 commits / 315 贡献者)——Fast Start 持久化每 GPU 权重缓存守护进程(CUDA IPC 映射,H200 引擎初始化 28.9s→8.2s)、DeepSeek-V4.1-Flash day-0 支持(MXFP8 KV 存 SM100)、HiSparse 主机驻留 KV 溢出与双键 Gumbel-max 水印一并落地,且正式修复 CVE-2026-93436,成为 PD 分离生产升级目标(取代此前仅 rc0 状态);SGLang 近 72h 无新 tag、仍 v0.5.20(分支点缓存 DSV4-Flash 命中 43.8%→60.8%、sampling masks overlap +17%~+52%、DSpark-under-PD、B200 Blackwell 1.2×/1.45×)继续领跑;论文侧 Meta DINOv3(7B 自监督、Gram anchoring)让冻结视觉骨干首超弱监督 SOTA 成机器人免标注默认「眼睛」,算子 Muon(Newton-Schulz 正交化)与 MegaBlocks 无丢弃 MoE(块稀疏 GEMM)压训练与推理成本,产业侧特斯拉 Optimus 长三角审厂收官、首批约 5000 台订单落地——具身「补脑 + 落地」继续逐一标价。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。