系列:每日AI热点

每日AI热点 · 2026-09-17:vLLM

★ 今日最值得关注

vLLM #56935(09-16 合入)——把 DeepSeek-V4.1 的 FlashMLA mega attention + NVFP4 压缩 KV 一次打通并设为 SM100 默认:首个把「融合 kernel」与「更低精度 KV」同时做成默认路径的改动(压缩记录比 fp8_ds_mla 小 45%),还附了罕见的端到端精度证据(DSpark k=5 真实拒绝采样下 gsm8k 0.9318 vs 0.9265、gpqa 0.9053 vs 0.9066),并明确划出三条边界——TP1 明显更快、prefill 未测、非 SM100 不受影响。这是本期框架侧最干净的一条信号:把 KV 容量账重算权交还硬件默认路径。

它和今天的论文主线其实是同一条:机器人落地的瓶颈正从「模型够不够强」转向「能不能持续采到真实部署数据」——π*0.6/RECAP 用「预训练通用 VLA + 任务级真机 RL 微调」产出可部署策略(最难任务吞吐 ×2+、失败率约减半、连续做咖啡 13 小时),证明模型侧已够用,卡点变成数据;而产业面「本体厂商集体补脑、但 2026H1 真实商用订单仅占 21.1%」是同一瓶颈的另一面。框架把 KV 账做薄、机器人把部署数据做厚,都是「把已有能力推到可用」的收口动作。

三层事实:

  1. 融合 kernel + 更低精度 KV 同时默认(#56935):mega-attention 把「Q 的 RoPE → 稀疏注意力 → 逆 RoPE → FP8 量化」四步压进一次 kernel launch,直写 wo_a 消费的 buffer;NVFP4 记录 288 B/token(256 B e2m1 + 32 个 e4m3 scale,group 16),比 fp8_ds_mla 小 45%。不是「换个格式」,是「调度成本从 Python 侧移进 kernel」。
  2. 精度代价可忽略(首次给端到端证据):GB300 / CUDA Graph / decode,mega vs sparse 微秒,TP1 s_q=512 为 96/140(1.45×),TP2 起打平——决定变量是 live heads / padded heads 而非 batch size;草稿接受率几乎一致,即融合 kernel + 更小压缩记录无可测量精度损失。
  3. PD 分离首次可验证(SGLang #39500):新增可选 KV 传输 Adler-32 校验和(--disaggregation-enable-kv-checksum,默认关),不匹配即中止请求并计数——PD 从「能跑」走向「可验证」,排障期建议开、稳态压测关。

可执行结论:如果你在跟踪 DeepSeek-V4.1 部署栈,#56935 是 B200/GB300 上必须重算 KV 容量账的信号——「KV 少 45%」直接改写并发上限假设;同时 SGLang 的六连 PR 把多模态 V4.1 走得比 vLLM 靠前,PD 校验和是生产排障的刚需开关。对本人 OpenInfer / Qwen3-4B DFlash,方向一致:把压缩/KV 生命周期做成默认路径,比堆宽草稿树更实在。

值得单独说:本期四个 vLLM bugfix(#57152/#57132/#56930/#57104)全在「V4.1 + 投机解码 + PD」交叉路径上——causal image SWA、ROCm V4 精度崩坏、EAGLE/dense draft 在 EP 下起不来、KV Connector + MTP 死锁。结论很硬:别停在 v0.29.0,跟 main 或等 v0.29.1。

二、vLLM & SGLang 社区跟踪

版本状态:vLLM stable v0.29.0(09-09),下一个候选 v0.29.1rc0(09-13);SGLang v0.5.19(09-05) 仍为最新稳定,近窗无新 tag。本期增量主要来自 main 分支,无正式发版(与 0916 同节奏)。

vLLM(main · DSv4.1 深水区 + 交叉路径 bugfix)

新特性 / 架构演进:

Bug 修复(交叉路径,建议跟 main):#57152(V4.1 causal image SWA)、#57132(ROCm 上 V4 精度崩坏)、#56930(EAGLE/dense draft 在 EP 下起不来)、#57104(KV Connector + MTP 在 KV 压力下死锁)——四个全在「V4.1 + 投机解码 + PD」交叉处。

SGLang(v0.5.19 · 多模态 V4.1 六连 + PD 可验证)

新特性 / 重大适配:

其他:#38526 支持 Ling-3.0-flash-VL、#37810 ROCm 上 DSV4 启用 breakable CUDA graph prefill、#39875 修 AMD dsv4 server 启动——AMD 上 V4 可用性快速补齐。

原理:#56935 的 mega-attention 融合 kernel + NVFP4 压缩 KV(把 KV 账做薄,不止换格式)

我的判断:#56935 的意义不在「KV 小 45%」这个数字,而在它把「融合 kernel + 低精度 KV」做成了默认路径——把 Python 侧调度成本移进 kernel,本质和 0913 的「VRAM 分层池化」、0916 的「DFlash2 抬 E[L]」同源:都在 tradeoff 上找最优工作点。对本人 OpenInfer / Qwen3-4B DFlash,下一步应实测「mega-attention 式融合 kernel + NVFP4 压缩 KV」能否在 Qwen3-4B 上复现 45% KV 缩减且精度无损。

常驻专题

PD 分离:SGLang #39500 给 KV 传输加可选校验和;vLLM #57077 修 HiSparse 跨逻辑 block 的 pull 对齐、#54222 让命中率进 token 明细。社区 09-15 综述点名未解矛盾:chunked prefill 在两家默认开启,批评者称其为局部最优,但「上下文长度 × 并发」的交叉曲线至今无人发布。

架构演进:KV 数值格式继续下探(vLLM NVFP4 288 B/token、SGLang FP4 packing + MXFP8 scale 备份);融合 kernel 取代多 kernel 编排(把 Python 侧调度成本移进 kernel);投机解码与调度/KV 生命周期深度耦合(本轮四个 bugfix 全在其交叉处)。

PyTorch vs transformers:本周期无新的「脱离 transformers」PR/讨论(vLLM 151、SGLang 132 个合入均无)。边界未松动——模型层继续用 transformers,只有 MoE/RoPE/FP4 packing 等热点算子才自研 kernel。

Step 适配:框架侧近 72h 无 Step 相关合入,沿用既有结论(vLLM stepfun37 + MTP 一等公民 > SGLang dev 镜像 + EAGLE)。产业侧 09-16 CEO 姜大昕讲金融垂类「FDE + SaS」新范式、端侧负责人俞刚讲 AI 2.0 泛化与质量;StepAudio 3 五款已上线,仅 Realtime 走 WebSocket、其余走 HTTP。

三、AI 论文与产业热点

今日重点(1 句)

Physical Intelligence 的 π*0.6 / RECAP(arXiv:2511.14759)证明「预训练通用 VLA + 任务级真机 RL 微调」能产出可部署策略——机器人落地的瓶颈正从「模型够不够强」转向「能不能持续采到真实部署数据」,这与今日产业面「本体厂商集体补脑、但 2026H1 真实商用订单仅占 21.1%」形成同一条主线的两面;Selective Scan / S6(Mamba)用 O(N) 关联扫描把推理 KV cache 打到数 MB、弹性推理把 GPU 利用率从 ~20% 拉到 60%+,正好把「端侧大脑 + 真机部署」的成本模型从算法层补到系统层——而优必选万台工厂、智元 A3 Ultra 千台级量产、宇树市值回撤 57%、千寻三轮融资超 45 亿、监管点名「中标 ≠ 商业收入」,正把具身「补脑 + 落地」逐一标价。

论文核心(π*0.6 / RECAP · Physical Intelligence,arXiv:2511.14759)

算子讲解:Selective Scan / S6(Mamba)

性能优化:弹性推理 / Serverless LLM Serving(Scale-to-Zero)

产业热点(具身公司 / 产业链速递 · 置顶)

⚠️ 产业动态不构成投资建议。

四、一句话结论

框架侧 vLLM #56935(09-16 合入)把 DeepSeek-V4.1 的 FlashMLA mega attention + NVFP4 压缩 KV 一次打通并设为 SM100 默认——首个把「融合 kernel」与「更低精度 KV」同时做成默认路径的改动(KV 少 45%、TP1 快 1.45×、精度无差),并明确三条边界;SGLang 用六连 PR 铺完多模态 V4.1、PD 分离首次可开 Adler-32 校验和(#39500,从「能跑」走向「可验证」);四个交叉路径 bugfix 提示别停在 v0.29.0、跟 main 或等 v0.29.1。论文侧 π*0.6/RECAP(Physical Intelligence,arXiv:2511.14759)证明「预训练通用 VLA + 任务级真机 RL 微调」可部署(吞吐 ×2+、失败率减半、连续做咖啡 13 小时),机器人瓶颈正从模型强度转向真实部署数据,与产业「本体补脑但真实商用订单仅 21.1%」同线;Selective Scan/S6(Mamba)用 O(N) 关联扫描把推理 KV cache 打到数 MB、弹性推理把 GPU 利用率从 ~20% 拉到 60%+,把「端侧大脑 + 真机部署」成本模型从算法补到系统层——而优必选万台工厂、智元 A3 Ultra 千台量产、宇树回撤 57%、千寻三轮超 45 亿、监管点名「中标 ≠ 商业收入」,正把具身「补脑 + 落地」逐一标价。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。