系列:每日AI热点

每日AI热点 · 2026-09-12:SGLang 抢下 DeepSeek-V4.1 Day-0(有界重算换低缓存,8×H200 prefill 1.56×、pass@1 无损),vLLM 维持 v0.29.0

★ 今日最值得关注

SGLang + Miles 抢下 DeepSeek-V4.1 的 Day-0 支持——「有界重算换低缓存」把 8×H200 prefill 打到 1.56×、AIME 2026 pass@1 无损(453/480),是近 72h 唯一「明确实测数字 + 可源码级解读」的大更新;vLLM 维持 v0.29.0(Blackwell 端到端时延 −33.6%、Hopper 低延迟 GEMM +12.9~25.2%),并移除 10 个废弃架构。

三层事实:

  1. SGLang + Miles 在 09-10 给出 DeepSeek-V4.1 Day-0 支持:encoder-side bounded replay / decoder-side tail-only 两套方案,8×H200 prefill 1.56×、4×GB300 1.37×,AIME 2026 pass@1 无损(453/480)——不是「宣布」,是有实测通过率与源码路径的大更新。
  2. vLLM 维持 v0.29.0(09-09,近 72h 无新 tag),但本周期补出真性能红利:分代 kernel 重调让 Hopper 低延迟 GEMM +12.9~25.2%、Blackwell autotuning 端到端时延 −33.6%;同时移除 10 个废弃架构(Arctic / Chameleon / MPT)+ 旧 api_server 路径,是破坏性变更,须先迁移。
  3. SGLang + Mooncake 把 KV 池化标杆拉到日均万亿 Token:命中 >90%、批量读取 <50ms,单机效率 3×/总产能 30×——PD 分离从论文配置变成生产线。

可执行结论:这是「缓存什么 vs 重算什么」的边界取舍,和本人 OpenInfer / Qwen3-4B DFlash 推测解码同构——用有界重算换更低缓存与更高命中。SGLang 用户可直接开启 V4.1 支持试 prefill;vLLM 用户升级前先在 staging 验 parity(移除 10 架构是硬 breaking)。

值得单独说:本期主角从 vLLM(0907/0910 连续发版)换成 SGLang——Day-0 支持 DeepSeek-V4.1 这种「卡发布窗口」的速度战,是推理框架的护城河之一。但 vLLM 的 Blackwell −33.6% / Hopper +12.9~25.2% 仍是部署侧实打实的红利,别只盯着发版节奏。

二、vLLM & SGLang 社区跟踪

版本状态:vLLM v0.29.0(正式版,09-09) 维持最新稳定,近 72h 无新 tag;SGLang v0.5.19(09-05) 仍为最新稳定版,但 09-10 借 Miles 拿到 DeepSeek-V4.1 Day-0 支持(非 tag,属生态适配)。

vLLM v0.29.0

新特性 / 架构演进:

破坏性变更:

变更影响
移除 10 个废弃架构(Arctic / Chameleon / MPT)依赖这些模型的须先迁移,否则启动失败
旧 api_server 路径废弃启动脚本改 vllm serve
CUDA Graph 显存 profiling 纳入 KV auto-sizing升级后须重查显存余量与图捕获

SGLang v0.5.19 + DeepSeek-V4.1 Day-0(09-10)

新特性 / 重大适配:

生产实践:SGLang + Mooncake 日均万亿 Token——Prefill 开 HiCache、Mooncake Store 池化节点 DRAM,KV 命中率 >90%、批量读取 <50ms,单机效率 3× / 总产能 30×。

原理:DeepSeek-V4.1 的「有界重算换低缓存」(SGLang 实现)

DeepSeek-V4.1 是 92 层 gated linear + full attention 交替的混合注意力。SGLang 不缓存每层窗口 KV,改「有界重算」重建:

机制:① decoder-side tail-only——第 20 层为最终 compressed-KV 源,21–39 层复用其 compressed KV + indexer keys,每 chunk 仅对末尾 ≤128 token 计算;② encoder-side bounded replay——命中缓存时重算前缀末 128 token 重建窗口 KV。两者把局部注意力的截断限制在重建边界(有界近似,须实测),均 opt-in,encoder replay 不支持投机解码。

启示:以「有界计算」换「更低缓存占用 + 更高命中」→ prefill 1.56× / 1.37×。这跟推测解码的「草稿先验 + 验证」同源:用一点受控重算换全局省缓存。和本人 OpenInfer / Qwen3-4B DFlash 的「轻量草稿 + 验证接受」是同构取舍——缓存边界的学问可直接借鉴。

我的判断:V4.1 把「该缓存什么」的答案从「全量窗口 KV」改成「压缩 KV + 末尾有界重算」,本质是注意力缓存的 Pareto 前沿再推一步。推理框架的胜负手,越来越落在「KV 边界管理」上,而非单纯算子堆料。

常驻专题

PD 分离:SGLang + Mooncake 万亿 Token 生产实践(Prefill 开 HiCache、命中 >90%、读取 <50ms);vLLM MultiConnector 支持 XpYd(P2P MooncakeConnector + 共享池 MooncakeStoreConnector,「读先到先得、写广播」);llm-d DisaggregatedSet 统一编排 NIXL / Mooncake / MoRIIO。

架构演进:V4.1 SWA 有界重算;SGLang DeepEP v2 + W4A8 MoE + LayerNorm SP;vLLM MRV2 默认 + batch-sharded sampling + CUDA graph 内存纳入 auto-sizing + per-request 投机指标。

PyTorch vs transformers:本周期无新「脱离 transformers」PR;信号偏反向——vLLM 把 FlexOlmo / Olmo3 / Hunyuan 迁回 Transformers 后端;企业实测 Qwen3.6-35B-A3B 弃 transformers+accelerate 用 vLLM+SGLang(P99 3.2s→412ms,根因 past_key_values 静态 tuple 深拷贝)。结论:自研栈赢在 KV 管理与批调度。

Step 适配:近 72h 无新增适配 PR;step-3.7-flash(198B / 11B 稀疏 MoE、256K、原生多模态 + 工具调用)自托管 vLLM stepfun37(MTP)成熟度 > SGLang dev- 镜像(EAGLE),NVFP4 约 4 卡。

三、AI 论文与产业热点

今日重点(1 句)

Meta 的 SAM 把「分割」从一类一模型变成可提示的通用能力,证明视觉也能有基础模型;它正是机器人「看懂世界」的视觉前端——与今日「管动」的具身产业动态正好互补。

论文核心(SAM / Meta AI, arXiv:2304.02643, ICCV 2023)

算子讲解:QK-Norm

性能优化:ZeRO / FSDP(分片数据并行)

产业热点(具身智能公司 / 产业链速递)

⚠️ 产业动态不构成投资建议。

四、一句话结论

SGLang + Miles 抢下 DeepSeek-V4.1 Day-0(有界重算换低缓存,8×H200 prefill 1.56×、pass@1 无损),是本期唯一兼具实测与源码级解读的大更新;vLLM 维持 v0.29.0 却补出 Blackwell −33.6% / Hopper +12.9~25.2% 的部署红利,并移除 10 个废弃架构(硬 breaking);SGLang + Mooncake 把 KV 池化拉到日均万亿 Token、命中 >90%;论文侧 SAM 把分割变「可提示」通用接口,成为机器人视觉前端,QK-Norm 根治 loss spike、ZeRO/FSDP 用通信换显存支撑千亿 VLA 训练,而优必选 5000 万出海、智元 44% 份额、宇树量增利减、DeepSeek V4.1-Flash 把 KV 砍到 1/4,正把「看懂 + 管动」的具身主线逐个标上价格。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。