★ 今日最值得关注
SGLang + Miles 抢下 DeepSeek-V4.1 的 Day-0 支持——「有界重算换低缓存」把 8×H200 prefill 打到 1.56×、AIME 2026 pass@1 无损(453/480),是近 72h 唯一「明确实测数字 + 可源码级解读」的大更新;vLLM 维持 v0.29.0(Blackwell 端到端时延 −33.6%、Hopper 低延迟 GEMM +12.9~25.2%),并移除 10 个废弃架构。
三层事实:
- SGLang + Miles 在 09-10 给出 DeepSeek-V4.1 Day-0 支持:encoder-side bounded replay / decoder-side tail-only 两套方案,8×H200 prefill 1.56×、4×GB300 1.37×,AIME 2026 pass@1 无损(453/480)——不是「宣布」,是有实测通过率与源码路径的大更新。
- vLLM 维持 v0.29.0(09-09,近 72h 无新 tag),但本周期补出真性能红利:分代 kernel 重调让 Hopper 低延迟 GEMM +12.9~25.2%、Blackwell autotuning 端到端时延 −33.6%;同时移除 10 个废弃架构(Arctic / Chameleon / MPT)+ 旧 api_server 路径,是破坏性变更,须先迁移。
- SGLang + Mooncake 把 KV 池化标杆拉到日均万亿 Token:命中 >90%、批量读取 <50ms,单机效率 3×/总产能 30×——PD 分离从论文配置变成生产线。
可执行结论:这是「缓存什么 vs 重算什么」的边界取舍,和本人 OpenInfer / Qwen3-4B DFlash 推测解码同构——用有界重算换更低缓存与更高命中。SGLang 用户可直接开启 V4.1 支持试 prefill;vLLM 用户升级前先在 staging 验 parity(移除 10 架构是硬 breaking)。
值得单独说:本期主角从 vLLM(0907/0910 连续发版)换成 SGLang——Day-0 支持 DeepSeek-V4.1 这种「卡发布窗口」的速度战,是推理框架的护城河之一。但 vLLM 的 Blackwell −33.6% / Hopper +12.9~25.2% 仍是部署侧实打实的红利,别只盯着发版节奏。
二、vLLM & SGLang 社区跟踪
版本状态:vLLM v0.29.0(正式版,09-09) 维持最新稳定,近 72h 无新 tag;SGLang v0.5.19(09-05) 仍为最新稳定版,但 09-10 借 Miles 拿到 DeepSeek-V4.1 Day-0 支持(非 tag,属生态适配)。
vLLM v0.29.0
新特性 / 架构演进:
- Model Runner V2 全量默认(收官):CUDA Graph 显存 profiling 纳入 KV cache 自动 sizing → 升级须重查模型兼容性 / 图捕获 / 显存余量。
- batch-sharded sampling:每步 logits 显存降到 1/TP,高并发采样显存天花板抬高。
- 分代 kernel 重调:Hopper 低延迟 GEMM +12.9~25.2%,Blackwell autotuning 端到端时延 −33.6%。
- Mamba 前缀缓存保留 prefill checkpoint,TTFT 改善 9~25%;Kimi-K3 latent tail 降入 Mamba metadata。
- 新增模型:Hy4-preview(腾讯 770B / 49B MoE)、Qwen3.8-Flash-Next 等。
破坏性变更:
| 变更 | 影响 |
|---|---|
| 移除 10 个废弃架构(Arctic / Chameleon / MPT) | 依赖这些模型的须先迁移,否则启动失败 |
旧 api_server 路径废弃 | 启动脚本改 vllm serve |
| CUDA Graph 显存 profiling 纳入 KV auto-sizing | 升级后须重查显存余量与图捕获 |
SGLang v0.5.19 + DeepSeek-V4.1 Day-0(09-10)
新特性 / 重大适配:
- DeepSeek-V4.1 Day-0 支持(LMSYS 09-10):encoder-side bounded replay / decoder-side tail-only;8×H200 prefill 1.56×、4×GB300 1.37×,AIME 2026 pass@1 无损(453/480)。
- Lean attention 在 MI300X / MI355X 默认开启:长 / 异构 decode 吞吐 ≤1.52×、ITL 降 3.62×;GLM-5.2 8×MI355X TPOT 23→8ms。
- 统一 radix tree 成默认前缀缓存(Breaking);DeepEP v2 ElasticBuffer(
--moe-a2a-backend deepep_v2)支持跨节点 MoE decode 进 CUDA graph。 --enable-layernorm-sp(Qwen3-8B prefill H100 −3.5% / B200 −5.6%);Hopper W4A8 MoE 使 DeepSeek-V4-Flash 输出吞吐 +12%。
生产实践:SGLang + Mooncake 日均万亿 Token——Prefill 开 HiCache、Mooncake Store 池化节点 DRAM,KV 命中率 >90%、批量读取 <50ms,单机效率 3× / 总产能 30×。
原理:DeepSeek-V4.1 的「有界重算换低缓存」(SGLang 实现)
DeepSeek-V4.1 是 92 层 gated linear + full attention 交替的混合注意力。SGLang 不缓存每层窗口 KV,改「有界重算」重建:
机制:① decoder-side tail-only——第 20 层为最终 compressed-KV 源,21–39 层复用其 compressed KV + indexer keys,每 chunk 仅对末尾 ≤128 token 计算;② encoder-side bounded replay——命中缓存时重算前缀末 128 token 重建窗口 KV。两者把局部注意力的截断限制在重建边界(有界近似,须实测),均 opt-in,encoder replay 不支持投机解码。
启示:以「有界计算」换「更低缓存占用 + 更高命中」→ prefill 1.56× / 1.37×。这跟推测解码的「草稿先验 + 验证」同源:用一点受控重算换全局省缓存。和本人 OpenInfer / Qwen3-4B DFlash 的「轻量草稿 + 验证接受」是同构取舍——缓存边界的学问可直接借鉴。
我的判断:V4.1 把「该缓存什么」的答案从「全量窗口 KV」改成「压缩 KV + 末尾有界重算」,本质是注意力缓存的 Pareto 前沿再推一步。推理框架的胜负手,越来越落在「KV 边界管理」上,而非单纯算子堆料。
常驻专题
PD 分离:SGLang + Mooncake 万亿 Token 生产实践(Prefill 开 HiCache、命中 >90%、读取 <50ms);vLLM MultiConnector 支持 XpYd(P2P MooncakeConnector + 共享池 MooncakeStoreConnector,「读先到先得、写广播」);llm-d DisaggregatedSet 统一编排 NIXL / Mooncake / MoRIIO。
架构演进:V4.1 SWA 有界重算;SGLang DeepEP v2 + W4A8 MoE + LayerNorm SP;vLLM MRV2 默认 + batch-sharded sampling + CUDA graph 内存纳入 auto-sizing + per-request 投机指标。
PyTorch vs transformers:本周期无新「脱离 transformers」PR;信号偏反向——vLLM 把 FlexOlmo / Olmo3 / Hunyuan 迁回 Transformers 后端;企业实测 Qwen3.6-35B-A3B 弃 transformers+accelerate 用 vLLM+SGLang(P99 3.2s→412ms,根因 past_key_values 静态 tuple 深拷贝)。结论:自研栈赢在 KV 管理与批调度。
Step 适配:近 72h 无新增适配 PR;step-3.7-flash(198B / 11B 稀疏 MoE、256K、原生多模态 + 工具调用)自托管 vLLM stepfun37(MTP)成熟度 > SGLang dev- 镜像(EAGLE),NVFP4 约 4 卡。
三、AI 论文与产业热点
今日重点(1 句)
Meta 的 SAM 把「分割」从一类一模型变成可提示的通用能力,证明视觉也能有基础模型;它正是机器人「看懂世界」的视觉前端——与今日「管动」的具身产业动态正好互补。
论文核心(SAM / Meta AI, arXiv:2304.02643, ICCV 2023)
- 一句话定位:给点 / 框 / 掩码 / 文本提示即可零样本抠出目标,无需重训,把分割变成「可提示」的通用接口。
- 核心思想①(三部件解耦):Image Encoder(ViT-H/14,~632M,每图只跑一次)+ Prompt Encoder(轻)+ Mask Decoder(2 层 Transformer,~4M,毫秒级)——贵的算一次,交互部分随便点。
- 核心思想②(歧义友好):一次输出 3 个掩码(整体 / 部分 / 子部分),训练取 min-loss 回传;
L = 20·L_focal + L_dice + L_mse。 - 核心思想③(数据引擎):SA-1B = 1100 万图 / 11 亿掩码(比前最大分割集大 ~400×),三轮迭代(人工 → 模型辅助 → 自动生成 + 抽查)。
- 影响:视觉基础模型的开端;对具身 = VLA 的视觉前端,零样本分割目标物供策略网络选抓取点。
算子讲解:QK-Norm
- 定位:注意力前对 Q / K 各按头做 RMSNorm(
q̂=γ⊙q/RMS(q)),使 ‖q̂‖ 固定 → logits 有界 → softmax 不饱和 → 根治大模型 loss spike。 - 顺序与代价:先 Norm 再 RoPE、Norm 内 fp32;只多 1–2% step time,纯换稳定性。
- 在用:Qwen3、Gemma 2/3、OLMo 2、ViT-22B(SAM 骨干 ViT 系);DeepSeek MLA 不用。
性能优化:ZeRO / FSDP(分片数据并行)
- 定位:让千亿模型装进显存。显存账:Adam 训练每参数 16Ψ(fp16 权重 2 + 梯度 2 + fp32 master 4 + Adam m 4 + v 4)。
- 机制:ZeRO-1/2/3 分别分片优化器 / 梯度 / 参数,每卡 ≈ 16Ψ/N(Z3);FSDP = PyTorch 原生 ZeRO-3。
- 本质:用通信换显存,是千亿模型 3D 并行地基。具身关联 = VLA 训练降本、量化 / 蒸馏 = 端侧降本。
产业热点(具身智能公司 / 产业链速递)
- 【具身】优必选(09880.HK):再拿 5000 万元海外订单(多台 Walker S2),国产人形出海加速 → 利好整机与「大脑」,映射机器人 ETF 华夏(562500)。
- 【具身】智元机器人 / 上纬新材(688585·A股):年内出货超 8400 台、占全球约 44% 居首 → 利好 A 股智元映射平台。
- 【具身】宇树科技(688836·A股):出货约 5900 台、占约 31%,但 Q1 扣非净利同比 −52.55%——「量增利减」提示价格战,关注毛利率。
- 【产业链】小鹏高阶人形产线、特斯拉 Optimus 批量订单、智元 AGILE 2.0 端到端感控模型落地 → 利好执行器(三花智控 002050 / 拓普集团 601689)、减速器(绿的谐波 688017)、机器人 ETF(562500)。
- 【通用】DeepSeek V4.1-Flash 将 KV Cache 降至 1/4;GPT-6 Astra 训练破 10 万卡;Kimi K2.8;高德 ABot-Earth 0.7 世界模型;外滩大会风向由「对话」转「干活」。
⚠️ 产业动态不构成投资建议。
四、一句话结论
SGLang + Miles 抢下 DeepSeek-V4.1 Day-0(有界重算换低缓存,8×H200 prefill 1.56×、pass@1 无损),是本期唯一兼具实测与源码级解读的大更新;vLLM 维持 v0.29.0 却补出 Blackwell −33.6% / Hopper +12.9~25.2% 的部署红利,并移除 10 个废弃架构(硬 breaking);SGLang + Mooncake 把 KV 池化拉到日均万亿 Token、命中 >90%;论文侧 SAM 把分割变「可提示」通用接口,成为机器人视觉前端,QK-Norm 根治 loss spike、ZeRO/FSDP 用通信换显存支撑千亿 VLA 训练,而优必选 5000 万出海、智元 44% 份额、宇树量增利减、DeepSeek V4.1-Flash 把 KV 砍到 1/4,正把「看懂 + 管动」的具身主线逐个标上价格。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。