★ 今日最值得关注
vLLM #56935(09-16 合入)——把 DeepSeek-V4.1 的 FlashMLA mega attention + NVFP4 压缩 KV 一次打通并设为 SM100 默认:首个把「融合 kernel」与「更低精度 KV」同时做成默认路径的改动(压缩记录比 fp8_ds_mla 小 45%),还附了罕见的端到端精度证据(DSpark k=5 真实拒绝采样下 gsm8k 0.9318 vs 0.9265、gpqa 0.9053 vs 0.9066),并明确划出三条边界——TP1 明显更快、prefill 未测、非 SM100 不受影响。这是本期框架侧最干净的一条信号:把 KV 容量账重算权交还硬件默认路径。
它和今天的论文主线其实是同一条:机器人落地的瓶颈正从「模型够不够强」转向「能不能持续采到真实部署数据」——π*0.6/RECAP 用「预训练通用 VLA + 任务级真机 RL 微调」产出可部署策略(最难任务吞吐 ×2+、失败率约减半、连续做咖啡 13 小时),证明模型侧已够用,卡点变成数据;而产业面「本体厂商集体补脑、但 2026H1 真实商用订单仅占 21.1%」是同一瓶颈的另一面。框架把 KV 账做薄、机器人把部署数据做厚,都是「把已有能力推到可用」的收口动作。
三层事实:
- 融合 kernel + 更低精度 KV 同时默认(#56935):mega-attention 把「Q 的 RoPE → 稀疏注意力 → 逆 RoPE → FP8 量化」四步压进一次 kernel launch,直写
wo_a消费的 buffer;NVFP4 记录 288 B/token(256 B e2m1 + 32 个 e4m3 scale,group 16),比 fp8_ds_mla 小 45%。不是「换个格式」,是「调度成本从 Python 侧移进 kernel」。 - 精度代价可忽略(首次给端到端证据):GB300 / CUDA Graph / decode,mega vs sparse 微秒,TP1 s_q=512 为 96/140(1.45×),TP2 起打平——决定变量是 live heads / padded heads 而非 batch size;草稿接受率几乎一致,即融合 kernel + 更小压缩记录无可测量精度损失。
- PD 分离首次可验证(SGLang #39500):新增可选 KV 传输 Adler-32 校验和(
--disaggregation-enable-kv-checksum,默认关),不匹配即中止请求并计数——PD 从「能跑」走向「可验证」,排障期建议开、稳态压测关。
可执行结论:如果你在跟踪 DeepSeek-V4.1 部署栈,#56935 是 B200/GB300 上必须重算 KV 容量账的信号——「KV 少 45%」直接改写并发上限假设;同时 SGLang 的六连 PR 把多模态 V4.1 走得比 vLLM 靠前,PD 校验和是生产排障的刚需开关。对本人 OpenInfer / Qwen3-4B DFlash,方向一致:把压缩/KV 生命周期做成默认路径,比堆宽草稿树更实在。
值得单独说:本期四个 vLLM bugfix(#57152/#57132/#56930/#57104)全在「V4.1 + 投机解码 + PD」交叉路径上——causal image SWA、ROCm V4 精度崩坏、EAGLE/dense draft 在 EP 下起不来、KV Connector + MTP 死锁。结论很硬:别停在 v0.29.0,跟 main 或等 v0.29.1。
二、vLLM & SGLang 社区跟踪
版本状态:vLLM stable v0.29.0(09-09),下一个候选 v0.29.1rc0(09-13);SGLang v0.5.19(09-05) 仍为最新稳定,近窗无新 tag。本期增量主要来自 main 分支,无正式发版(与 0916 同节奏)。
vLLM(main · DSv4.1 深水区 + 交叉路径 bugfix)
新特性 / 架构演进:
- #56935(09-16 合入):DSv4.1 的 FlashMLA mega attention + NVFP4 压缩 KV,新后端
FLASHMLA_MEGA_ATTN_DSV41成为 SM100 默认,压缩记录比 fp8_ds_mla 小 45%;影响=B200/GB300 上 KV 容量账要重算。 - 性能 #57204 / #57140:去掉 MegaMoE 的 padding 与 shared padding workaround、GDN 把 mixed 投机输出 scatter 回调用方 buffer;影响=MoE 少做无用 pad,长序列省显存与算力。
- PD 分离 #57077 / #54222:HiSparse 在 PD 下按逻辑 block 大小对齐 region-mapped pull(此前会静默拉错 KV);prefill worker 缓存命中进
prompt_tokens_details;影响=PD 成本收益终于可对着 token 明细对账。 - 硬件/生态 #55934 / #57210 / #55557:ROCm 上 triton 3.8 的 mxfp4 MoE(gpt-oss + DSv4)、DeepEPv2 进 SP 支持列表、Qwen4Exp 在 QSA 路径用 fp8_e4m3 主 KV;影响=AMD 侧 MXFP4 MoE 追平 NVIDIA 路线。
Bug 修复(交叉路径,建议跟 main):#57152(V4.1 causal image SWA)、#57132(ROCm 上 V4 精度崩坏)、#56930(EAGLE/dense draft 在 EP 下起不来)、#57104(KV Connector + MTP 在 KV 压力下死锁)——四个全在「V4.1 + 投机解码 + PD」交叉处。
SGLang(v0.5.19 · 多模态 V4.1 六连 + PD 可验证)
新特性 / 重大适配:
- DSv4.1 六连 PR:#39652 压缩/KV I-O/metadata kernels、#39656 RoPE 与 FP4 packing、#39657 Hopper FP8 matmul 与调优、#39664 mHC 计算与补偿投影、#39668 视觉塔与图像预处理、#39671 candidate indexer 库;影响=多模态 V4.1 目前 SGLang 走得比 vLLM 靠前。
- PD 分离 #39500(high priority):新增可选 KV 传输 Adler-32 校验和(
--disaggregation-enable-kv-checksum,默认关,不匹配即中止请求并计数);影响=PD 从「能跑」走向「可验证」。 - KV 架构 #37615 [kv-shard 2/4] Sharded pools(Blackwell / memory-pool / unified-radix-cache)、#39089 HiCache 在 host pool 备份 MXFP8 KV scales;影响=为 Blackwell 大池 + 统一 Radix 树铺路,KV 卸载/回迁不再丢精度元数据。
- Router 生产化 #39002 / #39016 / #38774:sampling contract 3/3(splice 注入不重新序列化)、SIGTERM 前先撤销 readiness 让 k8s 摘 Pod、修 NIXL 后端初始化的 device context;影响=滚动发布不再掉请求。
其他:#38526 支持 Ling-3.0-flash-VL、#37810 ROCm 上 DSV4 启用 breakable CUDA graph prefill、#39875 修 AMD dsv4 server 启动——AMD 上 V4 可用性快速补齐。
原理:#56935 的 mega-attention 融合 kernel + NVFP4 压缩 KV(把 KV 账做薄,不止换格式)
- 四步合一:mega-attention 把「Q 的 RoPE → 稀疏注意力 → 输出逆 RoPE → FP8 量化」压进一次 kernel launch,直写
wo_a消费的 buffer;靠新能力位accepts_unnormed_unroped_query让 kernel 自己做 Q norm/RoPE,TP1 时 64 live head 恰好等于 kernel head 数,Q 填充这步直接跳过。 - 一步一对 buffer:输出走 QuantizedActivation(fp8 e4m3 + packed ue8m0 scales),prefill chunk 与 decode segment 填不相交 token 区间,一次 fp8_einsum 覆盖全部 N token;NVFP4 记录 288 B/token(256 B e2m1 + 32 个 e4m3 scale,group 16),比 fp8_ds_mla 小 45%。
- 性能(GB300 / CUDA graph / decode,mega vs sparse 微秒):TP1 s_q=512 为 96/140(1.45×),TP2 起打平——决定变量是 live heads / padded heads 而非 batch size。精度:DSpark k=5 真实拒绝采样下 gsm8k 0.9318 vs 0.9265、gpqa 0.9053 vs 0.9066,草稿接受率几乎一致,即融合 kernel + 更小压缩记录无可测量精度代价。未覆盖:prefill 未测、仅 SM100。
我的判断:#56935 的意义不在「KV 小 45%」这个数字,而在它把「融合 kernel + 低精度 KV」做成了默认路径——把 Python 侧调度成本移进 kernel,本质和 0913 的「VRAM 分层池化」、0916 的「DFlash2 抬 E[L]」同源:都在 tradeoff 上找最优工作点。对本人 OpenInfer / Qwen3-4B DFlash,下一步应实测「mega-attention 式融合 kernel + NVFP4 压缩 KV」能否在 Qwen3-4B 上复现 45% KV 缩减且精度无损。
常驻专题
PD 分离:SGLang #39500 给 KV 传输加可选校验和;vLLM #57077 修 HiSparse 跨逻辑 block 的 pull 对齐、#54222 让命中率进 token 明细。社区 09-15 综述点名未解矛盾:chunked prefill 在两家默认开启,批评者称其为局部最优,但「上下文长度 × 并发」的交叉曲线至今无人发布。
架构演进:KV 数值格式继续下探(vLLM NVFP4 288 B/token、SGLang FP4 packing + MXFP8 scale 备份);融合 kernel 取代多 kernel 编排(把 Python 侧调度成本移进 kernel);投机解码与调度/KV 生命周期深度耦合(本轮四个 bugfix 全在其交叉处)。
PyTorch vs transformers:本周期无新的「脱离 transformers」PR/讨论(vLLM 151、SGLang 132 个合入均无)。边界未松动——模型层继续用 transformers,只有 MoE/RoPE/FP4 packing 等热点算子才自研 kernel。
Step 适配:框架侧近 72h 无 Step 相关合入,沿用既有结论(vLLM stepfun37 + MTP 一等公民 > SGLang dev 镜像 + EAGLE)。产业侧 09-16 CEO 姜大昕讲金融垂类「FDE + SaS」新范式、端侧负责人俞刚讲 AI 2.0 泛化与质量;StepAudio 3 五款已上线,仅 Realtime 走 WebSocket、其余走 HTTP。
三、AI 论文与产业热点
今日重点(1 句)
Physical Intelligence 的 π*0.6 / RECAP(arXiv:2511.14759)证明「预训练通用 VLA + 任务级真机 RL 微调」能产出可部署策略——机器人落地的瓶颈正从「模型够不够强」转向「能不能持续采到真实部署数据」,这与今日产业面「本体厂商集体补脑、但 2026H1 真实商用订单仅占 21.1%」形成同一条主线的两面;Selective Scan / S6(Mamba)用 O(N) 关联扫描把推理 KV cache 打到数 MB、弹性推理把 GPU 利用率从 ~20% 拉到 60%+,正好把「端侧大脑 + 真机部署」的成本模型从算法层补到系统层——而优必选万台工厂、智元 A3 Ultra 千台级量产、宇树市值回撤 57%、千寻三轮融资超 45 亿、监管点名「中标 ≠ 商业收入」,正把具身「补脑 + 落地」逐一标价。
论文核心(π*0.6 / RECAP · Physical Intelligence,arXiv:2511.14759)
- 一句话定位:RECAP(RL with Experience and Corrections via Advantage-conditioned Policies)把演示 + 自主 rollout + 人类干预三类异构数据统一进一个离线 RL 闭环;π*0.6 = π0.6 加 advantage 条件化。
- 三代演进:π0.5 → π0.6(更多机器人平台 / 骨干换 Gemma 3 4B / 动作专家扩到 860M)→ π*0.6(advantage 条件化)。策略输出 50 Hz action chunk + 离散子任务文本 ℓ̂。
- 分布式价值函数 V:B = 201 个离散 value bin,交叉熵训练;奖励「进度制」(成功 episode 奖励随步数线性升到 0,失败给大负常数)→ V 实为「离成功还差几步」,归一到 (−1, 0);V 骨干仅 670M。
- Advantage 条件化(核心):I_t 作额外文本 token 插在子任务之后、动作之前 → 只影响动作 log-likelihood;训练随机丢弃 I_t,推理 I_t=True(β=1)或 CFG;人类干预动作强制 I_t=True。损失 Eq.3 把策略提取从 PPO 在线交互拉回离线加权回归,绕开大模型 PPO 不稳定。
- 结果:最难任务吞吐 ×2 以上、失败率 约减半;装箱成功率 90%+;连续做咖啡 13 小时、新家叠陌生衣物 >2 小时。失败多因「policy 跑超时」(动作慢)而非动作错 → 主要买到速度。
- 局限:人类干预质量不保证、探索偏贪心、对「演示做不了」的任务帮助有限、未开源(openpi 仅 π0 / π0-FAST / π0.5)。
算子讲解:Selective Scan / S6(Mamba)
- 定位:把 SSM 的 Δ_t, B_t, C_t 变成输入 x_t 的函数,S4(LTI,可折叠成一次全局卷积)→ S6(时变,获得内容感知门控)。
- 工程核心:associative scan(结合律并行前缀扫描)+ 硬件感知 CUDA kernel(离散化/扫描/门控融合,隐状态只留 SRAM 不回写 HBM)——角色等价于注意力里的 FlashAttention。
- 复杂度:计算 O(N) vs O(N²);推理每层固定大小隐状态、无 KV cache(100 万 token:数 GB → 数 MB);论文报告推理吞吐最高约 5×。
- 短板:关联召回(MQAR)弱 → 长文档 QA / 精确引用仍偏 Transformer;落地形态是混合架构:Jamba、Nemotron-H、Granite 4.0、Zamba、Codestral/Falcon Mamba;国内同族 Qwen3-Next Gated DeltaNet、MiniMax Lightning Attention。
- 坑:只看 perplexity 会误判;SSM:attention 层配比是超参(直接决定 KV cache 大小);训练 kernel(并行扫描)与推理 kernel(单步递推)不是同一个,须分别 profile。
性能优化:弹性推理 / Serverless LLM Serving(Scale-to-Zero)
- 常规清单:量化(GPTQ/AWQ/FP8)、剪枝、蒸馏、PagedAttention、continuous batching、LoRA、FlashAttention、CUDA Graphs、KV 量化。
- 前沿清单:稀疏 MoE + EP、MLA/NSA、线性注意力与 SSM、投机解码(MTP/EAGLE/Medusa/DSpark)、PD 分离、BitNet 1-bit、KV 量化与卸载、编译优化(TorchCompile/FA-4)、序列与上下文并行、Expert Offload、MoD、语义缓存。
- 深挖要点:GPU 按秒计费 + 流量潮汐 → 固定常驻利用率仅 15–30%。四件事:① SLO-aware 扩缩(按队列等待 / P99 TTFT);② Scale-to-Zero;③ 冷启动消除(权重加载 70B bf16≈140GB 千兆网 100s 量级 → GPUDirect Storage / 顺序读 / 权重快照压到秒级;运行时 CUDA context + 图捕获 + JIT → 预热池 keep-warm / CRIU 快照);④ 多模型复用一张卡(cache-aware 路由、S-LoRA 统一分页、错峰常驻)。
- 最实用组合:与 PD 分离叠加(prefill 弹性可抢占 + decode 保底常驻),再叠 Spot + checkpoint 续跑。收益:冷启动数十秒 → 亚秒~数秒;GPU 利用率 ~20% → 60%+;单位 token 成本可降 2–5×。
- 具身关联:云端「大脑」按需弹性 + 端侧固定时延预算 = robot-as-a-service 成本模型的底层变量;今日印证 = 服贸会算力贷/算力词元贷、DeepSeek 乌兰察布 1 GW(≥16 万颗昇腾 950DT)、无问芯穹 APXInf 端侧引擎(最低约 26 ms)。
产业热点(具身公司 / 产业链速递 · 置顶)
- 【具身】优必选 09880.HK:万台级工业人形超级智慧工厂投产,每 10 分钟下线 1 台、年产能超万台;2026H1 营收 12.69 亿(+104.2%),全尺寸人形收入 5.9 亿成第一大来源(毛利 >70%)、新增订单超 10 亿(空客/头部车企/国家电网);但 U1 交付预期下调至 1500–2000 台,力争 Q4 单季经调整 EBITDA 转正 → 中性偏正面但兑现打折(产能 ≠ 订单 ≠ 收入)。
- 【具身】智元 → 上纬新材 688585:9/16 发布远征 A3 Ultra 全球首个规模化量产全尺寸人形商用落地实景(4S 店/酒店/便利店),700 TOPS + 20 DoF 全向触觉灵巧手 + 360° 全域感知 + UWB/RTK,完成千台级车规量产验证、7×24 值守;AGILE 2.0 + GE-Act 2.0 同期 → 利好。
- 【具身】宇树 688836:上市满月市值 4449 亿 → 约 1900 亿(−57%,蒸发超 2200 亿);2026H1 营收 11.52 亿(+48.54%) 但扣非净利 −19.34%,科研教育占 73.6%、工业物流仅约 9%;开源 UnifoLM-WLA-1.0 → 估值回归。
- 【具身】千寻智能:三个月三轮融资累计 超 45 亿元(顺为/云锋罕见同框,宁德时代/京东/TCL 创投入局);Spirit v1.6 登顶北美 RoboArena 全球第一(首个中国具身模型);Moz1 工业人形 + Moz2 商用服务,首条产线已在宁德时代中州基地投运 → 强利好。
- 【监管】行业洗牌 ⚠️:梅卡曼德创始人点名银河通用「数采中心+关联交易制造虚假收入」,千寻/星海图遭举报;2026H1 国内人形中标总额 17.23 亿元但真实商用订单仅占 21.1%;传监管对人形 IPO 非正式窗口指导 → 「中标 ≠ 商业收入」。
- 【产业链】一级市场 & 训练场:ENCOS 因克斯超 3 亿 B 轮(关节模组→平台化)、RobotPlusPlus 数亿元 C 轮(船体除锈 200 万+ 小时,「作业即数采」)、信通院称全国已建成启用 超 70 家具身智能训练场 → 映射 绿的谐波 688017 / 三花 002050 / 拓普 601689 / 机器人 ETF 562500 / 地平线 09660.HK。
- 【端侧 VLA】8 天 3 家连发 5 模型:无问芯穹联合清华/上交开源 APXInf 端侧引擎(4090/Jetson Orin/Thor,最低约 26 ms)、具脑磐石 Cog-WM 1.0 类脑世界模型、原力灵机 DM0.5 六榜第一——本体厂商集体「补脑」。
- 【通用侧】:OpenAI 发布周(GPT-6 Sol 或周四上线)、DeepSeek 开源 Harness 智能体框架 + 拟建乌兰察布 约 1 GW 数据中心(≥16 万颗昇腾 950DT)+ 筹备科创板 IPO、豆包 Seed-2.1-Pro-0915(图像/视频推理 Token 降 30%+)、九部门《智能网联新能源汽车”十五五”规划》定调「AI + 汽车」(地平线 09660.HK 受益)、蚂蚁开源安全护栏 SingProbe Infra(适配 29 模型、接入 SGLang/vLLM、开销 <0.5%)。
⚠️ 产业动态不构成投资建议。
四、一句话结论
框架侧 vLLM #56935(09-16 合入)把 DeepSeek-V4.1 的 FlashMLA mega attention + NVFP4 压缩 KV 一次打通并设为 SM100 默认——首个把「融合 kernel」与「更低精度 KV」同时做成默认路径的改动(KV 少 45%、TP1 快 1.45×、精度无差),并明确三条边界;SGLang 用六连 PR 铺完多模态 V4.1、PD 分离首次可开 Adler-32 校验和(#39500,从「能跑」走向「可验证」);四个交叉路径 bugfix 提示别停在 v0.29.0、跟 main 或等 v0.29.1。论文侧 π*0.6/RECAP(Physical Intelligence,arXiv:2511.14759)证明「预训练通用 VLA + 任务级真机 RL 微调」可部署(吞吐 ×2+、失败率减半、连续做咖啡 13 小时),机器人瓶颈正从模型强度转向真实部署数据,与产业「本体补脑但真实商用订单仅 21.1%」同线;Selective Scan/S6(Mamba)用 O(N) 关联扫描把推理 KV cache 打到数 MB、弹性推理把 GPU 利用率从 ~20% 拉到 60%+,把「端侧大脑 + 真机部署」成本模型从算法补到系统层——而优必选万台工厂、智元 A3 Ultra 千台量产、宇树回撤 57%、千寻三轮超 45 亿、监管点名「中标 ≠ 商业收入」,正把具身「补脑 + 落地」逐一标价。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。