★ 今日最值得关注
vLLM HiSparse 三连(#53781 + #56061 + #56629)把「显存不够」的解法从「省着用」推进到「分层与池化」——稀疏 MLA 解码首次把 pinned host 内存变成 GPU 显存的延展层,全程 GPU 侧解析、兼容 CUDA Graph replay、跨 TP rank 共享一份 host pool,直抬长上下文并发上限;SGLang 用 graph-pool 四连(#39176~#39180)把 CUDA Graph 显存从「各图独占」做成「可借用池」。三方均无新 tag(vLLM v0.29.0 · 09-09 / SGLang v0.5.19 · 09-05 / Step 冻结),增量全部来自 main。
三层事实:
- vLLM HiSparse(#53781,09-12 合入,+14373/−1017,124 文件):稀疏 MLA 解码加 host 缓存,尽量留 device,仅在 GPU 容量需回收时才溢出到 pinned host 内存(取代 #46326「always host-resident」),解码显存上限从 GPU 容量松绑到 host RAM。
- 跨 rank 共享 + 指标(#56629 + #56061):用 mmap-backed pool 跨本地 TP rank 共享一份 host cache,host cache 占用降到约 1/TP;KV connector stats 暴露缓存指标,可观测。
- SGLang graph-pool 四连(09-12~09-13):#39176 复用存活图可执行体、#39177 借用状态收进 runtime + 预切可复用段 + 生命周期检查(降碎片)、#39178 借用容量检查、#39180 借用必须在自己分配流上(跨流会搁浅段致 OOM)——CUDA Graph 显存从「各图独占」变「可借用池」。
可执行结论:三级解析 + LRU 的「按需只拉选中行」与本人 OpenInfer / Qwen3-4B DFlash 推测解码同构——缓存边界的学问可直接借鉴:草稿/验证 KV 也能照此分层。部署侧:长上下文高并发可盯 HiSparse + graph-pool 省出的显存天花板;升级前先在 staging 验 parity(两者皆 main 分支增量,非 tag,稳定性待观察)。
值得单独说:本周主角从「抢发版」(0907/0910/0912 连发)又回到「显存工程」——没有新 tag,但把 KV 与 CUDA Graph 显存都做成了「可分层 / 可借用」的资源池。推理框架的护城河,越来越落在「显存边界管理」上。
二、vLLM & SGLang 社区跟踪
版本状态:vLLM v0.29.0(09-09) 维持最新稳定,近窗无新 tag;SGLang v0.5.19(09-05) 仍为最新稳定,近窗无新 tag;Step 冻结。本期增量全部来自 main 分支,无正式发版。
vLLM(main · 显存分层主线)
新特性 / 架构演进:
- HiSparse 三级 host 缓存(#53781):稀疏 MLA 解码加 pinned host 溢出层,supersedes #46326「always host-resident」——仅在 GPU 容量需回收时才溢出,稀疏 MLA 解码显存上限从 GPU 容量松绑到 host RAM。
- 跨 TP rank 共享 host cache(#56629):mmap-backed pool,rank0 写、peers 经 IPC event 等,host cache 占用降到约 1/TP;#56061 经 KV connector stats 暴露缓存指标。
- 稀疏 MLA 打通 PCP + DCP(#56157):GB200×4 / GLM-5.3 NVFP4 / TP1·PCP4·DCP4,新增 MoE all-reduce fast path,省掉按 PCP 复制 decode 行。
- Rust 前端补齐:#54821/#56378/#56386/#55047;扩容/预热路径修复 #56610(ROCm 弹性 EP 死锁)、#56526、#54416、#56452;DSv4 warmup 系列 #50178/#56323/#53566(压冷启动)。
破坏性变更:
| 变更 | 影响 |
|---|---|
| HiSparse 取代 always-host-resident 策略(#53781) | 稀疏 MLA 解码行为变更,旧配置须重验显存与命中 |
| PCP+DCP 的 MoE all-reduce fast path(#56157) | 并行路径变更,须重验 GLM-5.3 NVFP4 等模型 parity |
| DSv4 warmup 系列(#50178/#56323/#53566) | 冷启动路径变更,须观察首请求时延 |
SGLang(main · 图显存池化主线)
新特性 / 重大适配:
- graph-pool 四连(09-12~09-13):#39176 复用存活图可执行体、#39177 借用状态收进 runtime + 预切可复用段 + 生命周期检查(降碎片)、#39178 借用容量检查、#39180 借用必须在自己分配流上(跨流会搁浅段致 OOM)——CUDA Graph 显存从「各图独占」变「可借用池」。
- 缓存 Rust 化:#37584 SWA 分支点缓存移植到 Rust TreeCore;#38482 拆节点保留 aux LRU 近期性。
- 默认值变更:#39165
--dcp-comm-backend对每模型默认解析为 fi_a2a/a2a。 - PD / 投机 / 新模型:#36651 Qwen3.8-Next PD state transfer;#39190 Kimi-K3 DCP under HiCache L1+L2 with DSPARK;#39154 DSpark per-step metadata 上 device;#34556 支持 Mamba 2&1;GLM-5.3-Flash cookbook(#39213,MTP 5/1/6、EP1+flashinfer_trtllm on Blackwell);Responses API 扩展(custom tools / 加密推理回放)。
生产实践:graph-pool 把 CUDA Graph 显存做成可借用池后,多图并发的显存碎片与独占浪费下降,长上下文稳态吞吐更平滑(main 分支增量,尚未进 v0.5.19 tag)。
原理:HiSparse 三级解析(#53781 源码注释)
HiSparse 用一个 fused CUDA resolver 把每个 top-k 选中位置映射到:① 常规 resident GPU page;② 请求自身 GPU hot buffer 中已有的行;③ pinned host pool。顺序有讲究——resident 命中在 hot-cache 查找之前返回(免无谓 host 拉取),hot 命中更新 GPU 侧 LRU,miss 仅 gather 被选中的 host 行替换 LRU 条目。解析/替换/LRU 更新全留在 GPU 侧且兼容 CUDA Graph replay;活跃 indexer cache 仍 device-resident 不参与分层。
启示:稀疏注意力的 top-k 本身就是「工作集描述符」,按需只拉选中行而非整页——这与本人 OpenInfer(Qwen3-4B 推测解码,验证集稀疏、显存敏感)同构:三级解析 + LRU 可直接借鉴到草稿/验证 KV。这跟 V4.1「有界重算换低缓存」同源:都是在 cache 边界上做 Pareto 取舍。
我的判断:本周主线是「显存池化 / 分层」。HiSparse 把 host 变成 GPU 延展层、graph-pool 把 CUDA Graph 显存变成可借用池——推理框架的胜负手,越来越落在「显存边界管理」上,而非单纯算子堆料。
常驻专题
PD 分离:SGLang #36651(Qwen3.8-Next PD state transfer)+ #39190(Kimi-K3 DCP under HiCache L1+L2);vLLM HiSparse 是 PD「D」段的显存延展,与外部 KV 池化(Mooncake)互补而非替代 → D 段正被拆成 device / host 两级。
架构演进:本窗主线 = 显存池化 / 分层(HiSparse 三级 + graph-pool);次为编译预热系统化(vLLM DSv4 warmup)+ Rust 前端 / TreeCore 补齐。
PyTorch vs transformers:本窗无「脱离 transformers」新 PR;仍分层——模型定义靠 transformers,数据面与运行时靠自研。
Step 适配:近窗无新增;唯一新信号 = Steptron 训练框架开源(SteptronOss,09-04,587★)。推理侧仍建议 vLLM stepfun37 + MTP 优先;依赖 MTP 须先验 --speculative-config '{"method":"mtp"}' 能否起服。
三、AI 论文与产业热点
今日重点(1 句)
智元 GO-1 用 ViLLA 隐式动作把动作知识从「真机稀缺标注」解放到「海量无标注视频」,让 VLA 第一次具备跨本体迁移能力;而 AdaLN-Zero 与 CUDA Graphs 补齐「确定性时延执行」链路,正好对应今日具身产业的「管动」主线。
论文核心(GO-1 / ViLLA · 智元 × 上海AI Lab,2025-03-10 发布,2025-09-19 开源)
- 一句话定位:真机带动作标签数据稀缺(百万级即天花板),互联网无标注视频海量;GO-1 把 VLA 升级为 ViLLA(Vision-Language-Latent-Action)——在感知与执行之间插入**隐式动作(Latent Action)**层,让动作知识可从无标注视频跨本体迁移。
- 核心思想①(三模块):VLM(InternVL-2B)+ MoE 双专家(Latent Planner 隐式规划器 / Action Expert 扩散动作专家),共享 Transformer 主干、独立 FFN 与 Q/K/V/O。
- 核心思想②(LAM 隐式动作模型):编码器 Spatio-temporal Transformer + 时序因果掩码,解码器 Spatial Transformer(初始帧 + 离散 Token → 重建目标帧),Token 经 VQ-VAE 量化。
- 核心思想③(数据基座 AgiBot World):4000㎡、五大域、100+ 场景、超 100 万条轨迹、30Hz、约 1% 故障恢复轨迹。
- 效果:5 类任务平均成功率 46%→78%(+32%);消融加 Latent Planner +12%(66%→78%)。
算子讲解:AdaLN-Zero
- 定位:令
AdaLN(h|c)=γ(c)⊙LayerNorm(h)+β(c),γ/β 由条件向量 c 经 MLP 动态生成、逐通道调制(对比传统 LayerNorm 的 scale/shift 全局学习、与条件无关)。 - Zero 关键:MLP 另输出门控 α,且 γ/β/α 三个线性层零初始化 → α=0 时残差分支输出 0、网络初始为恒等映射,训练初期信号干净、深堆叠不发散。
- 优势:O(N) 元素级 vs Cross-Attn O(N×M),便宜稳定易加深;用于 DiT / SD3-MMDiT / Diffusion Policy / RDT-1B / VLA 动作头。
性能优化:CUDA Graphs(图捕获 · 消除 kernel launch 开销)
- 问题:GPU 每步需 CPU 逐个 launch 成百上千 kernel(单次 ~5–10μs),自回归解码每步仅 1 token → CPU 成瓶颈、GPU 空转(launch gap)、时延与抖动升高。
- 方案:把重复计算序列(整个 forward / 一个 decode step)流式 capture 为 CUDA Graph,replay 一次重放全部 kernel。
- 硬约束:静态 shape / 静态显存地址(batch 与 seq len 固定 → vLLM/SGLang 把 batch 对齐 padding 桶);不支持动态控制流;PagedAttention 动态页表需固定地址变体;常用「抓大放小」(只捕获小 batch)。
- 收益:解码时延降 10–30%、抖动大降;vLLM V1 / SGLang / TensorRT-LLM 默认开启。具身关联:控制回路要求确定性时延,消抖是进实时闭环的关键——这也正是今日 SGLang graph-pool「跨流搁浅致 OOM」要规避的坑。
产业热点(具身智能公司 / 产业链速递 · 置顶)
- 【具身】优必选(09880.HK):9/13 中标乐山商用服务人形项目 约 1.508 亿元;9/12 柳州万台级工业人形超级智慧工厂投产(全球首个适配万台级产能,约每 10 分钟下线 1 台、年规划产能超万台)。上半年营收 12.7 亿(+104.2%)、人形总销量 16123 台(+268.3%)、全尺寸具身收入 5.9 亿(+1445%)。
- 【具身】智元 / 上纬新材(688585·A股):AGILE 2.0 感控一体(灵犀 X2 踩球走/钻火圈/跳长绳,踩球走行业首次双足自主);与长隆共建全球首个大型具身智能主题乐园;与敏实/塞尔维亚合建工厂年产能 5000+ 台。
- 【具身】宇树(688836·A股):9/11 收 477 元、市值约 1929.78 亿,较 8/19 首日高点(约 1100 元)回撤近 55%;2025 年超七成收入来自科研教育、工业仅约 9%。监管收紧拟上市人形门槛。
- 【产业链】小鹏 IRON:9/8 全球首条高阶通用人形自动化产线启用、首台全自动总装下线,核心工序自动化率超 80%。
- 【一级】:超维动力(Kinetix AI)超 5 亿元天使+轮(KAI Hand 37 自由度、指尖力>30N 已全球开售);斜跃智能数亿元天使+轮(家庭场景通用具身基础模型);自变量机器人保密递表港交所(估值超 200 亿)。上半年国内具身融资 约 935 亿元 / 322 笔(同比约 5 倍)。
- 【产业链】:领益智造 × 智元合资「领智创新」首条具身智能产线(数千台整机组装);保隆科技获机器人旋转关节编码器定点(2026-12 量产、±10 arcsec);灵巧手年出货破万只、触觉搭载率 20%→60%。映射:三花智控 002050 / 拓普集团 601689 / 绿的谐波 688017 / 机器人 ETF 562500 / 上纬新材 688585。
- 【通用】:Anthropic 9/12《We Must Pace the Frontier》主张放缓前沿模型 + 员工级第三方嵌入式评估;国常会 9/11 部署算力网(绿电直连 / 源网荷储);谷歌 15 亿美元以上收 AI 编程创企 Mechanize;全球人形上半年出货破 2.2 万台(同比近 +300%)、工信部预计全年整机产量破 10 万台。
⚠️ 产业动态不构成投资建议。
四、一句话结论
vLLM HiSparse 三连(#53781+#56061+#56629)首次把 pinned host 内存变成稀疏 MLA 解码的 GPU 显存延展层,全程 GPU 侧解析、兼容 CUDA Graph replay、跨 TP rank 共享一份 host pool,直抬长上下文并发上限;SGLang graph-pool 四连把 CUDA Graph 显存从「各图独占」做成「可借用池」;两者皆 main 增量、无新 tag,主线是「显存池化/分层」而非发版——推理框架胜负手越来越落在显存边界管理。论文侧 GO-1 用 ViLLA 隐式动作让动作知识跨本体迁移(5 类任务 +32%),AdaLN-Zero 与 CUDA Graphs 补齐「确定性时延执行」链路,而优必选 1.5 亿中标、宇树回撤 55%、具身融资同比 5 倍,正把「看懂 + 管动」的具身主线逐一标价。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。