系列:每日AI热点

每日AI热点 · 2026-09-13:vLLM HiSparse 三连把 host 内存变成 GPU 显存延展层,SGLang graph-pool 把 CUDA Graph 显存做成可借用池

★ 今日最值得关注

vLLM HiSparse 三连(#53781 + #56061 + #56629)把「显存不够」的解法从「省着用」推进到「分层与池化」——稀疏 MLA 解码首次把 pinned host 内存变成 GPU 显存的延展层,全程 GPU 侧解析、兼容 CUDA Graph replay、跨 TP rank 共享一份 host pool,直抬长上下文并发上限;SGLang 用 graph-pool 四连(#39176~#39180)把 CUDA Graph 显存从「各图独占」做成「可借用池」。三方均无新 tag(vLLM v0.29.0 · 09-09 / SGLang v0.5.19 · 09-05 / Step 冻结),增量全部来自 main。

三层事实:

  1. vLLM HiSparse(#53781,09-12 合入,+14373/−1017,124 文件):稀疏 MLA 解码加 host 缓存,尽量留 device,仅在 GPU 容量需回收时才溢出到 pinned host 内存(取代 #46326「always host-resident」),解码显存上限从 GPU 容量松绑到 host RAM。
  2. 跨 rank 共享 + 指标(#56629 + #56061):用 mmap-backed pool 跨本地 TP rank 共享一份 host cache,host cache 占用降到约 1/TP;KV connector stats 暴露缓存指标,可观测。
  3. SGLang graph-pool 四连(09-12~09-13):#39176 复用存活图可执行体、#39177 借用状态收进 runtime + 预切可复用段 + 生命周期检查(降碎片)、#39178 借用容量检查、#39180 借用必须在自己分配流上(跨流会搁浅段致 OOM)——CUDA Graph 显存从「各图独占」变「可借用池」。

可执行结论:三级解析 + LRU 的「按需只拉选中行」与本人 OpenInfer / Qwen3-4B DFlash 推测解码同构——缓存边界的学问可直接借鉴:草稿/验证 KV 也能照此分层。部署侧:长上下文高并发可盯 HiSparse + graph-pool 省出的显存天花板;升级前先在 staging 验 parity(两者皆 main 分支增量,非 tag,稳定性待观察)。

值得单独说:本周主角从「抢发版」(0907/0910/0912 连发)又回到「显存工程」——没有新 tag,但把 KV 与 CUDA Graph 显存都做成了「可分层 / 可借用」的资源池。推理框架的护城河,越来越落在「显存边界管理」上。

二、vLLM & SGLang 社区跟踪

版本状态:vLLM v0.29.0(09-09) 维持最新稳定,近窗无新 tag;SGLang v0.5.19(09-05) 仍为最新稳定,近窗无新 tag;Step 冻结。本期增量全部来自 main 分支,无正式发版。

vLLM(main · 显存分层主线)

新特性 / 架构演进:

破坏性变更:

变更影响
HiSparse 取代 always-host-resident 策略(#53781)稀疏 MLA 解码行为变更,旧配置须重验显存与命中
PCP+DCP 的 MoE all-reduce fast path(#56157)并行路径变更,须重验 GLM-5.3 NVFP4 等模型 parity
DSv4 warmup 系列(#50178/#56323/#53566)冷启动路径变更,须观察首请求时延

SGLang(main · 图显存池化主线)

新特性 / 重大适配:

生产实践:graph-pool 把 CUDA Graph 显存做成可借用池后,多图并发的显存碎片与独占浪费下降,长上下文稳态吞吐更平滑(main 分支增量,尚未进 v0.5.19 tag)。

原理:HiSparse 三级解析(#53781 源码注释)

HiSparse 用一个 fused CUDA resolver 把每个 top-k 选中位置映射到:① 常规 resident GPU page;② 请求自身 GPU hot buffer 中已有的行;③ pinned host pool。顺序有讲究——resident 命中在 hot-cache 查找之前返回(免无谓 host 拉取),hot 命中更新 GPU 侧 LRU,miss 仅 gather 被选中的 host 行替换 LRU 条目。解析/替换/LRU 更新全留在 GPU 侧且兼容 CUDA Graph replay;活跃 indexer cache 仍 device-resident 不参与分层。

启示:稀疏注意力的 top-k 本身就是「工作集描述符」,按需只拉选中行而非整页——这与本人 OpenInfer(Qwen3-4B 推测解码,验证集稀疏、显存敏感)同构:三级解析 + LRU 可直接借鉴到草稿/验证 KV。这跟 V4.1「有界重算换低缓存」同源:都是在 cache 边界上做 Pareto 取舍。

我的判断:本周主线是「显存池化 / 分层」。HiSparse 把 host 变成 GPU 延展层、graph-pool 把 CUDA Graph 显存变成可借用池——推理框架的胜负手,越来越落在「显存边界管理」上,而非单纯算子堆料。

常驻专题

PD 分离:SGLang #36651(Qwen3.8-Next PD state transfer)+ #39190(Kimi-K3 DCP under HiCache L1+L2);vLLM HiSparse 是 PD「D」段的显存延展,与外部 KV 池化(Mooncake)互补而非替代 → D 段正被拆成 device / host 两级。

架构演进:本窗主线 = 显存池化 / 分层(HiSparse 三级 + graph-pool);次为编译预热系统化(vLLM DSv4 warmup)+ Rust 前端 / TreeCore 补齐。

PyTorch vs transformers:本窗无「脱离 transformers」新 PR;仍分层——模型定义靠 transformers,数据面与运行时靠自研。

Step 适配:近窗无新增;唯一新信号 = Steptron 训练框架开源(SteptronOss,09-04,587★)。推理侧仍建议 vLLM stepfun37 + MTP 优先;依赖 MTP 须先验 --speculative-config '{"method":"mtp"}' 能否起服。

三、AI 论文与产业热点

今日重点(1 句)

智元 GO-1 用 ViLLA 隐式动作把动作知识从「真机稀缺标注」解放到「海量无标注视频」,让 VLA 第一次具备跨本体迁移能力;而 AdaLN-Zero 与 CUDA Graphs 补齐「确定性时延执行」链路,正好对应今日具身产业的「管动」主线。

论文核心(GO-1 / ViLLA · 智元 × 上海AI Lab,2025-03-10 发布,2025-09-19 开源)

算子讲解:AdaLN-Zero

性能优化:CUDA Graphs(图捕获 · 消除 kernel launch 开销)

产业热点(具身智能公司 / 产业链速递 · 置顶)

⚠️ 产业动态不构成投资建议。

四、一句话结论

vLLM HiSparse 三连(#53781+#56061+#56629)首次把 pinned host 内存变成稀疏 MLA 解码的 GPU 显存延展层,全程 GPU 侧解析、兼容 CUDA Graph replay、跨 TP rank 共享一份 host pool,直抬长上下文并发上限;SGLang graph-pool 四连把 CUDA Graph 显存从「各图独占」做成「可借用池」;两者皆 main 增量、无新 tag,主线是「显存池化/分层」而非发版——推理框架胜负手越来越落在显存边界管理。论文侧 GO-1 用 ViLLA 隐式动作让动作知识跨本体迁移(5 类任务 +32%),AdaLN-Zero 与 CUDA Graphs 补齐「确定性时延执行」链路,而优必选 1.5 亿中标、宇树回撤 55%、具身融资同比 5 倍,正把「看懂 + 管动」的具身主线逐一标价。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。