关于本期来源:今天只有 vLLM / SGLang 社区跟踪摘要,没有对应的 AI 论文与产业热点日报。因此本期只有推理基础设施部分,产业与论文一节从缺。
★ 今日最值得关注
Agentic 负载正式成为 vLLM / SGLang 优化的主战场,胜负手从「固定 8k 提示词吞吐」变成了「多轮 Agent 会话下一轮还能不能命中历史 KV」。
这是今天最该进你架构评审的一条——因为它改变了你做容量规划和选型时的判断标准。
三层事实:
- 标准迁移:SemiAnalysis 的深度对照指出,两家都已围绕**混合注意力(Full + Sliding-Window + 线性/循环状态)**重写 KV 缓存的存、取、淘汰与跨节点迁移。判断指标从「固定 8k 提示词吞吐」变成「多轮会话下一轮还能否命中历史」。
- 状态分三类,成本结构完全不同:Full KV 贵且可复用、SWA 尾便宜且可重建、循环状态便宜但不可重建——「卸载多少 / 淘汰谁」从统一策略退化为三套分层策略。
- 最该警惕的坑(来自本期正确性修复):ROCm ring-cache 复用仍被引用的 slot 时,得到的是错误输出,不是慢输出——静默错误比慢更危险,因为它不会报警。
可执行结论:如果你在为 Agent / 多轮对话做推理底座,把评估指标从「首包吞吐」改成「跨轮次 KV 命中率 + 状态迁移成本」,并按 Full / SWA / 循环三类状态分别定策略;ROCm 部署务必确认 ring-cache 修复已合入。
值得强调:这不是算力不够,而是「谁该留在 HBM」这个问题变难了。Agentic 负载的变长 + 分叉特性,让「按长度特化」「按 LRU 淘汰」这些静态假设全部失效。推理引擎正在从「管理显存的运行时」变成「跨 GPU/主存/磁盘调度三类状态的运行时」——和 9/1 那期 KV 下沉磁盘是同一个方向的延伸。
二、vLLM & SGLang 社区跟踪
本期无 AI 论文与产业热点来源(见开头说明),以下为推理基础设施部分。
版本状态:近 72h 无新版本。vLLM v0.28.0(8/26);SGLang v0.5.18(710 PRs / 212 贡献者)。
vLLM v0.28.0
最实用的三处 KV Offload 改动(store 路径):
- 相同 transfer 在途则跳过 store(并发共享前缀只付一次)。
- 只写增量 KV 区间(不每轮重写整个前缀)。
- store 不再依赖 block 是否仍在 HBM(驱逐时不丢已排期工作)。
load 路径:调度 lookup 改异步(connector 脱离 step 关键路径)+ 紧凑零拷贝 lookup key + 接收端并行加载 + 预构建 Mooncake key 串。
正确性账(混合状态):按 hybrid cache group 发 cache event;EAGLE 投机状态跨 Mooncake 合并组 / SimpleCPU coordinator 传播。
ROCm 三改:Kimi-K3 KDA 直写 layer output buffer(每层每 token 省一次 device copy);AITER sparse-MLA decode kernel → AgentX 输出吞吐 +5.22%、ITL 显著下降;待合并亮点 DeepSeek V4 C4A selector 改 gfx950 hybrid AITER/native → 端到端 1.21×–1.76×。
PD 分离:Kimi-K3 conv+ssm 循环状态随 attention KV 经 MoRI-IO 传输(1P1D);MI355X TP8 跨节点 RDMA,双腿均开 DSpark 投机。
SGLang v0.5.18
滑动窗口分配器:window / prefix pages 同池、窗口更贪婪 → 页面离窗即释放、compute lock 上限设为单窗、清除 stale full-KV。遗留盲点:分叉请求仍持可复用 full-KV 但分叉点 window state 已释放 → 整前缀重算(正在做「分叉点保留 SWA 状态」)。
HiCache 非对称卸载:只卸载 full-attention cache,回程重建短的 SWA 尾(贵的搬、便宜的重建更快);AMD 上 staged write-back 不阻塞引擎。
循环状态缺口补上:FlashInfer GDN 检查点让 recurrent state 首次参与前缀复用,92.4% 命中率下 47,771 → 53,004 tok/s/GPU。
变长上下文:context length 改 runtime scalar(避免每请求编译新 kernel)→ AgentX 并发 384 输出吞吐 +26.75%、平均 TTFT −36.25%(不是算得更快,是不编译了)。
正确性修复:ROCm ring-cache 复用仍被引用的 slot → 错误输出(非慢输出);另 DP attention 被 chunked-prefill 喂饱的 rank 总赢 prefill-first → 可配 decode interval 强制插入 decode 轮次。
原理:今日串联主线 —— 模型从 Full Attention 变成「混合体」
把本期所有改动串起来,是同一件事:
- 模型从纯 Full Attention 变成 Full + SWA + 线性/循环状态混合体;
- 三类状态成本结构完全不同:Full KV 贵且可复用、SWA 尾便宜且可重建、循环状态便宜但不可重建;
- 「要不要卸载 / 卸载多少 / 淘汰谁」从统一策略退化为分层的三套策略;
- Agentic 负载的变长 + 分叉特性,让「按长度特化」「按 LRU 淘汰」等静态假设全部失效。
对推测解码的启示(和你的工作直接相关):投机状态(EAGLE / MTP / DSpark)现在也成了「必须跟着 KV 一起迁移和复用的状态」。投机解码收益不再只是「每步多接受几个 token」,而与缓存命中率、状态迁移成本强耦合——profiling 只看接受率会漏掉一整块收益/损失来源。这条把 9/2 的「自适应预算零成本」又往前推了一步:预算省的是冗余,但前提是状态迁移的账要算对。
国内两条硬新闻
- 智谱 GLM-5 / LayerSplit:Coding Agent 负载「上下文长、prefix 命中率高」→ Prefill 主导。先用超时 Abort 压 TTFT、HiCache 缓解 Prefill 侧 KV 容量;LayerSplit 让 CP 下每张 GPU 只持部分层 KV,Attention 前由持有 rank 广播该层 Cache 并与 indexer 计算重叠,额外通信仅 Indexer Cache 广播 ≈ KV 的 1/8(已提 SGLang PR #22811)。
- FlagOS 四天三次 Day0(千问/GLM/混元):MoE 融合专家(净 ~0.6ms)+ dense/projection 复用原生 fast path(~0.5ms),每步累计省约 8.66ms;但算子提速 ≠ 端到端提速——必须把 metadata 构造纳入 CUDA Graph(新增/改写 3 个 metadata kernel),对比:原生仅 +0.93%,FlagOS 完整入图 +7.46%。另挖出上游精度缺陷(GDN Packed Decode 的 beta FP32 被不必要舍入回 BF16 → 长序列循环状态误差累积,PR #53877)。
常驻专题
| 专题 | 今日状态 |
|---|---|
| PD 分离 | vLLM:Kimi-K3 循环状态经 MoRI-IO 随 KV 迁移(MI355X TP8 RDMA + 双腿 DSpark);SGLang:HiCache 非对称卸载 + AMD staged write-back |
| 架构演进 | 混合注意力成默认假设;GLM-5.3-Flash 用插件层承接多芯片差异;FlagOS 同一套算子延续到 Qwen4 模型族 |
| KV 缓存层级化 | HBM → CPU DRAM(pinned + 异步 DMA)→ 本地 NVMe → 远程(Redis / Mooncake / InfiniStore);LMCache CacheBlend 解 RAG chunk 乱序复用,TTFT 约 2–3× 改善 |
| 缓存亲和路由 | 新条目:Meta CacheRoute —— 高频请求回到已有缓存节点,在缓存局部性与负载均衡间取平衡;规模化后最易被忽略的命中率杀手 |
| Step 适配 | 本周无新增;维持 Step-3.7-Flash NVFP4 四卡本地部署 + MTP/EAGLE 投机口径 |
运维与安全
- 版本底线:CVE-2026-54234(DoS,0.24.0 修)、CVE-2026-73559(completion fan-out DoS,0.26.0 修)→ 生产建议 ≥0.26.0,尽量 0.28.0。
- KV 卸载 CLI:
--kv-offloading-size(GiB,TP>1 为各 rank 之和)+--kv-offloading-backend native|lmcache,仅设了 size 才激活。 - ReplaySSM:
--use-replayssm缓存近期 SSM 输入、跳过每步全状态 store、flush 回写检查点;需 mamba 后端,仅标准解码(不走投机)。 - 权重卸载:OffloadConfig 三选
uva(零拷贝)/prefetch(分组异步预取)/auto。
三、一句话结论
没有新版本的日子里,本期最高价值来自 SemiAnalysis 把两大引擎的优化主战场指到 Agentic 负载——胜负手从「固定 8k 吞吐」变成「多轮会话还能不能命中历史 KV」,而支撑它的工程是「Full / SWA / 循环三类状态分别定策略」;最该警惕的是 ROCm ring-cache 复用仍被引用的 slot 会给出错误输出而非慢输出,以及 FlagOS 提醒的「算子提速 ≠ 端到端提速」(metadata 不入 CUDA Graph 只拿 +0.93%,完整入图才 +7.46%)——推理引擎正在像操作系统一样分层调度状态,你的评估指标和运维账本都得跟着升级。
📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。