系列:每日AI热点

每日AI热点 · 2026-09-03:Agentic 负载成主战场,胜负手从「8k 吞吐」变成「多轮会话还能不能命中历史 KV」

关于本期来源:今天只有 vLLM / SGLang 社区跟踪摘要,没有对应的 AI 论文与产业热点日报。因此本期只有推理基础设施部分,产业与论文一节从缺。

★ 今日最值得关注

Agentic 负载正式成为 vLLM / SGLang 优化的主战场,胜负手从「固定 8k 提示词吞吐」变成了「多轮 Agent 会话下一轮还能不能命中历史 KV」。

这是今天最该进你架构评审的一条——因为它改变了你做容量规划和选型时的判断标准。

三层事实:

  1. 标准迁移:SemiAnalysis 的深度对照指出,两家都已围绕**混合注意力(Full + Sliding-Window + 线性/循环状态)**重写 KV 缓存的存、取、淘汰与跨节点迁移。判断指标从「固定 8k 提示词吞吐」变成「多轮会话下一轮还能否命中历史」。
  2. 状态分三类,成本结构完全不同:Full KV 贵且可复用、SWA 尾便宜且可重建、循环状态便宜但不可重建——「卸载多少 / 淘汰谁」从统一策略退化为三套分层策略。
  3. 最该警惕的坑(来自本期正确性修复):ROCm ring-cache 复用仍被引用的 slot 时,得到的是错误输出,不是慢输出——静默错误比慢更危险,因为它不会报警。

可执行结论:如果你在为 Agent / 多轮对话做推理底座,把评估指标从「首包吞吐」改成「跨轮次 KV 命中率 + 状态迁移成本」,并按 Full / SWA / 循环三类状态分别定策略;ROCm 部署务必确认 ring-cache 修复已合入。

值得强调:这不是算力不够,而是「谁该留在 HBM」这个问题变难了。Agentic 负载的变长 + 分叉特性,让「按长度特化」「按 LRU 淘汰」这些静态假设全部失效。推理引擎正在从「管理显存的运行时」变成「跨 GPU/主存/磁盘调度三类状态的运行时」——和 9/1 那期 KV 下沉磁盘是同一个方向的延伸。

二、vLLM & SGLang 社区跟踪

本期无 AI 论文与产业热点来源(见开头说明),以下为推理基础设施部分。

版本状态:近 72h 无新版本。vLLM v0.28.0(8/26);SGLang v0.5.18(710 PRs / 212 贡献者)。

vLLM v0.28.0

最实用的三处 KV Offload 改动(store 路径):

load 路径:调度 lookup 改异步(connector 脱离 step 关键路径)+ 紧凑零拷贝 lookup key + 接收端并行加载 + 预构建 Mooncake key 串。

正确性账(混合状态):按 hybrid cache group 发 cache event;EAGLE 投机状态跨 Mooncake 合并组 / SimpleCPU coordinator 传播。

ROCm 三改:Kimi-K3 KDA 直写 layer output buffer(每层每 token 省一次 device copy);AITER sparse-MLA decode kernel → AgentX 输出吞吐 +5.22%、ITL 显著下降;待合并亮点 DeepSeek V4 C4A selector 改 gfx950 hybrid AITER/native → 端到端 1.21×–1.76×。

PD 分离:Kimi-K3 conv+ssm 循环状态随 attention KV 经 MoRI-IO 传输(1P1D);MI355X TP8 跨节点 RDMA,双腿均开 DSpark 投机。

SGLang v0.5.18

滑动窗口分配器:window / prefix pages 同池、窗口更贪婪 → 页面离窗即释放、compute lock 上限设为单窗、清除 stale full-KV。遗留盲点:分叉请求仍持可复用 full-KV 但分叉点 window state 已释放 → 整前缀重算(正在做「分叉点保留 SWA 状态」)。

HiCache 非对称卸载:只卸载 full-attention cache,回程重建短的 SWA 尾(贵的搬、便宜的重建更快);AMD 上 staged write-back 不阻塞引擎。

循环状态缺口补上:FlashInfer GDN 检查点让 recurrent state 首次参与前缀复用,92.4% 命中率下 47,771 → 53,004 tok/s/GPU。

变长上下文:context length 改 runtime scalar(避免每请求编译新 kernel)→ AgentX 并发 384 输出吞吐 +26.75%、平均 TTFT −36.25%(不是算得更快,是不编译了)。

正确性修复:ROCm ring-cache 复用仍被引用的 slot → 错误输出(非慢输出);另 DP attention 被 chunked-prefill 喂饱的 rank 总赢 prefill-first → 可配 decode interval 强制插入 decode 轮次。

原理:今日串联主线 —— 模型从 Full Attention 变成「混合体」

把本期所有改动串起来,是同一件事:

  1. 模型从纯 Full Attention 变成 Full + SWA + 线性/循环状态混合体;
  2. 三类状态成本结构完全不同:Full KV 贵且可复用、SWA 尾便宜且可重建、循环状态便宜但不可重建;
  3. 「要不要卸载 / 卸载多少 / 淘汰谁」从统一策略退化为分层的三套策略;
  4. Agentic 负载的变长 + 分叉特性,让「按长度特化」「按 LRU 淘汰」等静态假设全部失效。

对推测解码的启示(和你的工作直接相关):投机状态(EAGLE / MTP / DSpark)现在也成了「必须跟着 KV 一起迁移和复用的状态」。投机解码收益不再只是「每步多接受几个 token」,而与缓存命中率、状态迁移成本强耦合——profiling 只看接受率会漏掉一整块收益/损失来源。这条把 9/2 的「自适应预算零成本」又往前推了一步:预算省的是冗余,但前提是状态迁移的账要算对。

国内两条硬新闻

常驻专题

专题今日状态
PD 分离vLLM:Kimi-K3 循环状态经 MoRI-IO 随 KV 迁移(MI355X TP8 RDMA + 双腿 DSpark);SGLang:HiCache 非对称卸载 + AMD staged write-back
架构演进混合注意力成默认假设;GLM-5.3-Flash 用插件层承接多芯片差异;FlagOS 同一套算子延续到 Qwen4 模型族
KV 缓存层级化HBM → CPU DRAM(pinned + 异步 DMA)→ 本地 NVMe → 远程(Redis / Mooncake / InfiniStore);LMCache CacheBlend 解 RAG chunk 乱序复用,TTFT 约 2–3× 改善
缓存亲和路由新条目:Meta CacheRoute —— 高频请求回到已有缓存节点,在缓存局部性与负载均衡间取平衡;规模化后最易被忽略的命中率杀手
Step 适配本周无新增;维持 Step-3.7-Flash NVFP4 四卡本地部署 + MTP/EAGLE 投机口径

运维与安全

三、一句话结论

没有新版本的日子里,本期最高价值来自 SemiAnalysis 把两大引擎的优化主战场指到 Agentic 负载——胜负手从「固定 8k 吞吐」变成「多轮会话还能不能命中历史 KV」,而支撑它的工程是「Full / SWA / 循环三类状态分别定策略」;最该警惕的是 ROCm ring-cache 复用仍被引用的 slot 会给出错误输出而非慢输出,以及 FlagOS 提醒的「算子提速 ≠ 端到端提速」(metadata 不入 CUDA Graph 只拿 +0.93%,完整入图才 +7.46%)——推理引擎正在像操作系统一样分层调度状态,你的评估指标和运维账本都得跟着升级。


📬 想持续收到这类每日追踪?留邮箱 / 加我列表就好 👉 1023628035@qq.com

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。