0. 一句话主线
Agent 不是”更会聊天的模型”,而是把 LLM 嵌进一个「感知—规划—行动—反馈」的闭环。而这件事在工程上最深刻的后果并不在模型侧,而在推理基础设施侧:Agentic 负载的变长、分叉、多轮特性,把 KV Cache 从”显存够不够”的问题,升级成了”状态在 GPU / 主存 / 磁盘之间怎么调度”的问题。本篇把散落在每日追踪里的 Agent 知识串成体系,并把它和本博客的 HiCache(sys1)/ HiSparse(sys6)/ DCP(sys7)/ KV 量化(op2)串成一条主线。
1. 能力栈:Agent = 模型 + 规划 + 工具 + 记忆
| 层 | 作用 | 关键问题 |
|---|---|---|
| 模型(大脑) | 推理、决策、生成 | 指令跟随、长上下文、输出稳定性 |
| 规划 | 把目标拆成可执行的步骤 | 步数控制、失败回退 |
| 工具 | 触达外部世界 | 调用协议、权限、沙箱 |
| 记忆 | 跨轮次 / 跨会话留存 | 什么该留、留多久、放在哪一层 |
这四层缺一层,就不叫 Agent,只是”带提示词的聊天机器人”。
2. 工具调用:从 Function Calling 到 MCP
- Function Calling:模型输出结构化调用意图(函数名 + 参数),宿主执行后把结果回灌上下文。这是 Agent 能”动手”的最小机制。
- MCP(Model Context Protocol):把”每个 Agent 各自适配每个工具”的 M×N 适配问题,收敛成”工具一次接入、处处可用”的 M+N 问题。本质是 Agent 时代的”USB-C”。
- 工程坑:工具描述本身占上下文;参数幻觉;超时/重试策略;以及最要命的——副作用不可逆(写操作必须留人工确认闸门)。
3. 上下文工程:Agent 真正的护城河
Agent 的失败,很少是”模型不够聪明”,而是上下文没管好。
- 上下文是有成本的资源:每一轮都要重放前缀,token 成本随轮次线性增长。
- 常规手段:摘要压缩、检索注入、上下文卸载到外部存储、KV 复用(prefix caching)。
- 1M-token Agent 的目录注意力(DeepSeek V4 路线):把 128 个 token 融合成 1 个”目录条目”,对约 8K 个目录做稠密注意力。关键点在于必须 Dense 不能 Sparse——8K 条 KV 跑 Dense kernel 比 Sparse 更规则、更快。这是”远处历史需要全局轮廓”这一需求的典型结构创新。
4. 执行范式与编排:简单方案赢了
- ReAct:思考—行动—观察循环;Plan-and-Execute:先规划后执行;反思/自校正:失败后重新规划。
- 编排范式:Orchestrator(思考 / 规划 / 成功检测)+ 执行者。DeepMind 的 Gemini Robotics 1.5 把它落到了具身场景:GR-ER 1.5(会思考的 VLM)当 Orchestrator,GR 1.5(通用 VLA)当执行者,“先思考后动作”。结果是长时程任务进度分约 80%,而单独用 Thinking VLA 只有 44%——编排本身就是性能。
- 现实约束(高盛):AI 已进入”执行时代”,竞争焦点从模型转向工作流;68% 的生产级 Agent 采用简单可控方案——人工介入前最多 10 步。别高估当下的自治程度。
5. Agentic 负载:为什么它重塑了推理系统(本篇核心)
这是把 Agent 知识和本博客其余文章串起来的地方。
5.1 三个特性击穿静态假设
Agent 负载和传统”单轮问答”最大的区别:
- 变长:每轮上下文长度都在变,且跨度极大。
- 分叉:一次任务会派生多条尝试路径(采样、重试、分支)。
- 多轮 + 冷会话:一个会话可能挂半小时没动静,然后突然继续。
后果:推理引擎里”按长度特化 kernel""按 LRU 淘汰 KV”这些静态假设全部失效。
5.2 评估指标必须换
- 旧指标:固定 8K 提示词吞吐 / 首包 TTFT。
- 新指标:跨轮次 KV 命中率 + 状态迁移成本。
如果你在为 Agent / 多轮对话做推理底座,把评估指标从”首包吞吐”改成”下一轮还能不能命中历史 KV”——这才是 Agent 场景的真实瓶颈。
5.3 引擎侧的四条应对主线
- 分层卸载:冷会话的 KV 不该永久占最贵的 HBM。HiCache(sys1)给出 GPU / 主存 / 磁盘的放置与数据通路;HiSparse(sys6)把 HBM 当缓存、主机 DRAM 存权威全量 KV;最新进展是新增磁盘 tier——一个挂半小时没动静的 Agent 会话,它的 KV 可以安静躺在磁盘上,把 HBM 让给真正在跑的请求。
- 跨实例共享与续接:TensorCast(北大 × 阶跃,arXiv:2608.06007)把 KV 迁移 / 权重物化解耦为共享 TaaS 层,高并发多轮 Agent 的 median TTFT 最多 −93.2%(注意收益集中在”高并发 + 多轮”这个组合,单轮 / 短上下文 / 低并发吃不到);Mooncake Store 新增
save_decode_cache,让 decode 期的 KV 也进共享 Store,多轮 / Agent 负载跨实例续接不必重算。 - 并行与容量:DCP(sys7)沿序列维分片 KV 消除 TP 冗余复制;KV Cache 量化(op2)用 FP16→FP8 / INT4 直接砍容量。Prefill 主导型负载(如 Coding Agent:上下文长、prefix 命中率高)还要靠 LayerSplit 这类让每张 GPU 只持部分层 KV 的方案,额外通信仅 Indexer Cache 广播 ≈ KV 的 1/8。
- 正确性优先于速度:ROCm ring-cache 曾出现”复用仍被引用的 slot”,给的不是慢输出而是错误输出。Agent 场景里,这类静默错误比延迟致命得多。
5.4 一句话总结这个转变
推理引擎正在从「管理显存的运行时」,变成「跨 GPU / 主存 / 磁盘调度三类状态的运行时」。
6. 落地与产业观察
- 基础设施在成型:阿里云发布 KV Cache Store + Agentic FS,日均 Token 调用突破 140 万亿次——Agent 已经不是 demo,而是真实的基础设施负载。
- 形态在扩散:腾讯 TairosAgent 具身智能体框架、QClaw / WorkBuddy 多模态 Agent 三端 App、阿里办公 Agent、商汤 Seko 创编一体视频智能体、阶跃 / 努比亚智能体手机——Agent 正从”对话框”长进操作系统、办公套件和机器人。
- 具身侧:NitroGen 把 GR00T 架构迁移到虚拟世界(1000+ 游戏、4 万小时交互)训练通用具身 Agent,用生成环境缓解具身智能的数据饥渴。
- 理性预期:68% 的生产级 Agent 是 ≤10 步的简单可控方案;真正的长时程自治(如 80% 进度分的具身 agentic 系统)仍集中在特定垂直场景。
7. 实践清单
- 先问负载形态:单轮问答走传统优化;多轮 Agent 优先看 KV 命中率与状态迁移成本。
- 评估指标换血:跨轮次 KV 命中率 + 状态迁移成本,取代固定 8K 吞吐。
- 分层卸载要配磁盘 tier,冷会话不占 HBM。
- 上下文工程优先于换模型:摘要、检索、卸载、KV 复用。
- 工具层用 MCP 收敛适配成本;写操作必须留人工确认。
- 别迷信自治:默认按 ≤10 步设计,失败可回退、可人工接管。
- 警惕静默错误:状态复用 / 缓存复用必须有 occupancy 校验。
串起来看:Agent 定义了负载形态(变长、分叉、多轮)→ 负载形态击穿了静态调度假设 → 引擎被迫演化为跨层状态调度器(HiCache / HiSparse / DCP / KV 量化)→ 而”远处历史要全局轮廓”又催生了目录注意力这类新结构。这就是今天 Agent 与推理系统互相塑造的完整闭环。
注:本文整合自 2026-08-13 至 2026-09-08 的每日 AI 热点追踪与 AI 知识库条目,重写为系统化版本。
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。