系列:智能体手记

智能体手记(一):Agent 知识体系——能力栈、上下文工程与 Agentic 负载下的推理重构

0. 一句话主线

Agent 不是”更会聊天的模型”,而是把 LLM 嵌进一个「感知—规划—行动—反馈」的闭环。而这件事在工程上最深刻的后果并不在模型侧,而在推理基础设施侧:Agentic 负载的变长、分叉、多轮特性,把 KV Cache 从”显存够不够”的问题,升级成了”状态在 GPU / 主存 / 磁盘之间怎么调度”的问题。本篇把散落在每日追踪里的 Agent 知识串成体系,并把它和本博客的 HiCache(sys1)/ HiSparse(sys6)/ DCP(sys7)/ KV 量化(op2)串成一条主线。

1. 能力栈:Agent = 模型 + 规划 + 工具 + 记忆

层作用关键问题
模型(大脑)推理、决策、生成指令跟随、长上下文、输出稳定性
规划把目标拆成可执行的步骤步数控制、失败回退
工具触达外部世界调用协议、权限、沙箱
记忆跨轮次 / 跨会话留存什么该留、留多久、放在哪一层

这四层缺一层,就不叫 Agent,只是”带提示词的聊天机器人”。

2. 工具调用:从 Function Calling 到 MCP

3. 上下文工程:Agent 真正的护城河

Agent 的失败,很少是”模型不够聪明”,而是上下文没管好。

4. 执行范式与编排:简单方案赢了

5. Agentic 负载:为什么它重塑了推理系统(本篇核心)

这是把 Agent 知识和本博客其余文章串起来的地方。

5.1 三个特性击穿静态假设

Agent 负载和传统”单轮问答”最大的区别:

后果:推理引擎里”按长度特化 kernel""按 LRU 淘汰 KV”这些静态假设全部失效。

5.2 评估指标必须换

如果你在为 Agent / 多轮对话做推理底座,把评估指标从”首包吞吐”改成”下一轮还能不能命中历史 KV”——这才是 Agent 场景的真实瓶颈。

5.3 引擎侧的四条应对主线

  1. 分层卸载:冷会话的 KV 不该永久占最贵的 HBM。HiCache(sys1)给出 GPU / 主存 / 磁盘的放置与数据通路;HiSparse(sys6)把 HBM 当缓存、主机 DRAM 存权威全量 KV;最新进展是新增磁盘 tier——一个挂半小时没动静的 Agent 会话,它的 KV 可以安静躺在磁盘上,把 HBM 让给真正在跑的请求。
  2. 跨实例共享与续接:TensorCast(北大 × 阶跃,arXiv:2608.06007)把 KV 迁移 / 权重物化解耦为共享 TaaS 层,高并发多轮 Agent 的 median TTFT 最多 −93.2%(注意收益集中在”高并发 + 多轮”这个组合,单轮 / 短上下文 / 低并发吃不到);Mooncake Store 新增 save_decode_cache,让 decode 期的 KV 也进共享 Store,多轮 / Agent 负载跨实例续接不必重算。
  3. 并行与容量:DCP(sys7)沿序列维分片 KV 消除 TP 冗余复制;KV Cache 量化(op2)用 FP16→FP8 / INT4 直接砍容量。Prefill 主导型负载(如 Coding Agent:上下文长、prefix 命中率高)还要靠 LayerSplit 这类让每张 GPU 只持部分层 KV 的方案,额外通信仅 Indexer Cache 广播 ≈ KV 的 1/8。
  4. 正确性优先于速度:ROCm ring-cache 曾出现”复用仍被引用的 slot”,给的不是慢输出而是错误输出。Agent 场景里,这类静默错误比延迟致命得多。

5.4 一句话总结这个转变

推理引擎正在从「管理显存的运行时」,变成「跨 GPU / 主存 / 磁盘调度三类状态的运行时」。

6. 落地与产业观察

7. 实践清单

  1. 先问负载形态:单轮问答走传统优化;多轮 Agent 优先看 KV 命中率与状态迁移成本。
  2. 评估指标换血:跨轮次 KV 命中率 + 状态迁移成本,取代固定 8K 吞吐。
  3. 分层卸载要配磁盘 tier,冷会话不占 HBM。
  4. 上下文工程优先于换模型:摘要、检索、卸载、KV 复用。
  5. 工具层用 MCP 收敛适配成本;写操作必须留人工确认。
  6. 别迷信自治:默认按 ≤10 步设计,失败可回退、可人工接管。
  7. 警惕静默错误:状态复用 / 缓存复用必须有 occupancy 校验。

串起来看:Agent 定义了负载形态(变长、分叉、多轮)→ 负载形态击穿了静态调度假设 → 引擎被迫演化为跨层状态调度器(HiCache / HiSparse / DCP / KV 量化)→ 而”远处历史要全局轮廓”又催生了目录注意力这类新结构。这就是今天 Agent 与推理系统互相塑造的完整闭环。

注:本文整合自 2026-08-13 至 2026-09-08 的每日 AI 热点追踪与 AI 知识库条目,重写为系统化版本。

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。