系列:多模态解码手记

多模态解码手记(五):高效系统与前沿推理——注意力 / 推理优化 / 端侧 / RL

0. 为什么需要这一章

(一)~(四)讲的是多模态”能做什么”;(五)讲的是”怎么让它跑得起、跑得快、跑在端侧”。推理成本每降一档,VLA + 世界模型(四章)就多一分端侧实时可行。这一章把它拆成四层。

1. 注意力五件套:主流 Decoder LLM 的标配

长上下文 / 低成本推理的胜负手在 KV Cache:GQA/MLA”省显存”、FlashAttention”省 IO”、RMSNorm”省计算”——三者叠加构成今天的效率基线。

2. DeepSeek-V4 架构深读:压缩 KV Cache 的四级演进(MLA → NSA → DSA → CSA+HCA)

把(一)的”注意力五件套”落到一个旗舰模型上:DeepSeek 用三代(V2→V3→V4)把”KV Cache 压缩”做成了工程主线。理解这条线,就理解了长上下文推理为何能降本一个数量级——这也是评估任何长上下文/低成本推理标的的技术锚点。

2.1 一条主线:把 KV Cache 压到极限

KV Cache 是长上下文推理的成本锚点:每多一个 token,就要多存一份 K/V。DeepSeek 的压缩有两个正交方向:

图1 给出两个方向的对照。

压宽度 · MLA 每个 token 全量 K/V c 低维潜向量

压长度 · NSA→CSA+HCA 全部 token 细粒度 K/V 少量记忆块

图1 KV Cache 的两个压缩方向:压宽度(MLA,把每列的 K/V 压成细 latent c)与压长度(NSA→CSA+HCA,把多列合并成少数记忆块)。两者正交、可叠加。

2.2 四级演进

阶段代号做法省了什么备注
①MLAK/V→低维潜向量 c压宽度V2/V3/V4 基线
②NSA(2025.02)三分支 cmp/slc/win,原生可训练压长度硬件对齐(GQA 式分组,算术强度均衡)
③DSA(V3.2 过渡)Lightning Indexer省算力省算不省存,承上启下
④CSA+HCA(V4)三级记忆压长度到极致1M 上下文仅 ~7800 记忆

2.3 V4 三级记忆:SWA + CSA + HCA

V4 三级记忆(越久越粗,越近越细)

SWA 短期 滑动窗口 n_win = 128(细粒度局部 KV)

CSA 中期 4→1 压缩 + Lightning Indexer 取 top-k = 1024

HCA 长期 128 个 chunk 128→1 稠密(1M→~7800)

三级叠加:1M token 最终仅约 7800 个记忆单元(≈ 原 KV 的 0.8%)

图2 V4 三级记忆:短期 SWA(窗口 n_win=128)→ 中期 CSA(4 个 chunk 压成 1 个 + Lightning Indexer 取 top-k=1024)→ 长期 HCA(128→1 稠密,1M 上下文压到约 7800 个记忆)。

三级记忆的妙处:越久越远的信息越”粗”,越近越”细”。近处要精确、远处只要语义——这正是对人记忆的建模,也让 1M 上下文的推理成本可控。

2.4 两条产品线:V4-Pro 与 V4-Flash

指标(相对稠密基线)V4-ProV4-Flash
计算量 FLOPs≈ 27%≈ 10%
KV 显存≈ 10%≈ 7%

V4-Flash 把计算量压到约 1/10、KV 压到约 1/14,是面向”极致吞吐 / 边缘部署”的版本;V4-Pro 在效果与成本间取更平衡的点。

2.5 推理侧:Mooncake 与 DistServe

压缩把”单卡能装下”解决了,但高并发长上下文还要靠 PD 分离。

Prefill 实例 ×N Prefill 实例

KVCache 池 KV 只算一次 跨实例复用

Decode 实例 ×M Decode 实例

以 KVCache 为中心的 P/D 分离:显存跨实例共享,不被重复计算

图3 Mooncake:以 KVCache 池为中心的 Prefill/Decode 分离,KV 只算一次、多处复用。
Prefill 池 优化 TTFT

Decode 池 优化 TPOT

KV 传递

目标:Goodput = 满足 SLO 的有效 token 数

图4 DistServe:Prefill 池与 Decode 池分离,分别优化 TTFT 与 TPOT,用 Goodput(满足 SLO 的有用 token)做目标。

端到端成本 = 压缩(MLA/NSA/CSA+HCA 降显存+降 FLOPs)× 调度(Mooncake/DistServe 提并发)。DeepSeek V3 全量分离栈约 545 output tok/s/GPU,正是这俩乘出来的结果——这也是”推理降本→云推理厂商/轻量 VLA 部署门槛下降”投资逻辑的技术底座。

3. 高效训练与推理系统

推理成本 = 显存(GQA/MLA + 量化 KV)+ IO(FlashAttention)+ 调度(PagedAttention + PD 分离)+ 解码效率(投机解码)四层叠加。评估推理栈时看是否”四层全开”。

4. 端侧智能:小资源也能用大模型

5. 前沿推理与强化学习(2026 夏)

这组工作共同指向:推理能力正从”堆参数”转向”更好的训练信号 + 更好的长上下文 / 潜空间表征”。

6. 全系列收束

(一)基础与对齐范式  → 多模态=把生成空间从文本外推到图像/动作
(二)VLM 演进        → ViT/CLIP/LLaVA:看+说的标准范式
(三)生成模型        → 扩散/GAN:画出来的那一支
(四)VLA+世界模型    → RT-2→π0.7→HiF-VLA:动手+先想再动
(五)高效+前沿       → 注意力/推理优化/端侧/前沿RL:跑得起跑得快的底座

投资视角闭环:大模型降本(本篇)↔ 具身实时可行(四篇)↔ 端侧芯片 / 边缘算力(本篇端侧)是同一逻辑链上的三个支点。评估任何一家多模态 / 具身公司,都可以沿这条”基础范式 → 模型 → 生成 → 行动 → 效率”的轴线逐项打分。

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。