系列:前沿架构解码手记

前沿架构解码手记(四):DeepSeek V4——极致压缩与高效训练

0. 压轴:最激进的”压缩”路线

前面两家:Kimi K3 改注意力内部(差分),MiniMax M3 改注意力范围(稀疏)。DeepSeek V4 更进一步——直接压缩 KV Cache 本身,并把训练也重做了一遍。这是路线图里改造最重的一站。

1. 注意力:CSA + HCA 混合

三者混合,形成”近处精确、远处压缩”的分层结构。

Query 位置 → 历史 KV 的分层处理 最近 128 token CSA(4-token 块 + top-k) HCA(重度压缩 128×) 最远端历史 混合效果(官方口径,相对 V3.2 @ 1M): 每 token 算力 ≈ 27% · KV Cache ≈ 10% · 默认 1M 上下文 近处精确(滑窗)+ 中距压缩(CSA)+ 远端极压(HCA)

图:DeepSeek V4 的分层注意力——近处不压缩,越远压得越狠。

2. 训练侧:Muon + OPD + 低比特

3. 两个版本与定价

版本参数(MoE)定位定价(每 M tokens)
Flash284B / 激活 13B轻量、低延迟输入 1 元 / 输出 2 元(命中缓存输入 0.2 元)
Pro1.6T / 激活 49B强推理输入 12 元 / 输出 24 元

两者默认 1M 上下文,最大输出约 384K;MIT 许可开源。

4. 基准(官方口径)

偏代码、agentic 工具调用、竞赛数学——与”极致压缩换来长上下文 + 强推理”的定位一致。

5. 三家合流:共同终点

把四篇串起来看:

路线代表注意力改造1M 上下文代价
重设计Kimi K3KDA 差分 + 门控(3:1) + 残差靠 MLA 省 KV
稀疏化MiniMax M3MSA 稀疏选择每 token 算力≈M2.7 的 1/20
压缩DeepSeek V4CSA+HCA 压 KV每 token 算力≈V3.2 的 27%、KV≈10%
结论:三家的差异在"动刀位置"(内部 / 范围 / KV 本身),但终点完全一致——MoE + 1M 上下文 + 注意力改造。2026 之后,稠密大模型基本退场,"长上下文 + 低 KV"成为前沿模型的及格线。

6. 投资视角

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。