0. 压轴:最激进的”压缩”路线
前面两家:Kimi K3 改注意力内部(差分),MiniMax M3 改注意力范围(稀疏)。DeepSeek V4 更进一步——直接压缩 KV Cache 本身,并把训练也重做了一遍。这是路线图里改造最重的一站。
1. 注意力:CSA + HCA 混合
- CSA(Compressed Sparse Attention,压缩稀疏注意力):把 KV 按 4-token 块压缩,再对块做 top-k 选择——既压缩又保留稀疏选择。
- HCA(Heavily Compressed Attention,重度压缩注意力):压缩比高达 128×,用于处理”最远端、最该压缩”的历史。
- 不压缩滑窗分支:最近 128 token 走普通注意力,保证局部精细建模不被压坏。
三者混合,形成”近处精确、远处压缩”的分层结构。
图:DeepSeek V4 的分层注意力——近处不压缩,越远压得越狠。
2. 训练侧:Muon + OPD + 低比特
- Muon 优化器替代 AdamW:对正交/矩矩阵用 Muon(动量 + 正交化),更省显存、收敛更稳,是 V4 训练降本的关键。
- OPD(On-Policy Distillation,同策略蒸馏):用主模型在线蒸馏”领域专家”小模型,把专项能力压缩进统一模型,避免离线蒸馏的分布偏移。
- FP8 训练 / FP4 专家参数:MoE 专家权重用 FP4,进一步压训练/存储成本。
- MegaMoE EP 通信:专家并行通信优化,提速 1.5–1.73×;另有磁盘 KV Cache、TileLang DSL、昇腾 NPU 适配。
3. 两个版本与定价
| 版本 | 参数(MoE) | 定位 | 定价(每 M tokens) |
|---|---|---|---|
| Flash | 284B / 激活 13B | 轻量、低延迟 | 输入 1 元 / 输出 2 元(命中缓存输入 0.2 元) |
| Pro | 1.6T / 激活 49B | 强推理 | 输入 12 元 / 输出 24 元 |
两者默认 1M 上下文,最大输出约 384K;MIT 许可开源。
4. 基准(官方口径)
- Codeforces 评分 3206(V4-Pro-Max);
- SWE-Verified 80.6%;
- Toolathlon 51.8;
- Putnam 2025 满分。
偏代码、agentic 工具调用、竞赛数学——与”极致压缩换来长上下文 + 强推理”的定位一致。
5. 三家合流:共同终点
把四篇串起来看:
| 路线 | 代表 | 注意力改造 | 1M 上下文代价 |
|---|---|---|---|
| 重设计 | Kimi K3 | KDA 差分 + 门控(3:1) + 残差 | 靠 MLA 省 KV |
| 稀疏化 | MiniMax M3 | MSA 稀疏选择 | 每 token 算力≈M2.7 的 1/20 |
| 压缩 | DeepSeek V4 | CSA+HCA 压 KV | 每 token 算力≈V3.2 的 27%、KV≈10% |
结论:三家的差异在"动刀位置"(内部 / 范围 / KV 本身),但终点完全一致——MoE + 1M 上下文 + 注意力改造。2026 之后,稠密大模型基本退场,"长上下文 + 低 KV"成为前沿模型的及格线。
6. 投资视角
- 推理成本曲线继续下探:KV 与每 token 算力被压到 1/10~1/20 量级,直接利好端侧 / 机载实时模型与长程 Agent——具身智能的成本拐点更近。
- 能力商品化加速:三家全开源(MIT/Apache),“前沿模型能力”不再是壁垒,壁垒转移到数据、工程、生态与场景。
- 训练降本(Muon / FP4 / OPD)意味着小团队也能训出强模型,利好国产算力与垂直模型生态。
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。