系列:前沿架构解码手记

前沿架构解码手记(一):2026 前沿大模型总览——长上下文 × 效率 × 规模化 的不可能三角

0. 本系列的定位

“推测解码手记”讲的是怎么把现有大模型跑得更快;“多模态解码手记”讲的是模型怎么感知并作用于世界。这两条线最后都汇到一个问题:模型架构本身,在 2026 年走到了哪一步?

2026 年集中亮相的三款前沿模型——Kimi K3、MiniMax M3、DeepSeek V4——恰好构成了一组”对照实验”:它们面对的是同一个工程难题,却给出了三种不同的解法。本系列就用”循序渐进”的方式,把这三家拆开讲清楚,最后再合起来看趋势。

路线图:(一)总览与路线图 → (二)Kimi K3:注意力与 MoE 的双重进化 → (三)MiniMax M2.7→M3:稀疏注意力的跨越 → (四)DeepSeek V4:极致压缩与高效训练。

1. 一个三角形:长上下文 × 效率 × 规模化

理解这三家,先立一个”不可能三角”:

朴素做法(标准 softmax 注意力 + 稠密模型)在三角形中心,哪个顶点都够不着——上下文一长就 OOM,模型一大就烧钱。三家的破局思路,本质都是改造注意力机制 + 上 MoE,只是抓手不同:

            长上下文 (1M)
               /      \
            重设计     压缩
          注意力       注意力
             |          |
   Kimi K3   |    DeepSeek V4
   (KDA+MLA) |    (CSA + HCA)
             \          /
          稀疏注意力
             MiniMax M3
              (MSA)
               \      /
                规模化 (MoE)
一句话:2026 前沿架构的竞争,不是"谁参数多",而是"谁能把注意力改到既撑得起 1M 上下文、又不让 KV 与算力爆炸"。三家分别选了重设计 / 稀疏化 / 压缩三条路。

2. 注意力改造谱系(速查):SWA 混合模型是什么

把 2026 年各家对注意力的”改造”摆成一条谱系,从”完全不改”到”彻底换范式”,方便后面每篇对号入座:

改造类型代表核心做法注意力复杂度
全注意力(Full Attention)标准 Transformer、MiniMax M2.7每个 token attend 全部历史O(n²)
滑动窗口注意力(SWA)Longformer / GPT-3 滑窗、早期 Gemma每个 token 只看窗口 w 内O(n·w)
SWA 混合模型Step-3.5-Flash(3:1)、Mistral / Gemma 类同时堆叠 Full Attention 层与 Sliding Window Attention 层O(n²) 局部 + O(n·w) 主体
稀疏注意力(MSA)MiniMax M3学习/固定稀疏模式,只算重要对≪ O(n²)
压缩注意力(CSA + HCA)DeepSeek V4把 KV 压成块 / 极致压缩O(n·c)
非注意力(Mamba / SSM)Kimi K3(部分)、Jamba用状态空间替代注意力O(n)

SWA 混合模型(Sliding-Window-Attention Hybrid):指同时包含 Full Attention 层和 Sliding Window Attention 层的混合注意力架构模型。典型做法是把大部分层设为滑动窗口(把主体 KV 开销从 O(n²) 压到 O(n·w)),再每隔若干层插入少量 Full Attention 层,负责”长程信息跨窗口传播”——否则窗口外的信息永远传不进来、模型会”健忘”。Step-3.5-Flash 用的就是 3:1(每 3 层滑窗 + 1 层全注意),详见 Fw6:模型支持与选型。

为什么要"混合"?纯 SWA 便宜但"健忘"(窗口外信息丢失,长程依赖断掉);纯 Full Attention 信息全但贵。SWA 混合 = 用少量 Full Attention 层"打通"窗口之间的长程依赖,主体仍用 SWA 省钱——这是"性价比"与"记忆力"之间的折中,也是 2026 年很多中等规模模型的首选注意力配方。
注意力改造谱系 从全注意力到非注意力(Mamba)的复杂度谱系,SWA 混合模型位于滑窗与稀疏之间。 注意力改造谱系(复杂度由高到低) Full Attn O(n²) SWA O(n·w) SWA 混合 Full+SWA 层 稀疏 MSA ≪O(n²) 压缩 CSA+HCA O(n·c) Mamba/SSM O(n) 箭头方向:注意力 KV / 算力成本递减,记忆与长程能力递减;SWA 混合在"省钱"与"不忘"之间取折中。 注:此谱系按"改造强度/成本"排列,非严格单调;具体模型常混合多种(如 V4 同时有 CSA/HCA + 滑窗兜底)。

3. 三家路线速写

模型发布核心抓手上下文参数量级开放
Kimi K32026重设计注意力(KDA + Gated MLA 3:1)+ Stable LatentMoE + 原生视觉1M2.8T MoE权重开源
MiniMax M32026-06稀疏注意力(MSA)+ 原生多模态 + computer use1M(M2.7 仅 200K)未公开(MoE)权重开源
DeepSeek V42026-04压缩注意力(CSA + HCA)+ Muon 优化器 + OPD 蒸馏1M(默认)Pro 1.6T / Flash 284B(MoE)MIT 开源

4. 循序渐进路线图

本系列刻意按”注意力改造强度”由轻到重排:

  1. (二)Kimi K3:在 MLA 基础上加一个差分项(KDA)、把 MLA 与门控按 3:1 结合——属于”温和改注意力 + 重做 MoE/视觉”,最好懂,适合作为入门。
  2. (三)MiniMax M2.7→M3:先看 M2.7 的标准注意力 baseline,再看 M3 如何把它稀疏化——这是”注意力从稠密到稀疏”的现场演进,最直观地展示稀疏化的收益。
  3. (四)DeepSeek V4:直接压缩 KV 本身(CSA/HCA),再叠加 Muon、OPD、FP8/FP4——改造最激进、工程最重,放在最后压轴。

这样读完,你会自然建立起一条主线:稠密注意力 → 稀疏注意力 → 压缩注意力,最终三家都收敛到”MoE + 1M 上下文”这一共同终点。

5. 贯穿全系列的主线 & 投资视角

三家的共同点远比差异重要:

投资视角:注意力的”摩尔定律”(同样上下文下算力/KV 逐年大幅下降)直接利好推理侧降本——每降一档,端侧 / 机载实时 VLA、Agent 长程任务就多一分可行,这正是具身智能与 AI 应用的成本拐点。下一章从 Kimi K3 的”重设计注意力”开始,逐家拆解。

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。