系列:前沿架构解码手记

前沿架构解码手记(二):Kimi K3——注意力与 MoE 的双重进化

0. 为什么从 Kimi K3 讲起

在总览里我们说过,Kimi K3 选的是”重设计注意力”这条最温和、也最好懂的路。它相比 M2.7→M3 的”稀疏化”、DeepSeek V4 的”压缩”,改动更靠近现有架构,适合作为循序渐进的第一站。

1. 注意力:在 MLA 上加一个”差分项”

Kimi K3 的注意力核心是 Kimi Delta Attention(KDA),建立在 MLA(Multi-head Latent Attention)之上:

配合 Attention Residuals(注意力残差):把上一层注意力的输出作为残差直接并入当前层,缓解深层网络里注意力信号衰减,让 1M 上下文训练更稳。

要点:KDA 不是推翻 MLA,而是在 MLA 上加"差分 + 门控(3:1) + 残差"三件套,目标是不增加太多 KV 的前提下,把长上下文建模做扎实。

2. MoE:Stable LatentMoE

Kimi K3 是 2.8T 参数的 MoE,关键在”稳”:

3. 视觉:MoonViT-V2 原生多模态

Kimi K3 的视觉不是”外接一个 CLIP”,而是 MoonViT-V2——一个从零训练、以 next-token-prediction 为目标的视觉编码器:

4. 基础设施:MoonEP / FlashKDA / AgentEnv

5. 效果与定位

官方口径:相对 K2.5,缩放效率约 2.5×——即同样算力/数据下,能力爬升更快;2.8T MoE + 1M 上下文 + 原生视觉,定位为”能读、能看、能长程推理”的通用前沿模型。

资料说明:本文核心架构点来自 Moonshot AI 官方技术报告(PDF)及官方微信公众号发布的解读;技术报告 PDF 在本站环境内未做机器解析,细节以官方发布为准。

6. 投资视角

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。