系列:多模态解码手记

多模态解码手记(一):基础与对齐范式——从"会写"到"会看会动"

0. 本系列的定位

“推测解码手记”讲的是怎么把大模型跑得更快;这个系列讲大模型能”感知并作用于世界”的能力从哪来——也就是多模态。

一条贯穿全系列的线索是:自回归生成(autoregressive decoding)是把所有模态统一起来的那把钥匙。文本是 token 的序列生成;图像可以离散成 token 序列(或用扩散做连续生成);动作可以离散成动作 token;连”世界模型”的预测也可以看成一种生成。理解了”生成即解码”,多模态就不再是散落的子领域,而是一条连贯的演进路线。

路线图:(一)基础与对齐范式 → (二)视觉语言模型 VLM 演进 → (三)生成模型(扩散 / GAN) → (四)从 VLA 到世界模型 → (五)高效系统与前沿推理。

1. 什么是”模态”,难点在哪

2. 生成式预训练:多模态大脑的”种子范式”

一切的起点是 GPT-1(Radford et al., 2018)——它首次证明”生成式预训练 + 下游微调”可以横扫 NLU 任务,写好了后来 ChatGPT 的全部基因。

一句话:多模态不是另起炉灶,而是把 GPT 的”生成式预训练 + 微调”范式,沿着输出空间一路外推到视觉与动作。

3. 多模态演进的主线(全系列预览)

生成式预训练(会"写"语言)
   └─ 多模态指令微调(会"看 + 说")           → 系列(二)VLM
        └─ 视觉-语言-动作 VLA(会"动手")       → 系列(四)VLA + 世界模型
             └─ VLA + 世界模型(会"先想再动")   → 系列(四)
生成侧另一支:扩散 / GAN(会"画")             → 系列(三)生成模型
支撑这一切的效率底座:注意力 / KV Cache / 投机解码 / 端侧  → 系列(五)

对投资视角的启示:具身智能的”大脑”并不是凭空出现的,而是沿用了语言 / 多模态大模型已经验证的预训练 + 微调范式;差别只在于输出空间从”文本 token”逐步扩展到”动作 token”。这也解释了为什么”大模型降本”直接利好具身——推理成本每降一档,端侧 / 机载实时 VLA 就多一分可行。

4. 实践启示

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。