0. 本系列的定位
“推测解码手记”讲的是怎么把大模型跑得更快;这个系列讲大模型能”感知并作用于世界”的能力从哪来——也就是多模态。
一条贯穿全系列的线索是:自回归生成(autoregressive decoding)是把所有模态统一起来的那把钥匙。文本是 token 的序列生成;图像可以离散成 token 序列(或用扩散做连续生成);动作可以离散成动作 token;连”世界模型”的预测也可以看成一种生成。理解了”生成即解码”,多模态就不再是散落的子领域,而是一条连贯的演进路线。
路线图:(一)基础与对齐范式 → (二)视觉语言模型 VLM 演进 → (三)生成模型(扩散 / GAN) → (四)从 VLA 到世界模型 → (五)高效系统与前沿推理。
1. 什么是”模态”,难点在哪
- 模态(modality):信息的一种自然呈现形式——文本、图像、音频、视频、动作(机器人关节角 / 末端位姿)、甚至是触觉、IMU 信号。
- 核心难点 = 对齐(alignment):不同模态的原始数据分布天差地别(文本是离散符号、图像是连续像素张量、动作是低频连续向量)。要让一个模型同时”懂”它们,必须把它们投影到同一套可计算的表征空间,并在该空间里学会”文本↔图像↔动作”的对应关系。
- 两种对齐粒度:
- 表征对齐:把不同模态编码到相近向量(如 CLIP 把”猫的图片”和”cat”拉近);
- 指令对齐:让模型按自然语言指令,对不同模态做推理/生成(如”把杯子移到左边”→ 一串动作)。
2. 生成式预训练:多模态大脑的”种子范式”
一切的起点是 GPT-1(Radford et al., 2018)——它首次证明”生成式预训练 + 下游微调”可以横扫 NLU 任务,写好了后来 ChatGPT 的全部基因。
- 核心公式:先在 BookCorpus 上做因果语言建模
L₁ = Σ log P(uᵢ | u<i; Θ),再迁移Θ加线性头W_y微调,辅以λ·L₁防遗忘。 - 架构:Decoder-only Transformer,12 层、d=768、h=12、ctx=512、117M 参数(虽小,但路线完整)。
- 为什么它是多模态的基石:GPT 路线确立了一个极具扩展性的范式——先在海量数据上”学生成”,再把生成空间替换/扩展到新模态。后来的多模态,不过是把这个”生成空间”从文本 token 逐步扩到图像 token、动作 token。
一句话:多模态不是另起炉灶,而是把 GPT 的”生成式预训练 + 微调”范式,沿着输出空间一路外推到视觉与动作。
3. 多模态演进的主线(全系列预览)
生成式预训练(会"写"语言)
└─ 多模态指令微调(会"看 + 说") → 系列(二)VLM
└─ 视觉-语言-动作 VLA(会"动手") → 系列(四)VLA + 世界模型
└─ VLA + 世界模型(会"先想再动") → 系列(四)
生成侧另一支:扩散 / GAN(会"画") → 系列(三)生成模型
支撑这一切的效率底座:注意力 / KV Cache / 投机解码 / 端侧 → 系列(五)
对投资视角的启示:具身智能的”大脑”并不是凭空出现的,而是沿用了语言 / 多模态大模型已经验证的预训练 + 微调范式;差别只在于输出空间从”文本 token”逐步扩展到”动作 token”。这也解释了为什么”大模型降本”直接利好具身——推理成本每降一档,端侧 / 机载实时 VLA 就多一分可行。
4. 实践启示
- 评估一家多模态 / 具身公司时,先看它是否复用成熟 LLM / VLM 预训练范式(而非另起炉灶)——这是判断其工程成熟度的第一信号。
- 对齐质量(而非模型参数量)往往决定多模态产品的可用性下限;数据(尤其是”图文 / 图文动作”配对数据)是最大瓶颈,常差 1~2 个数量级。
- 下一章我们进入具体模型:看 ViT、CLIP、LLaVA 如何把”看 + 说”做成一套可复制的标准范式。
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。