1. 为什么 VLM 是承上启下的一章
(一)讲到:多模态的本质是对齐。文本侧已经有成熟的语言模型;图像侧怎么办?VLM(Vision-Language Model)的演进,就是一步步把”图像”变成语言模型能消化的食物。
2. ViT:把图像切成 token 序列(Dosovitskiy et al., 2020)
- 核心洞察:Transformer 不挑输入形态。把图像切成 16×16 的 patch,每个 patch 当成一个”视觉 token”,像文本 token 一样喂进 Transformer。
- 做法:
image → patch embedding → +position → Transformer encoder → 全局表征。 - 意义:第一次让”图像”和”文本”在架构层面同构(都是 token 序列),为后面的统一表征铺路。今天几乎所有多模态视觉编码器都基于 ViT(或它的变体)。
3. CLIP:用对比学习把图文塞进同一空间(Radford et al., 2021)
- 核心机制:4 亿”图文对”上做对比学习——同一对的图文向量拉近距离、不同对的推开。训练目标不是一个分类头,而是一个”图文匹配”的相似度函数。
- 关键产出:一个共享嵌入空间,使”猫的图片”和文本 “a cat” 落到相近向量。这个空间可直接 zero-shot:把类别名当 prompt,算图像与各类文本的相似度即完成分类。
- 意义:CLIP 是真正意义上”对齐”的工业级方案,也成为后续 LLaVA / DALL·E / 一切图文模型的视觉底座。
4. LLaVA:标准 VLM 范式定型(NeurIPS 2023 Oral)
LLaVA 证明了一件事:不需要从头训一个多模态大模型,冻结视觉编码器 + 一个轻量投影 + 微调 LLM 就够了。
- 数据魔法:用 GPT-4 根据 COCO captions “想象”出 158K 条多模态指令数据(对话 / 描述 / 推理三类,零人工标注)——解决了多模态指令数据稀缺的死结。
- 极简架构:
冻结 CLIP ViT + 可训练线性投影 W + Vicuna LLM。 - 两阶段训练:
- 特征对齐:只用图文对,训投影
W把 ViT 输出对齐到 LLM 的词嵌入空间; - 指令微调:接上 158K 指令数据,解冻 LLM 一起训。
- 特征对齐:只用图文对,训投影
- 效果:GPT-4-as-Judge 相对分 85.1%,ScienceQA 92.53% SOTA。
图:LLaVA 标准范式——冻结视觉编码器 + 轻量投影桥接 + LLM 微调(重绘)
这一范式(冻结视觉编码器 + 投影桥接 + LLM 微调)催生了 LLaVA-1.5 / NeXT、CogVLM、InternVL、Qwen-VL 整条生态——今天你看到的绝大多数”能看图聊天”的模型,骨架都源自这里。
5. 什么决定一个 VLM 的好坏
- 对齐数据质量:LLaVA 的 158K 告诉我们,数据构造(而非模型结构)常是天花板。指令数据的多样性、推理链深度直接决定”看懂→说清”的能力。
- 投影设计:线性投影最轻量,但复杂任务上 MLP / 注意力式投影更稳。
- 视觉编码器分辨率:高分辨率(更高 patch 数)对 OCR / 细粒度理解至关重要,Qwen-VL / InternVL 在此持续加注。
- 与 LLM 的耦合深度:从”只训投影”到”联合微调”到”原生多模态预训练(如 GPT-4V / Gemini)“,能力上限递增、成本也递增。
6. 承上启下
VLM 解决了”看 + 说”。但很多真实任务要求”动手”——把视觉理解转成动作。下一章我们回到”生成”的另一支:图像 / 视频是怎么被生成出来的(扩散与 GAN);再下一章,再把这些能力接到机器人动作上,进入 VLA 与世界模型。
实践提示:看多模态模型时,先问”视觉编码器是谁(CLIP/ViT 系?)、对齐数据怎么来的、投影怎么接”——这三问能快速判断其工程成熟度,对应(一)里”是否复用成熟范式”的评估框架。
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。