系列:多模态解码手记

多模态解码手记(二):视觉语言模型演进——ViT → CLIP → LLaVA

1. 为什么 VLM 是承上启下的一章

(一)讲到:多模态的本质是对齐。文本侧已经有成熟的语言模型;图像侧怎么办?VLM(Vision-Language Model)的演进,就是一步步把”图像”变成语言模型能消化的食物。

2. ViT:把图像切成 token 序列(Dosovitskiy et al., 2020)

3. CLIP:用对比学习把图文塞进同一空间(Radford et al., 2021)

4. LLaVA:标准 VLM 范式定型(NeurIPS 2023 Oral)

LLaVA 证明了一件事:不需要从头训一个多模态大模型,冻结视觉编码器 + 一个轻量投影 + 微调 LLM 就够了。

LLaVA 架构:输入图像经冻结 CLIP ViT-L/14 编码,经可训练投影层桥接到 Vicuna 文本嵌入空间,与文本 token 拼接后由 LLM 自回归解码

图:LLaVA 标准范式——冻结视觉编码器 + 轻量投影桥接 + LLM 微调(重绘)

这一范式(冻结视觉编码器 + 投影桥接 + LLM 微调)催生了 LLaVA-1.5 / NeXT、CogVLM、InternVL、Qwen-VL 整条生态——今天你看到的绝大多数”能看图聊天”的模型,骨架都源自这里。

5. 什么决定一个 VLM 的好坏

6. 承上启下

VLM 解决了”看 + 说”。但很多真实任务要求”动手”——把视觉理解转成动作。下一章我们回到”生成”的另一支:图像 / 视频是怎么被生成出来的(扩散与 GAN);再下一章,再把这些能力接到机器人动作上,进入 VLA 与世界模型。

实践提示:看多模态模型时,先问”视觉编码器是谁(CLIP/ViT 系?)、对齐数据怎么来的、投影怎么接”——这三问能快速判断其工程成熟度,对应(一)里”是否复用成熟范式”的评估框架。

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。