系列:多模态解码手记

多模态解码手记(四):从 VLA 到世界模型——RT-2 → π0.7 → HiF-VLA

1. 从”理解”到”行动”:VLA 是什么

前面三章:① 基础与对齐范式 → ② VLM(看 + 说)→ ③ 生成(画)。这一章把这些能力接到物理动作上。

VLA(Vision-Language-Action):输入”视觉 + 语言指令”,输出机器人动作。它的核心思想是(一)章的主线落点——把动作也当成一种 token 来生成。

2. RT-2:首个大规模 VLA,让 VLM 直接输出动作(Google DeepMind, 2023)

3. 纯 VLA 的致命缺陷:会”幻觉动作”

RT-2 之后大家发现:纯 VLA 在长程、精细任务上会生成看似合理、实则不可执行的动作(物体不存在、轨迹穿模)。根因是——VLA 只学”动作分布”,没有对”物理世界会怎样演化”的内部模型。

4. π0.7:把世界模型当”子目标图像提供器”(Physical Intelligence)

5. HiF-VLA:运动中心的双向时空推理(西湖 MiLAB, CVPR 2026)

6. 终局共识(WRAM):VLA 与世界模型”融合共生”

7. 实践启示

评估具身公司 / 模型时,重点看三点(呼应(一)的评估框架):

  1. 是否复用成熟 LLM / VLM 预训练范式(而非另起炉灶)——决定工程成熟度;
  2. VLA 是否引入世界模型做”先想再动”——决定长程任务可靠性;
  3. 跨本体 / 零适配迁移能力——决定量产可复制性(π0.7 的 ARX→UR5 是关键证据)。

这条主线也解释了为什么”大模型降本 + 高效推理”(下一章)直接利好具身:推理成本每降一档,端侧 / 机载实时 VLA + 世界模型就多一分可行。

下一章我们把视野拉到”底座”:支撑上述一切多模态模型的注意力机制、高效训练 / 推理系统、端侧智能与前沿 RL——也就是让这些模型”跑得起、跑得快、跑在端侧”的优化手段。

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。