1. 从”理解”到”行动”:VLA 是什么
前面三章:① 基础与对齐范式 → ② VLM(看 + 说)→ ③ 生成(画)。这一章把这些能力接到物理动作上。
VLA(Vision-Language-Action):输入”视觉 + 语言指令”,输出机器人动作。它的核心思想是(一)章的主线落点——把动作也当成一种 token 来生成。
2. RT-2:首个大规模 VLA,让 VLM 直接输出动作(Google DeepMind, 2023)
- 核心思想:把 7-DoF 连续动作按 256-bin 离散化为文本 token,与语言共享输出空间;自回归生成动作字符串后解码执行(co-fine-tuning)。
- 效果:unseen 任务成功率 RT-1 的 32% → RT-2 的 62%。
- 意义:奠定了 OpenVLA / π0 / GR00T 等后续 VLA 路线——“机器人大脑”的本质是”把动作当语言来生成”。这正好闭环了(一)章的判断:多模态 = 把生成空间从文本外推到动作。
3. 纯 VLA 的致命缺陷:会”幻觉动作”
RT-2 之后大家发现:纯 VLA 在长程、精细任务上会生成看似合理、实则不可执行的动作(物体不存在、轨迹穿模)。根因是——VLA 只学”动作分布”,没有对”物理世界会怎样演化”的内部模型。
4. π0.7:把世界模型当”子目标图像提供器”(Physical Intelligence)
- 核心做法:首次把世界模型(World Model)作为 Subgoal Image Provider 集成进 VLA——行动前先在”脑中”预测一张子目标图像(下一步世界该长什么样),再用它引导动作执行。
- 解决什么:用”先想清楚下一步世界状态,再动手”替代”盲生成动作”,显著克服幻觉动作。
- 跨本体零适配:实测 ARX 机械臂学到的叠衣服能力零适配迁移到 UR5 双臂——说明”世界模型引导”学到的是可迁移的通用技能,而非某一机械臂的过拟合。
5. HiF-VLA:运动中心的双向时空推理(西湖 MiLAB, CVPR 2026)
- 核心:Motion-centric 双向时空推理,联合专家同时预测”未来 Motion + 动作”。
- 效率:显存 31.4GB(基线 63.6)、延迟 117.7ms(基线 229.5),LIBERO-LONG SOTA。
- 意义:在”预测未来”这件事上,把动作与世界演化显式联合建模,比单纯动作生成更稳更快。
6. 终局共识(WRAM):VLA 与世界模型”融合共生”
- 业界逐渐收敛:纯 VLA 不够,VLA + 世界模型(WAM, World-Action Model)是具身智能的终局方向。
- 世界模型的角色不止”子目标图像”:它还能做预测式规划 / 失败预判 / 仿真式数据增强,缓解数据瓶颈(见下)。
- 数据仍是最大瓶颈:高质量”图文动作”配对数据差 1~2 个数量级,而世界模型恰好能靠”在内部世界里rollout”生成大量合成训练信号——这是 VLA + 世界模型融合的另一重动机。
7. 实践启示
评估具身公司 / 模型时,重点看三点(呼应(一)的评估框架):
- 是否复用成熟 LLM / VLM 预训练范式(而非另起炉灶)——决定工程成熟度;
- VLA 是否引入世界模型做”先想再动”——决定长程任务可靠性;
- 跨本体 / 零适配迁移能力——决定量产可复制性(π0.7 的 ARX→UR5 是关键证据)。
这条主线也解释了为什么”大模型降本 + 高效推理”(下一章)直接利好具身:推理成本每降一档,端侧 / 机载实时 VLA + 世界模型就多一分可行。
下一章我们把视野拉到”底座”:支撑上述一切多模态模型的注意力机制、高效训练 / 推理系统、端侧智能与前沿 RL——也就是让这些模型”跑得起、跑得快、跑在端侧”的优化手段。
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。