系列:VLA 解码手记

VLA 解码手记(一):从「看懂」到「动手」——什么是视觉-语言-动作模型

1. 为什么需要 VLA

前面的「多模态解码手记」讲完了 VLM——模型已经能看图、说出图里有什么。但真实世界里有大量任务要求的不只是”说”,而是动手:把碗放到沥水架、叠好毛巾、把零件装进卡槽。

VLA(Vision-Language-Action,视觉-语言-动作)模型就是把这三件事接到一条链路里:

输入 = 图像 / 视频(看到了什么)+ 语言指令(要做什么) 输出 = 机器人的连续动作(去哪、怎么动、用多大力)

它是「具身智能(Embodied AI)」的操作内核——让模型不仅生成文字,还生成能改变物理世界的控制指令。

图像 / 视频 语言指令 VLA 模型 VLM 大脑 + 动作头 机器人动作 连续控制序列

图:VLA 把"看到 + 说清"升级为"看到 + 说清 + 做对"

2. 范式跃迁:从手写策略到原生 VLA

机器人控制不是新课题。它走过几条路:

  1. 任务专用策略(Task-specific policy):每个任务单独写运动规划 + 感知模块。泛化差,长尾任务写不过来。
  2. 模仿学习(BC / DAgger):采集人类示范,让模型学”看状态→出动作”。能处理复杂任务,但换本体/换指令就崩。
  3. VLM 改造:在现成 VLM 后面接一个”动作头”,把图像理解变成动作。便宜,但理解和动作是两段式,容易脱节。
  4. 原生 VLA(联合预训练 V+L+A):把视觉、语言、动作在同一套表征里一起预训练。这是当前主流方向(π0、OpenVLA、Xiaomi-Robotics-0 都属此类)。

关键判断:VLA 不是”再训一个大模型”,而是把 LLM/VLM 已经具备的常识与泛化,顺着(一)(二)里讲的对齐范式,延伸到物理动作空间。

3. 动作怎么表示:两条路线

连续动作(机械臂 6–7 自由度关节角、移动底座速度)不能直接当文本 token。主流有两种编码:

4. 训练数据的命门:OXE 与跨本体

VLA 的”食材”是机器人演示数据。最重要的公开集是 Open X-Embodiment(OXE)——把几十家实验室、多种机器人本体的演示凑成跨本体(cross-embodiment)语料,让模型学到”与硬件无关”的通用操作常识。

但真实瓶颈在这里:语言模型吞了数万亿 token、视频模型吞了数十亿 clip,而头部公司的高质量物理交互数据只有几十万小时——离验证 scaling law 还差至少一个数量级(WAIC 2026 的共识)。

这恰好呼应(二)里”数据构造常是天花板”的判断:VLA 的竞争,短期看架构,长期看谁先跑通数据飞轮。

5. 承上启下

本篇给了 VLA 的骨架。下一篇深入动作生成的”发动机”——Diffusion Policy、Flow Matching、Action Chunking,以及小米如何把推理延迟压到 80ms。再之后是 π 系列的完整演进,以及国内玩家(蚂蚁灵波、小米、腾讯)的落地打法。

投资视角(呼应你的持仓框架):具身智能正从”炫技”进入”拼大脑”阶段,真正壁垒是模型体系 + 真实场景数据闭环。关注有工程闭环能力的公司,比追单一参数更稳。

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。