1. π0:把 VLA 做成”通用接口”(2024-10)
Physical Intelligence 的 π0 定了基线:
- 底座:PaliGemma(约 3B VLM)+ 一个独立的动作专家(action expert),动作专家用 Flow Matching 生成连续动作,输出 50Hz 高频控制。
- 数据:在 OXE + 自有演示上训练,覆盖 7 种机器人平台、68 项任务。
- 统一接口:语言/图像进,连续动作出。证明”一个通用 VLA 能在多本体上干活”。
2. π0-Fast:离散化提速
在 π0 上加动作离散化 + 自回归,换取推理速度。是”连续 vs 离散”两条路线的工程折中,适合延迟敏感场景。
3. π0.5:跨本体 + 任务分解(2025-04)
- 跨本体协同训练(cross-embodiment co-training):多台不同机器人共享一个”通用大脑”,学到与硬件无关的操作常识。
- 任务分解(task decomposition):高层把复杂指令拆成子目标,低层策略依次执行——让长时程任务可控。
4. π0.6*:RL 专精(RECAP)
用强化学习在已训 VLA 上做专精打磨(RECAP 思路),把特定任务成功率再往上推。是”通用预训练 + 专精后训练”的典型后半段。
5. π0.7:记忆 + 组合泛化(2026-04)
π0.7 是系列目前的顶点,几个关键升级:
- 底座升级:Gemma3 4B + 860M 动作专家。
- MEM 记忆机制:从过往经验中学习、携带上下文记忆,处理长程多步任务更稳。
- 多模态提示:支持图像 / 语言 / 演示混合提示,会”照着示范做”。
- 涌现的组合泛化(compositional generalization):未见过的指令组合也能泛化——这是迈向”真正通用”的信号。
- 效果:在多项基准上超越专精策略(specialist policies),而不只是追平。
图:π 系列的演进——底座升级、跨本体、RL 专精、记忆与组合泛化
6. 演进主线(一句话)
VLM 底座升级 → 跨本体复用 → RL 专精打磨 → 记忆 + 组合泛化。通用 VLA 正从”能干活”走向”比专精策略更强”。
7. 承上启下
π 系列是海外标杆。下一篇看国内:蚂蚁灵波 LingBot-VLA 2.0 的”一脑多机”、小米的开源实时 VLA、腾讯 HyVLA 的 FlowPRO——以及一处常见混淆的澄清。
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。