系列:VLA 解码手记

VLA 解码手记(二):动作生成的发动机——Diffusion Policy、Flow Matching 与低延迟

1. 为什么离散 token 不够用

上篇说到,把连续动作量化成 token 自回归生成,会截断精度、轨迹抖动。机器人需要的是高频、平滑、对扰动敏感的连续控制——这正是扩散/流匹配擅长的。

2. Diffusion Policy:把动作当”图像”去去噪

Diffusion Policy(Chi et al., 2023)借用了图像生成的扩散思想:

好处是天然支持多峰分布(同一画面可以有多种合理动作),对示范数据里的噪声也更能扛。

3. Flow Matching:比扩散更快更稳

Flow Matching 不直接建模复杂的概率路径,而是学习概率流(probability flow)的映射——把简单分布直线”推”向目标动作分布。

本站(推测解码手记)里讲过的”流匹配”在这里落地成了物理动作,不是文字 token——同一个数学工具,跨模态复用。

4. Action Chunking:一次预测一整段

高频决策每毫秒都出动作,既慢又抖。Action Chunking(源自 ACT / π0)让模型一次预测一小段动作块(chunk):

5. 小米的打法:MoT 松耦合 + 异步推理压延迟

Xiaomi-Robotics-0(2026-02 开源,4.7B)是低延迟 VLA 的范本:

结果:80ms 推理延迟、30Hz 控制频率、RTX 4090 实时,LIBERO / CALVIN / SimplerEnv 全基准 SOTA。

VLM 大脑 理解+决策 KV Cache 松耦合传递 DiT 小脑 生成动作块 真机 30Hz 异步

图:小米 MoT——大脑与小脑经 KV Cache 松耦合,异步驱动真机

6. 承上启下

动作生成机制清楚了。下一篇看 π 系列如何用这套机制一步步进化:从 π0 的 Flow Matching 50Hz,到 π0.7 的记忆与组合泛化。

觉得有用?欢迎点赞、收藏,或请作者喝咖啡 ☕️

支付宝收款码

支付宝

微信收款码

微信

💬 留言

评论由 Giscus 驱动(基于 GitHub Discussions)。 当前仓库 NaphJohn/LLM-blog 尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。