0. 先澄清一个混淆
你提到的”小米还有 Hy3”这里要纠一下:Hy3 / HyVLA 是腾讯混元系的具身团队,不是小米。小米的 VLA 模型叫 Xiaomi-Robotics-0。下面把三家分开讲,免得张冠李戴。
1. 蚂蚁灵波:LingBot-VLA 2.0「一脑多机」
- 背景:蚂蚁灵波科技,蚂蚁集团全资子公司,2025-03 成立于上海浦东,聚焦机器人”通用大脑”。2026-08 启动首轮独立融资,拟募资 15 亿元。
- 旗舰 LingBot-VLA 2.0(2026-07 发布):主打”一脑多机”——预训练阶段已适配宇树、智元、银河通用、乐聚等 17 个品牌、20 多种机器人构型,体现跨本体复用与泛化。
- LingBot 模型矩阵:VLA 2.0(基座/跨本体)、VA 2.0(世界动作模型)、Vision(空间原生视觉基模)、World 2.0(无限时长实时交互世界模型)、Video(MoE 架构开源视频生成)。
- 产业判断(CEO 朱兴):过去几年”小脑”和硬件发展快,但大脑才是瓶颈;未来”AI 将反向定义硬件”。
2. 小米:Xiaomi-Robotics-0(开源实时 VLA)
- 发布:2026-02 开源,4.7B 参数,雷军亲自公布,权重/HF/代码全公开。
- 架构:MoT——VLM 大脑 + 16 层 DiT 小脑,KV Cache 松耦合(详见(二))。
- 性能:80ms 延迟、30Hz、RTX 4090 实时,LIBERO / CALVIN / SimplerEnv 全基准 SOTA。
- 亮点:解决”动作断层”——异步推理 + Action Proposal + Clean Action Prefix + Λ 型注意力。
- 意义:大厂把消费级可跑的实时 VLA 开源,降低了行业门槛,也方便在自有工厂产线做数据飞轮(90.2% → 98% 的逐帧优化)。
3. 腾讯:HyVLA 与 FlowPRO
- FlowPRO:用 flow-matching 回归损失当隐式奖励代理,不需要额外 Critic 网络;四个长时程双臂任务成功率 94%–99%,碾压传统 DAgger 的 83%–93%。
- 数据:直接上光学动捕系统,亚毫米级精度采集。
- 定位:腾讯混元(Hy 系)在具身方向的方法论输出,强调后训练创新比参数规模更影响落地。
4. 生态与格局
| 玩家 | 模型 | 特点 | 姿态 |
|---|---|---|---|
| 蚂蚁灵波 | LingBot-VLA 2.0 | 一脑多机 / 跨本体 | 融资扩张 |
| 小米 | Xiaomi-Robotics-0 | 开源 / 实时 / 4090 | 开源+产线 |
| 腾讯 | HyVLA (FlowPRO) | 隐式奖励后训练 | 方法论 |
| 智元/宇树/银河/乐聚 | 各自本体+策略 | 硬件+小脑强 | 生态被接入 |
共同趋势:“拼大脑”阶段——谁先有完整模型体系 + 真实场景数据闭环,谁先跑出平台级公司。蚂蚁灵波已把 17 品牌接入同一大脑,是小脑/硬件厂商(宇树等)的上游”大脑供应商”逻辑。
5. 承上启下
国内玩家把 VLA 推向”跨本体 + 开源 + 工程闭环”。下一篇看 VLA 的下一站:世界模型、Sim-to-Real、数据飞轮与 scaling 瓶颈。
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。