1. 世界模型:让模型”想一步”
VLA 是”看→做”。世界模型(World Model)再多一层:“做这一步后,世界会变成什么样”——用于规划与想象 rollout。
- 蚂蚁灵波 LingBot-World 2.0 支持无限时长、实时交互的世界模拟;
- π 系列内部也用”预测未来观测”的思路提升长程稳定性;
- 价值:在脑子里先推演几种后果,再选最优动作,减少真机试错成本。
2. Sim-to-Real:仿真先行
- NVIDIA Isaac Sim 提供高保真物理引擎,大量试错在虚拟环境完成;
- 西门子与 Humanoid、NVIDIA 合作,把原型开发周期从 18–24 个月压到 7 个月;
- 但仿真永远无法完美复现现实,最后的 gap 只能靠真实部署来填。
3. 数据飞轮:真正的护城河
部署越多 → 数据越多 → 模型越聪明 → 部署越多。
- 小米工厂:每一次产线微小失误,几小时内转成算法更新素材,成功率从 90.2% 推到 98%;
- 腾讯光学动捕亚毫米采集;睿尔曼 150 台真机持续作业覆盖 1000+ 真实任务;
- WAIC 2026 共识:中美头部年内规划积累超 100 万小时训练数据。
4. Scaling 瓶颈:数据差一个数量级
语言模型吞数万亿 token、视频模型吞数十亿 clip;而头部公司的高质量物理交互数据只有几十万小时——离验证 VLA 的 scaling law 还差至少一个数量级。这是行业当前最大的”卡脖子”。
5. 落地挑战清单
- 实时性:延迟/帧率(小米 80ms/30Hz 是标杆);
- 长时程:多步任务的一致性(π0.7 记忆机制在补);
- 安全与成本:真机容错、部署成本;
- 工程闭环:采集 → 训练 → Sim2Real → 部署,四环节必须全跑通。
6. 产业 / 投资视角(呼应你的框架)
具身智能进入”拼大脑”阶段,关键变量从”谁的模型跑分高”转向”谁先跑通工程闭环”:
- 关注有完整模型体系 + 场景闭环的公司(蚂蚁灵波 / 小米 / 腾讯 / 智元等),而非单一参数;
- 硬件→被大脑反向定义,本体厂商(宇树等)可能成为”大脑供应商”的下游;
- 二级市场:机器人 / AI 产业链 ETF(如你监控池里的科创芯片ETF、机器人ETF)是间接敞口,比押单一未上市标的更稳、也更符合你”稳健 + 仓位管理”的偏好。
7. 系列收尾
五篇串起来:VLA 是什么(一)→ 动作怎么生成(二)→ π 系列演进(三)→ 国内玩家(四)→ 世界模型与落地(五)。它与「多模态解码手记(二)的 LLaVA」一脉相承——VLM 的”看懂”被顺理成章地延伸成了 VLA 的”动手”。
下一站可以接着写:把 VLA 与(推测解码手记)里的推理加速打通——机器人本体的 onboard 推理如何用投机解码 / 低比特量化降本,正是你持仓里”推理降本→具身部署门槛下降”投资逻辑的底层技术。
💬 留言
NaphJohn/LLM-blog尚未启用 Discussions:请在 GitHub 仓库 Settings → General → Features 勾选 Discussions 后刷新本页,评论区即自动显示。