这条路线的判据只有一个:模型最终输出动作。2023 年 Google 的 RT-2(arXiv:2307.15818)证明了一件事:把网页上学来的知识直接迁移到机械臂上——视觉-语言模型的权重可以「直出」机器人动作,VLA(视觉-语言-动作)的概念就此确立。随后 OpenVLA(7B,开源)点燃社区微调生态,Physical Intelligence 的 π0 用流匹配动作专家做到 50Hz 连续控制,π0.5 在陌生厨房里收拾台面——开放世界泛化第一次看起来不再遥远。
另一翼是「世界基础模型」:NVIDIA 在 CES 2025 发布 Cosmos,把「预训练世界模型 + 后训练到具体机器人」做成平台,与 GR00T 人形机器人栈配套;Wayve 的 GAIA 系列面向自动驾驶生成驾驶场景;1X 给人形机器人做了「预测接触密集未来」的世界模型,用来评估比特而非原子——先在模型里筛掉坏策略,省下真机试验。蚂蚁灵波的 LingBot-VA(RSS 2026)给出一个融合样本:先预测未来视觉状态,再用逆动力学反解出动作——世界模型与控制器在一个自回归序列里合体。