世界模型WORLD MODELS
路线 4 · EMBODIED

把世界模型接到双手: 输出的不是像素,是动作

2022 — 至今代表:RT-1/2 · OpenVLA · π0 系 · Cosmos + GR00T · GAIA · LingBot-VA
§1 起源故事

这条路线的判据只有一个:模型最终输出动作。2023 年 Google 的 RT-2(arXiv:2307.15818)证明了一件事:把网页上学来的知识直接迁移到机械臂上——视觉-语言模型的权重可以「直出」机器人动作,VLA(视觉-语言-动作)的概念就此确立。随后 OpenVLA(7B,开源)点燃社区微调生态,Physical Intelligence 的 π0 用流匹配动作专家做到 50Hz 连续控制,π0.5 在陌生厨房里收拾台面——开放世界泛化第一次看起来不再遥远。

另一翼是「世界基础模型」:NVIDIA 在 CES 2025 发布 Cosmos,把「预训练世界模型 + 后训练到具体机器人」做成平台,与 GR00T 人形机器人栈配套;Wayve 的 GAIA 系列面向自动驾驶生成驾驶场景;1X 给人形机器人做了「预测接触密集未来」的世界模型,用来评估比特而非原子——先在模型里筛掉坏策略,省下真机试验。蚂蚁灵波的 LingBot-VA(RSS 2026)给出一个融合样本:先预测未来视觉状态,再用逆动力学反解出动作——世界模型与控制器在一个自回归序列里合体。

§2 核心原理图解
视觉观测 + 语言指令
多模态输入
VLM 骨干
网页知识迁移到物理世界
世界模型预测
想象未来视觉状态(可选)
动作解码
VLA 直出 / 逆动力学反解
机器人执行
50–150Hz 连续控制
新观测回流,闭环控制
具身路线的两翼:VLA 直接出动作;世界模型先想象未来、再反解动作
§3 代表模型
RT-2
Google DeepMind · 2023
VLM 权重直出机器人动作,VLA 概念确立;网页知识零样本迁移到机械臂。
VLA 开山arXiv:2307.15818
π0.5
Physical Intelligence · 2025
开放世界泛化的标志性演示:进陌生厨房收拾台面。
开放世界泛化arXiv:2504.16054
Cosmos + GR00T
NVIDIA · 2025
世界基础模型平台(预训练 + 后训练管线)+ 人形机器人技能基座。
WFM 平台arXiv:2501.03575
LingBot-VA
蚂蚁灵波 · 2026
自回归扩散:先预测未来视觉,再逆动力学反解动作(RSS 2026)。
150Hz(官方)arXiv:2601.21998
完整档案与筛选见 模型库 →
§4 权威视频
YouTube ▶
NVIDIA Cosmos 世界基础模型入门(GTC 2025)
讲座 · 英语 · 看点:世界基础模型平台如何服务机器人与自动驾驶
✓ 已核验 2026-07-20
本站只展示经核验的视频链接;未核验资源一律不上线。
§5 这条路线的赌注与软肋
赌注 THE BET
真实世界是最终考场:世界模型的终极价值是输出动作。谁先转起「真机数据 → 更好模型 → 更多部署」的飞轮,谁就赢下具身智能。
软肋 THE WEAKNESS
真机数据贵而稀缺,跨本体泛化尚未被独立验证;关键指标(150Hz、成功率)多为厂商口径。机器人摔一跤的成本,远高于视频里的一帧穿模。
下一条路线:路线 5 · 3D 空间智能统一模板:起源 → 原理 → 模型 → 视频 → 赌注与软肋