世界模型WORLD MODELS · 月更
路线 4 · EMBODIED

把世界模型接到双手: 输出的不是像素,是动作

2022 — 至今代表:RT-1/2 · OpenVLA · π0 系 · Cosmos + GR00T · GAIA · LingBot-VA
§1 起源故事

这条路线的判据只有一个:模型最终输出动作。2023 年 Google 的 RT-2(arXiv:2307.15818)证明了一件事:把网页上学来的知识直接迁移到机械臂上——视觉-语言模型的权重可以「直出」机器人动作,VLA(视觉-语言-动作)的概念就此确立。随后 OpenVLA(7B,开源)点燃社区微调生态,Physical Intelligence 的 π0 用流匹配动作专家做到 50Hz 连续控制,π0.5 在陌生厨房里收拾台面——开放世界泛化第一次看起来不再遥远。

另一翼是「世界基础模型」:NVIDIA 在 CES 2025 发布 Cosmos,把「预训练世界模型 + 后训练到具体机器人」做成平台,与 GR00T 人形机器人栈配套;Wayve 的 GAIA 系列面向自动驾驶生成驾驶场景;1X 给人形机器人做了「预测接触密集未来」的世界模型,用来评估比特而非原子——先在模型里筛掉坏策略,省下真机试验。蚂蚁灵波的 LingBot-VA(RSS 2026)给出一个融合样本:先预测未来视觉状态,再用逆动力学反解出动作——世界模型与控制器在一个自回归序列里合体。

§2 核心原理图解
视觉观测 + 语言指令
多模态输入
VLM 骨干
网页知识迁移到物理世界
世界模型预测
想象未来视觉状态(可选)
动作解码
VLA 直出 / 逆动力学反解
机器人执行
50–150Hz 连续控制
新观测回流,闭环控制
具身路线的两翼:VLA 直接出动作;世界模型先想象未来、再反解动作
§3 代表模型
RT-1
Google DeepMind · 2022-12
离散动作 Transformer 策略,真机大规模数据先行者。
13 万轨迹arXiv:2212.06817
RT-2
Google DeepMind · 2023-07
VLM 权重直出机器人动作,VLA 概念确立。
VLA 开山arXiv:2307.15818
OpenVLA
斯坦福大学 · 2024-06
7B 开源 VLA,社区微调生态起点。
7B 开源arXiv:2406.09246
π0
Physical Intelligence · 2024-10
流匹配动作专家,50Hz 连续控制。
50Hz 控制arXiv:2410.24164
π0.5
Physical Intelligence · 2025-04
开放世界泛化:陌生厨房里收拾台面。
新环境成功率 94%官方口径
Cosmos
NVIDIA · 2025-01
世界基础模型平台:预训练 + 后训练管线。
WFM 平台arXiv:2501.03575
GR00T N1
NVIDIA · 2025-03
人形机器人推理与技能基础模型。
人形基座arXiv:2503.14734
1X World Model
1X Technologies · 2024
为全身人形预测接触密集未来:评估比特而非原子。
策略评估官方口径
GAIA-1
Wayve · 2023-09
9B 自动驾驶生成式世界模型:视频+文本+动作。
9B 驾驶场景arXiv:2309.17080
GAIA-2
Wayve · 2025-03
多视角潜在扩散,结构化条件控制。
多相机一致arXiv:2503.20523
GR-3
字节跳动 Seed · 2025-07
字节自研 VLA,配双臂移动机器人 ByteMini,论文称在多项任务上超过 π0。
多任务超过 π0arXiv:2507.15493
LingBot-VA
蚂蚁灵波 · 2026-01
视频预测 + 逆动力学出动作(RSS 2026)。
150Hz(官方)arXiv:2601.21998
LingBot-VLA 2
蚂蚁灵波 · 2026-07
6 万小时预训练、20 种构型:「一脑多机」。
<130ms 延迟(官方)官方口径
完整档案与筛选见 模型库 →
§4 权威视频
YouTube ▶
NVIDIA Cosmos 世界基础模型入门(GTC 2025)
讲座 · 英语 · 看点:世界基础模型平台如何服务机器人与自动驾驶
✓ 已核验 2026-07-20
本站只展示经核验的视频链接;未核验资源一律不上线。
这条路线的术语
世界模型视觉-语言-动作模型模仿学习动作分块逆动力学真机泛化遥操作数据仿真到现实迁移递归自我改进验证器模型硬件标准
§5 来自前沿侧的影响

通用大模型那一侧发生的事,有一部分会传导到这条路线上。每条都标了关联强度—— 大多数目前还停在论证层面。

方法🟢 有实测数据
递归自我改进
方向和直觉相反:不是 RSI 顺带产生世界模型,而是世界模型是 RSI 走出数字域的前置条件——因为物理世界没有便宜的验证器。
接口🔵 有论证,无实验
物理版 MCP:Model Hardware Standard
它一行动力学预测能力都不提供,但它降低的恰恰是能力矩阵「真实世界」那一列最贵的东西——把模型接到真机上的成本。
§6 这条路线的赌注与软肋
赌注 THE BET
真实世界是最终考场:世界模型的终极价值是输出动作。谁先转起「真机数据 → 更好模型 → 更多部署」的飞轮,谁就赢下具身智能。
软肋 THE WEAKNESS
真机数据贵而稀缺,跨本体泛化尚未被独立验证;关键指标(150Hz、成功率)多为厂商口径。机器人摔一跤的成本,远高于视频里的一帧穿模。
下一条路线:路线 5 · 3D 空间智能术语表 →统一模板:起源 → 原理 → 模型 → 视频 → 赌注与软肋