世界模型WORLD MODELS · 月更
EVIDENCE MATRIX · 不做总排行榜

能力证据矩阵

世界模型的评测互不可比:Dreamer 报 Atari 分数,Genie 报可玩性,π0.5 报真机成功率。把它们加权成一个总分,只会把「谁有硬证据、谁只有演示」这个真正重要的信息抹平。所以这里不排名,只记录证据强度

🟡 不代表做得差,只代表目前没有可核对的公开数字;⚪ 表示该模型没有主张这项能力,不是失分项。

时序一致性
画面/状态在时间上是否连贯,长序列会不会崩坏。
动作可控性
能否按外部动作指令改变后续演化,而不只是被动生成。
物理合理性
碰撞、重力、物体恒存等物理约束是否被遵守。
长程记忆
离开视野的东西再回来时,是否还是原样。
规划与反事实
能否用于推演「如果换个动作会怎样」并据此做决策。
真机迁移
有没有在真实机器人或真实环境上跑通的公开证据。
🟢 有公开数据🟡 有演示无数据 未涉及
路线0 起源
模型时序一致性动作可控性物理合理性长程记忆规划与反事实真机迁移
可微 RNN 世界模型未涉及未涉及未涉及未涉及未涉及未涉及
好奇心机制未涉及未涉及未涉及未涉及未涉及未涉及
路线1 MBRL
模型时序一致性动作可控性物理合理性长程记忆规划与反事实真机迁移
World Models🟢有公开数据🟡有演示无数据未涉及未涉及🟢有公开数据未涉及
PlaNet未涉及未涉及未涉及未涉及未涉及未涉及
DreamerV1未涉及未涉及未涉及未涉及未涉及未涉及
DreamerV2未涉及未涉及未涉及未涉及未涉及未涉及
DreamerV3🟢有公开数据🟡有演示无数据未涉及未涉及🟢有公开数据未涉及
DIAMOND未涉及未涉及未涉及未涉及未涉及未涉及
证据来源 · 6
  • 🟢 World Models · 时序一致性 — 控制器 C 完全在 M 生成的想象序列里训练、全程未接触真实环境,转移到真实环境后 VizDoom 平均存活约 1100 步,说明长程想象没有从一开始就崩坏。arXiv:1803.10122
  • 🟡 World Models · 动作可控性 — M(MDN-RNN)以动作为条件预测下一时刻隐状态,论文对此是架构层面的定性描述,没有单独的可控性量化指标。arXiv:1803.10122
  • 🟢 World Models · 规划与反事实 — 策略完全在 M 生成的想象环境中训练、不接触真实环境,CarRacing 均分 906±21、VizDoom 平均存活约 1100 步,证明想象训练可迁移为真实决策。arXiv:1803.10122
  • 🟢 DreamerV3 · 时序一致性 — 单套超参数在 150+ 个多样任务上稳定训练,其中 Minecraft 采钻石任务连续跑约 3000 万环境步(约 17 天游戏内时长)未发散。arXiv:2301.04104
  • 🟡 DreamerV3 · 动作可控性 — 同一套配置同时适配离散动作(Atari 等)与连续动作控制(DeepMind Control 等),论文对此是架构层面的定性描述,没有单独衡量「动作跟随准确度」一类可控性的量化指标。arXiv:2301.04104
  • 🟢 DreamerV3 · 规划与反事实 — 核心机制是让智能体在世界模型生成的想象场景中学习并改进策略,据此在 150+ 任务上追平或超过各领域专用方法。arXiv:2301.04104
路线2 JEPA
模型时序一致性动作可控性物理合理性长程记忆规划与反事实真机迁移
I-JEPA未涉及未涉及未涉及未涉及未涉及未涉及
V-JEPA未涉及未涉及未涉及未涉及未涉及未涉及
V-JEPA 2🟢有公开数据🟢有公开数据未涉及未涉及🟢有公开数据🟢有公开数据
证据来源 · 4
  • 🟢 V-JEPA 2 · 时序一致性 — 在跨机械臂零样本抓取放置任务中,多步动作规划全程使用同一世界模型的想象序列,任务整体成功率约 65%–80%,说明想象没有在任务时程内明显发散。arXiv:2506.09985
  • 🟢 V-JEPA 2 · 动作可控性 — V-JEPA 2-AC 用动作条件建模,在表征空间里对不同候选动作序列的后果做预测并据此选择动作;在两个实验室从未训练过的 Franka 机械臂上零样本部署,不同目标/物体对应的 pick-and-place 成功率约 65%–80%,说明模型确实按不同目标选出了不同且大多正确的动作序列。arXiv:2506.09985
  • 🟢 V-JEPA 2 · 规划与反事实 — 给定目标图像,模型在表征空间里对候选动作序列做「脑内试错」并挑选最接近目标的一条执行;这套机制在两个实验室的零样本抓取放置任务上取得约 65%–80% 的成功率,单步规划耗时约 16 秒(比 Cosmos 基线快一个数量级)。arXiv:2506.09985
  • 🟢 V-JEPA 2 · 真机迁移 — 在两个实验室此前未训练过的 Franka 机械臂上零样本部署,pick-and-place 成功率约 65%–80%(因物体而异)。arXiv:2506.09985
路线3 视频模拟器
模型时序一致性动作可控性物理合理性长程记忆规划与反事实真机迁移
Sora🟡有演示无数据未涉及🟡有演示无数据未涉及未涉及未涉及
Genie 1未涉及未涉及未涉及未涉及未涉及未涉及
GameNGen未涉及未涉及未涉及未涉及未涉及未涉及
Oasis未涉及未涉及未涉及未涉及未涉及未涉及
Genie 3🟡有演示无数据🟡有演示无数据未涉及🟡有演示无数据未涉及未涉及
Hunyuan-GameCraft未涉及未涉及未涉及未涉及未涉及未涉及
Kling 可灵未涉及未涉及未涉及未涉及未涉及未涉及
万相 Wan2.2未涉及未涉及未涉及未涉及未涉及未涉及
万相 Wan3.0未涉及未涉及未涉及未涉及未涉及未涉及
Seedance 2.0未涉及未涉及未涉及未涉及未涉及未涉及
LingBot-World未涉及未涉及未涉及未涉及未涉及未涉及
LingBot-World 2🟡有演示无数据🟡有演示无数据🟡有演示无数据🟡有演示无数据未涉及未涉及
证据来源 · 9
  • 🟡 Sora · 时序一致性 — 官方技术报告展示长达 1 分钟、镜头运动与光照保持较高一致性的精选视频,但无第三方可复现的定量连贯性指标。官方口径
  • 🟡 Sora · 物理合理性 — OpenAI 官方承认「模拟复杂物理的能力有限,理解因果关系和分辨左右的能力也有限」;另有研究(arXiv:2411.02385,测试的是自建的同类扩散视频模型而非 Sora 本身)发现规模扩大不足以让此类模型学到可泛化的物理规律。官方口径
  • 🟡 Genie 3 · 时序一致性 — 官方称环境一致性可维持数分钟;至今没有发表技术论文,24fps/720p 为 2025-08 研究预览版规格,非独立可复现的测量结果。官方口径(Google DeepMind 博客)
  • 🟡 Genie 3 · 动作可控性 — 支持用文字指令实时向场景「注入」事件(如天气变化、角色出现),为官方演示描述,无量化可控性指标。官方口径(Google DeepMind 博客)
  • 🟡 Genie 3 · 长程记忆 — 官方称视觉记忆可回溯约 1 分钟前的画面(转身再回头场景大概率还在),该规格适用于 2025-08 研究预览版,2026-01 后的开放版本未见重新公布。官方口径(Google DeepMind 博客)
  • 🟡 LingBot-World 2 · 时序一致性 — 论文摘要称因果预训练配合 MoBA 注意力可支持『unbounded interaction horizon』的小时级持续生成,但 60fps 衡量的是吞吐而非时序一致性本身,论文未给出独立的场景一致性量化指标。arXiv:2607.07534
  • 🟡 LingBot-World 2 · 动作可控性 — 论文摘要描述 pilot agent 负责规划角色行为、director agent 负责合成新环境元素,并支持多名玩家同时进入同一世界互动,但这是架构层面的定性描述,没有单独的可控性量化指标。arXiv:2607.07534
  • 🟡 LingBot-World 2 · 物理合理性 — 第三方实测认为可玩性与物理表现令人印象深刻,但为主观定性评价,没有公开的物理合规性/碰撞基准数字。第三方实测(爱范儿 ifanr.com/1671406)
  • 🟡 LingBot-World 2 · 长程记忆 — 官方展示多人同时进入同一持续生成的世界互动,但第三方实测记录了转身返回后出现此前不存在的墙这一空间不一致问题(官方称为体验版工程限制),暂无量化场景一致性数字。arXiv:2607.07534;第三方实测(爱范儿 ifanr.com/1671406)
路线4 具身/VLA
模型时序一致性动作可控性物理合理性长程记忆规划与反事实真机迁移
RT-1未涉及未涉及未涉及未涉及未涉及未涉及
RT-2未涉及未涉及未涉及未涉及未涉及未涉及
OpenVLA未涉及未涉及未涉及未涉及未涉及未涉及
π0未涉及未涉及未涉及未涉及未涉及未涉及
π0.5🟢有公开数据🟢有公开数据未涉及未涉及🟡有演示无数据🟢有公开数据
Cosmos未涉及未涉及未涉及未涉及未涉及未涉及
GR00T N1未涉及未涉及未涉及未涉及未涉及未涉及
1X World Model未涉及未涉及未涉及未涉及未涉及未涉及
GAIA-1未涉及未涉及未涉及未涉及未涉及未涉及
GAIA-2未涉及未涉及未涉及未涉及未涉及未涉及
GR-3未涉及未涉及未涉及未涉及未涉及未涉及
LingBot-VA未涉及未涉及未涉及未涉及未涉及未涉及
LingBot-VLA 2未涉及未涉及未涉及未涉及未涉及未涉及
证据来源 · 4
  • 🟢 π0.5 · 时序一致性 — 在从未见过的新家庭/卧室里执行 10–15 分钟的长程多阶段收拾任务(任务类型据论文),未见执行中期明显退化的报告。arXiv:2504.16054
  • 🟢 π0.5 · 动作可控性 — flow-matching 动作专家依据语言指令与视觉观测,在 17 维动作空间(双臂+全向移动底座、14 维状态)连续输出不同动作序列。arXiv:2504.16054
  • 🟡 π0.5 · 规划与反事实 — 官方博客消融实验称,去掉高层子任务预测(语义层规划)后开放世界成功率从约 94% 降到约 31%;具体百分比来自官网博客转述,未在 arXiv 论文正文逐一核对到对应表格。官方口径(Physical Intelligence 官网博客 pi05)
  • 🟢 π0.5 · 真机迁移 — 双臂 ARX 机械臂+全向移动底座,在训练时从未见过的新家庭/卧室完成打扫、整理等真机任务;官方口径整体成功率约 94%。arXiv:2504.16054
路线5 空间智能
模型时序一致性动作可控性物理合理性长程记忆规划与反事实真机迁移
NeRF未涉及未涉及未涉及未涉及未涉及未涉及
3DGS未涉及未涉及未涉及未涉及未涉及未涉及
Marble未涉及未涉及🟡有演示无数据🟡有演示无数据未涉及未涉及
HunyuanWorld未涉及未涉及未涉及未涉及未涉及未涉及
证据来源 · 2
  • 🟡 Marble · 物理合理性 — 官方称同一模型同时输出高斯泼溅与「可供物理引擎运算」的碰撞网格,但官方自己也承认 AI 生成几何有时会自相交或比例失真,导致「不合理的物理」,无公开的物理准确度基准数字。官方口径(World Labs 博客)
  • 🟡 Marble · 长程记忆 — 官方演示可从不同角度绕回同一位置,看到的仍是同一批物体、同样的位置,即「持久性」,但没有量化的场景保真度指标。官方口径(World Labs 博客)
每个非 ⚪ 的格子都必须带来源;未填写的格子按 ⚪ 渲染,不构成对该模型的负面陈述。术语表 →最后更新 2026-08