慕尼黑工大 · 路线0
「世界模型」术语进入机器学习:RNN 预测未来感官输入。
M+C 范式FKI-126-90
Schmidhuber · 路线0
预测误差即内在奖励,智能体主动探索。
内在动机开山IJCNN 1991
Google Brain · 路线1
VAE + MDN-RNN + 梦境训练,让「世界模型」重回聚光灯。
梦境训练首证arXiv:1803.10122开源
DeepMind · 路线1
RSSM 循环状态空间模型,纯隐空间规划。
RSSM 开山arXiv:1811.04551开源
DeepMind · 路线1
《Dream to Control》:把梦境训练做成通用配方。
梦境策略学习arXiv:1912.01603开源
DeepMind · 路线1
离散隐变量,首个 Atari 达人类水平的世界模型内智能体。
Atari 人类水平arXiv:2010.02193开源
DeepMind · 路线1
单套超参跨 150+ 任务,Nature 2025,从零采到钻石。
Nature 2025arXiv:2301.04104开源
日内瓦/爱丁堡 · 路线1
用扩散模型做世界建模的 RL 智能体。
Atari 100k SOTAarXiv:2405.12399开源
Meta AI · 路线2
图像隐空间预测的第一个 JEPA 实例。
隐空间预测arXiv:2301.08243开源
Meta AI · 路线2
JEPA 扩展到视频:时序遮挡学运动表征。
视频表征arXiv:2404.08471开源
Meta AI · 路线2
2-AC 版用 62 小时机器人视频后训练,零样本控制。
零样本控制arXiv:2506.09985开源
OpenAI · 路线3
「世界模拟器」争议起点,分钟级视频生成。
分钟级视频官方口径
DeepMind · 路线3
从无标注视频无监督学出潜在动作与可玩 2D 世界。
潜在动作模型arXiv:2402.15391
Google · 路线3
扩散模型 20fps 实时跑 DOOM。
20fps DOOMarXiv:2408.14837
Decart/Etched · 路线3
首个公开可玩的 AI 生成游戏(Minecraft 风)。
公开可玩官方口径开源
DeepMind · 路线3
无标注视频学出可交互世界,文本事件注入。
720p/24fps官方口径
腾讯 · 路线3
面向游戏场景的可交互视频生成。
游戏场景arXiv:2506.17201开源
快手 · 路线3
国内视频生成代表,向世界模型方向演进。
视频生成官方口径
蚂蚁灵波 · 路线3
基于 Wan2.2 的开源世界模拟器:16fps、<1s 延迟、近 10 分钟稳定生成。
16fps 实时arXiv:2601.20540开源
蚂蚁灵波 · 路线3
因果预训练 + MoBA,开源对标 Genie 3,主打帧率与时长。
720p/60fps官方口径开源
Google · 路线4
离散动作 Transformer 策略,真机大规模数据先行者。
13 万轨迹arXiv:2212.06817
Google DeepMind · 路线4
VLM 权重直出机器人动作,VLA 概念确立。
VLA 开山arXiv:2307.15818
Stanford 等 · 路线4
7B 开源 VLA,社区微调生态起点。
7B 开源arXiv:2406.09246开源
Physical Intelligence · 路线4
流匹配动作专家,50Hz 连续控制。
50Hz 控制arXiv:2410.24164开源
Physical Intelligence · 路线4
开放世界泛化:陌生厨房里收拾台面。
开放世界泛化arXiv:2504.16054开源
NVIDIA · 路线4
世界基础模型平台:预训练 + 后训练管线。
WFM 平台arXiv:2501.03575开源
NVIDIA · 路线4
人形机器人推理与技能基础模型。
人形基座arXiv:2503.14734开源
1X · 路线4
为全身人形预测接触密集未来:评估比特而非原子。
策略评估官方口径
Wayve · 路线4
9B 自动驾驶生成式世界模型:视频+文本+动作。
9B 驾驶场景arXiv:2309.17080
Wayve · 路线4
多视角潜在扩散,结构化条件控制。
多相机一致arXiv:2503.20523
蚂蚁灵波 · 路线4
视频预测 + 逆动力学出动作(RSS 2026)。
150Hz(官方)arXiv:2601.21998开源
蚂蚁灵波 · 路线4
6 万小时预训练、20 种构型:「一脑多机」。
<130ms 延迟(官方)官方口径开源
UC Berkeley 等 · 路线5
神经辐射场:3D 表征革命的起点。
3D 表征革命arXiv:2003.08934开源
Inria 等 · 路线5
高斯泼溅:实时渲染的显式 3D 表征。
实时渲染arXiv:2308.04079开源
World Labs · 路线5
文本/图像生成可探索持久 3D 世界,双表征输出。
持久 3D 世界官方口径
腾讯 · 路线5
视频渲染 + 3D 模拟融合的世界生成。
双表征arXiv:2507.21809开源