世界模型WORLD MODELS · 月更
MODEL LIBRARY · 分层而不混排

模型库

前沿基础模型回答「当下谁能完成复杂工作」,世界模型回答「系统如何预测环境与行动后果」。两类模型使用不同评价坐标,不做一张失真的总排行榜。

LIBRARY A · LONG HORIZON
世界模型 · 40 个 ↓
MBRL、JEPA、视频模拟器、具身/VLA、空间智能
LIBRARY B · CONTROL GROUP
对照组 · 7 个 →
GPT-5.6 Sol、Claude Fable 5、Claude Opus 5、Kimi K3、GLM-5.3、DeepSeek-V4-Pro、Qwen3.8-2.4T-A95B
路线
40 个世界模型
可微 RNN 世界模型
1990
慕尼黑工大 / IDSIA · 路线0 起源
「世界模型」术语进入机器学习:RNN 预测未来感官输入。
M+C 范式FKI-126-90
好奇心机制
1991
慕尼黑工大 / IDSIA · 路线0 起源
预测误差即内在奖励,智能体主动探索。
内在动机开山IJCNN 1991
World Models
2018-03
Google Brain · 路线1 MBRL
VAE + MDN-RNN + 梦境训练,让「世界模型」重回聚光灯。
CarRacing 906 分arXiv:1803.10122开源详情 →
PlaNet
2018-11
Google DeepMind · 路线1 MBRL
RSSM 循环状态空间模型,纯隐空间规划。
RSSM 开山arXiv:1811.04551开源
DreamerV1
2019-12
Google DeepMind · 路线1 MBRL
《Dream to Control》:把梦境训练做成通用配方。
梦境策略学习arXiv:1912.01603开源
DreamerV2
2020-10
Google DeepMind · 路线1 MBRL
离散隐变量,首个 Atari 达人类水平的世界模型内智能体。
Atari 人类水平arXiv:2010.02193开源
DreamerV3
2023-01
Google DeepMind · 路线1 MBRL
单套超参跨 150+ 任务,Nature 2025,从零采到钻石。
150+ 任务单套超参arXiv:2301.04104开源详情 →
DIAMOND
2024-05
日内瓦大学 / 爱丁堡大学 · 路线1 MBRL
用扩散模型做世界建模的 RL 智能体。
Atari 100k SOTAarXiv:2405.12399开源
I-JEPA
2023-01
Meta AI(FAIR) · 路线2 JEPA
图像隐空间预测的第一个 JEPA 实例。
隐空间预测arXiv:2301.08243开源
V-JEPA
2024-04
Meta AI(FAIR) · 路线2 JEPA
JEPA 扩展到视频:时序遮挡学运动表征。
视频表征arXiv:2404.08471开源
V-JEPA 2
2025-06
Meta AI(FAIR) · 路线2 JEPA
2-AC 版用 62 小时机器人视频后训练,零样本控制。
62 小时视频后训练arXiv:2506.09985开源详情 →
Sora
2024-02
OpenAI · 路线3 视频模拟器
「世界模拟器」争议起点,分钟级视频生成。
最长 1 分钟视频官方口径详情 →
Genie 1
2024-02
Google DeepMind · 路线3 视频模拟器
从无标注视频无监督学出潜在动作与可玩 2D 世界。
潜在动作模型arXiv:2402.15391
GameNGen
2024-08
Google DeepMind · 路线3 视频模拟器
扩散模型 20fps 实时跑 DOOM。
20fps DOOMarXiv:2408.14837
Oasis
2024-10
Decart / Etched · 路线3 视频模拟器
首个公开可玩的 AI 生成游戏(Minecraft 风)。
公开可玩官方口径开源
Genie 3
2025-08
Google DeepMind · 路线3 视频模拟器
无标注视频学出可交互世界,文本事件注入。
720p / 24fps 实时官方口径详情 →
Hunyuan-GameCraft
2025-06
腾讯混元 · 路线3 视频模拟器
面向游戏场景的可交互视频生成。
游戏场景arXiv:2506.17201开源
Kling 可灵
2024
快手可灵 · 路线3 视频模拟器
国内视频生成代表,向世界模型方向演进。
视频生成官方口径
万相 Wan2.2
2025-07
阿里通义 · 路线3 视频模拟器
首个 MoE 架构的开源视频生成模型,也是 LingBot-World 的底座。
首个 MoE 开源视频模型官方口径开源
万相 Wan3.0
2026-08
阿里通义 · 路线3 视频模拟器
单次 30 秒生成、支持文档输入;能力上去了,权重不再开放。
单次 30 秒官方口径
Seedance 2.0
2026-02
字节跳动 Seed · 路线3 视频模拟器
论文标题写着「面向世界复杂性」,摘要里没有一句世界建模。
480p/720p · 4–15 秒arXiv:2604.14148
LingBot-World
2026-01
蚂蚁灵波 · 路线3 视频模拟器
基于 Wan2.2 的开源世界模拟器:16fps、<1s 延迟、近 10 分钟稳定生成。
16fps 实时arXiv:2601.20540开源
LingBot-World 2
2026-07
蚂蚁灵波 · 路线3 视频模拟器
因果预训练 + MoBA,开源对标 Genie 3,主打帧率与时长。
720p / 60fps 实时流arXiv:2607.07534开源详情 →
RT-1
2022-12
Google DeepMind · 路线4 具身/VLA
离散动作 Transformer 策略,真机大规模数据先行者。
13 万轨迹arXiv:2212.06817
RT-2
2023-07
Google DeepMind · 路线4 具身/VLA
VLM 权重直出机器人动作,VLA 概念确立。
VLA 开山arXiv:2307.15818
OpenVLA
2024-06
斯坦福大学 · 路线4 具身/VLA
7B 开源 VLA,社区微调生态起点。
7B 开源arXiv:2406.09246开源
π0
2024-10
Physical Intelligence · 路线4 具身/VLA
流匹配动作专家,50Hz 连续控制。
50Hz 控制arXiv:2410.24164开源
π0.5
2025-04
Physical Intelligence · 路线4 具身/VLA
开放世界泛化:陌生厨房里收拾台面。
新环境成功率 94%官方口径开源详情 →
Cosmos
2025-01
NVIDIA · 路线4 具身/VLA
世界基础模型平台:预训练 + 后训练管线。
WFM 平台arXiv:2501.03575开源
GR00T N1
2025-03
NVIDIA · 路线4 具身/VLA
人形机器人推理与技能基础模型。
人形基座arXiv:2503.14734开源
1X World Model
2024
1X Technologies · 路线4 具身/VLA
为全身人形预测接触密集未来:评估比特而非原子。
策略评估官方口径
GAIA-1
2023-09
Wayve · 路线4 具身/VLA
9B 自动驾驶生成式世界模型:视频+文本+动作。
9B 驾驶场景arXiv:2309.17080
GAIA-2
2025-03
Wayve · 路线4 具身/VLA
多视角潜在扩散,结构化条件控制。
多相机一致arXiv:2503.20523
GR-3
2025-07
字节跳动 Seed · 路线4 具身/VLA
字节自研 VLA,配双臂移动机器人 ByteMini,论文称在多项任务上超过 π0。
多任务超过 π0arXiv:2507.15493
LingBot-VA
2026-01
蚂蚁灵波 · 路线4 具身/VLA
视频预测 + 逆动力学出动作(RSS 2026)。
150Hz(官方)arXiv:2601.21998开源
LingBot-VLA 2
2026-07
蚂蚁灵波 · 路线4 具身/VLA
6 万小时预训练、20 种构型:「一脑多机」。
<130ms 延迟(官方)官方口径开源
NeRF
2020-03
加州大学伯克利分校 · 路线5 空间智能
神经辐射场:3D 表征革命的起点。
3D 表征革命arXiv:2003.08934开源
3DGS
2023-08
Inria 等 · 路线5 空间智能
高斯泼溅:实时渲染的显式 3D 表征。
实时渲染arXiv:2308.04079开源
Marble
2025-11
World Labs · 路线5 空间智能
文本/图像生成可探索持久 3D 世界,双表征输出。
高斯泼溅 + 碰撞网格官方口径详情 →
HunyuanWorld
2025-07
腾讯混元 · 路线5 空间智能
视频渲染 + 3D 模拟融合的世界生成。
双表征arXiv:2507.21809开源
对照组 · 通用大模型

它们不是世界模型

列在这里是为了回答一个每月都要重问的问题:通用大模型离世界模型更近了吗?每一条都标注了「距离世界模型还缺什么」。反过来的那一问——前沿侧递了什么过来——在 交叉地带

GPT-5.6 Sol
2026-07-09
OpenAI · 闭源 API
把高难度知识工作、编程、科学研究和多智能体协作放进同一个通用模型家族。
复杂推理长程知识工作编程与工具多智能体
距离世界模型还缺
擅长数字任务,但没有公开证据表明它维护可用于物理规划的显式环境状态。
它递了什么给世界模型
递归自我改进🟢 有实测数据
方向和直觉相反:不是 RSI 顺带产生世界模型,而是世界模型是 RSI 走出数字域的前置条件——因为物理世界没有便宜的验证器。
Claude Fable 5
2026-06-09
Anthropic · 闭源 API
把更长时间的自主工作、视觉操作、持续记忆和高难度知识任务推到新的能力层级。
长程自主工作视觉持久记忆复杂工具链
距离世界模型还缺
能在软件与游戏环境中行动,不等于学到了稳定、可迁移的物理世界动力学。
它递了什么给世界模型
物理版 MCP:Model Hardware Standard🔵 有论证,无实验
它一行动力学预测能力都不提供,但它降低的恰恰是能力矩阵「真实世界」那一列最贵的东西——把模型接到真机上的成本。
Claude Opus 5
2026-07-24
Anthropic · 闭源 API
以更低成本接近 Fable 级能力,强调稳定执行、计算机使用和日常专业工作。
软件工程知识工作Computer Use成本效率
距离世界模型还缺
Computer Use 依赖界面观察与反馈闭环,仍不同于可反事实推演的世界模拟器。
它递了什么给世界模型
物理版 MCP:Model Hardware Standard🔵 有论证,无实验
它一行动力学预测能力都不提供,但它降低的恰恰是能力矩阵「真实世界」那一列最贵的东西——把模型接到真机上的成本。
Kimi K3
2026-07-16
月之暗面 · 开放权重
2.8T MoE、原生视觉与百万 token 上下文,把开放模型推进到长程 Agent 与专业工作的前沿。
原生多模态百万上下文长程 Agent开放部署
距离世界模型还缺
可构建游戏和 3D 内容主要体现多模态理解与代码执行,不能直接等同于内生世界模型。
GLM-5.3
2026-08-14
智谱 AI · 闭源 API
在同一基座上扩展长程任务环境与强化学习后训练,重点提升编程、Agent 与安全能力。
长程编程Agent 环境后训练扩展计划开放
距离世界模型还缺
训练环境更丰富会提升行动能力,但它仍主要面向数字任务,不是物理环境预测模型。
DeepSeek-V4-Pro
2026-08-13
深度求索 · 开放权重
1.7 万亿参数、MIT 协议开放权重,是开放阵营里许可最宽松的旗舰。
MIT 许可万亿级 MoE编程与工具开放部署
距离世界模型还缺
许可宽松解决的是「谁能用」,不是「模型懂不懂物理」——它没有任何面向环境动力学预测的公开证据。
Qwen3.8-2.4T-A95B
2026-08
阿里通义 · 开放权重
Qwen 首次把 Max 级模型直接开放:2.4T 总参数、95B 激活、百万级上下文。
万亿级 MoE百万上下文开放权重自定义许可
距离世界模型还缺
同一家公司的视频线(万相 Wan)才是靠近世界模型的那条;这条语言线的能力增长仍集中在文本与代码上。
指标来源性质:论文实测标 arXiv 号;厂商宣称标「官方口径」。术语表 →最后更新 2026-08