世界模型WORLD MODELS
路线 1 · MBRL

在自己的梦境里 训练一个智能体

2018 — 至今代表:World Models · PlaNet · Dreamer V1–V4 · DIAMOND
§1 起源故事

2018 年,Google Brain 的 David Ha 与 Schmidhuber 合写了一篇论文,标题就叫《World Models》(arXiv:1803.10122)。方案是一个优雅的三件套:V-M-C——用 VAE(V)把游戏画面压缩成低维隐向量 z,用带混合密度网络的 RNN(M)预测下一个 z 的分布,再让一个小得惊人的控制器(C)在隐空间里做决策。真正的创举是:智能体可以完全在模型自己的「梦境」里训练,再把学到的策略搬回真实环境。配套的交互式论文网页 worldmodels.github.io 能在浏览器里直接玩,让这个 1990 年的老词一夜之间重回聚光灯下。

接棒的是 DeepMind 的 Danijar Hafner:PlaNet(2019)引入 RSSM 循环状态空间模型,DreamerV1《Dream to Control》(2019)把「梦境训练」做成通用配方,DreamerV2(2020)改用离散隐变量、成为首个在 Atari 上达到人类水平的世界模型内训练智能体。到 DreamerV3(arXiv:2301.04104),一套超参数跑遍 150+ 任务,并在无人类数据、无课程设计的前提下从零在 Minecraft 里采到钻石——2025 年 4 月正式登上 Nature。2024 年的 DIAMOND(arXiv:2405.12399)则用扩散模型替代离散隐变量做世界建模,Atari 100k 拿下 1.46 的人类归一化分。这是六条路线里最有耐心、证据链最扎实的一条。

§2 核心原理图解
像素帧
游戏画面
VAE 编码 (V)
压缩成隐向量 z
RNN 预测 (M)
预测下一个 z 的分布
梦境 rollout
在隐空间里想象未来
控制器 (C)
在梦境中学策略
真实环境
策略迁移回现实
V-M-C 三件套(Ha & Schmidhuber 2018):压缩 → 预测 → 在想象中学习
§3 代表模型
World Models
Google Brain · 2018
VAE + MDN-RNN + 极小控制器,「在梦境中训练」的首个完整实证。
梦境训练首证arXiv:1803.10122
PlaNet
DeepMind · 2019
引入 RSSM 循环状态空间模型,纯隐空间规划完成像素级控制任务。
RSSM 开山arXiv:1811.04551
DreamerV3
DeepMind · 2023–25
单套超参跨 150+ 任务;无人类数据从零采到 Minecraft 钻石,登上 Nature(2025)。
Nature 2025arXiv:2301.04104
DIAMOND
日内瓦/爱丁堡 · 2024
用扩散模型做世界建模的 RL 智能体,Atari 100k 人类归一化分 1.46。
Atari 100k SOTAarXiv:2405.12399
完整档案与筛选见 模型库 →
§4 权威视频
YouTube ▶
David Ha:World Models(NeurIPS 2018 口头报告)
13 分钟 · 英语 · 看点:第一作者亲述 VAE + MDN-RNN + 梦境训练
✓ 已核验 2026-07-19
延伸:交互式论文网页 worldmodels.github.io(可在浏览器里直接玩,本站的精神参照)
本站只展示经核验的视频链接;未核验资源一律不上线。
§5 这条路线的赌注与软肋
赌注 THE BET
在隐空间的想象里训练,比在真实环境里试错的样本效率高几个量级——世界模型的价值在于规划,不在于画面好看。
软肋 THE WEAKNESS
紧凑隐空间的容量有限,难以扩到开放世界的视觉复杂度;当视频生成路线用海量数据轰出惊艳演示时,这条路线的成果显得「朴素」。DreamerV4 转向离线设定,正是对规模问题的回应。
下一条路线:路线 2 · LeCun 的反主流赌注统一模板:起源 → 原理 → 模型 → 视频 → 赌注与软肋