2018 年,Google Brain 的 David Ha 与 Schmidhuber 合写了一篇论文,标题就叫《World Models》(arXiv:1803.10122)。方案是一个优雅的三件套:V-M-C——用 VAE(V)把游戏画面压缩成低维隐向量 z,用带混合密度网络的 RNN(M)预测下一个 z 的分布,再让一个小得惊人的控制器(C)在隐空间里做决策。真正的创举是:智能体可以完全在模型自己的「梦境」里训练,再把学到的策略搬回真实环境。配套的交互式论文网页 worldmodels.github.io 能在浏览器里直接玩,让这个 1990 年的老词一夜之间重回聚光灯下。
接棒的是 DeepMind 的 Danijar Hafner:PlaNet(2019)引入 RSSM 循环状态空间模型,DreamerV1《Dream to Control》(2019)把「梦境训练」做成通用配方,DreamerV2(2020)改用离散隐变量、成为首个在 Atari 上达到人类水平的世界模型内训练智能体。到 DreamerV3(arXiv:2301.04104),一套超参数跑遍 150+ 任务,并在无人类数据、无课程设计的前提下从零在 Minecraft 里采到钻石——2025 年 4 月正式登上 Nature。2024 年的 DIAMOND(arXiv:2405.12399)则用扩散模型替代离散隐变量做世界建模,Atari 100k 拿下 1.46 的人类归一化分。这是六条路线里最有耐心、证据链最扎实的一条。