世界模型WORLD MODELS · 月更
路线1 MBRL · MODEL

World Models

Google Brain2018-03开放权重

第一次证明智能体可以只在「想象出来的环境」里学会本领,然后把策略搬回现实。

VAE + MDN-RNN + 梦境训练,让「世界模型」重回聚光灯。

它解决了什么问题

2018 年之前,强化学习智能体想学会一件事,就得在真实环境里反复试错几百万次。对游戏来说这只是费电,对机器人来说这意味着摔坏几百台设备。让智能体在脑子里练,是个显而易见的想法,但一直没人做出有说服力的证明。

怎么做的

他们把系统拆成三块,各司其职。第一块叫 V,是个变分自编码器——把每一帧画面压缩成一个几十维的向量,扔掉像素细节,只留下「场景里有什么」。

第二块叫 M,是个循环神经网络,配上混合密度输出。它接过 V 压缩出来的向量,学着预测下一时刻会变成什么样。因为世界本来就不是确定的,M 输出的不是一个答案,而是一个概率分布。

第三块叫 C,控制器,小到只有几百个参数。它不看原始画面,只看 V 和 M 给的内部表征,然后决定动作。

最关键的一步在这里:训练 C 的时候,根本不需要真实环境。M 已经学会了「世界会怎么变」,那就让 C 在 M 生成的梦境里练。练好了再放回真实环境——成绩依然成立。在开车游戏 CarRacing 里,这套「在梦里练出来」的策略拿到了 906 分(100 次试验均值),超过了当时公开排行榜的最好成绩;在射击游戏 VizDoom 的躲避关卡里,它能在真实环境里撑过约 1100 个时间步,远超过关所需的 750 步。

关键数字 · 来源可溯
CarRacing-v0906 ± 21 分(100 次随机试验均值),环境定义的「解决」阈值是连续 100 次试验均分 900 分arXiv:1803.10122
VizDoom(DoomTakeCover)真实环境中平均存活约 1100 个时间步,超过 750 步的通关线;此前 OpenAI Gym 排行榜最好成绩为 820 ± 58 步arXiv:1803.10122
能力证据 · 记录证据强度,不是能力强弱
时序一致性有公开数据
控制器 C 完全在 M 生成的想象序列里训练、全程未接触真实环境,转移到真实环境后 VizDoom 平均存活约 1100 步,说明长程想象没有从一开始就崩坏。
arXiv:1803.10122
动作可控性有演示无数据
M(MDN-RNN)以动作为条件预测下一时刻隐状态,论文对此是架构层面的定性描述,没有单独的可控性量化指标。
arXiv:1803.10122
物理合理性未涉及
长程记忆未涉及
规划与反事实有公开数据
策略完全在 M 生成的想象环境中训练、不接触真实环境,CarRacing 均分 906±21、VizDoom 平均存活约 1100 步,证明想象训练可迁移为真实决策。
arXiv:1803.10122
真机迁移未涉及
争议与软肋

这篇论文让「世界模型」一词重回主流,但也直接触发了优先权之争。Schmidhuber 是本文的第二作者,而他 1990 年的《Making the world differentiable》早就提出了预测器 M + 控制器 C 的范式。他此后多次公开强调这一点,认为后来涌现的大量「世界模型」工作都应该引用 1990 年那篇,2018 年这篇论文本质上是把 1990 到 2015 年间他自己一系列工作的思路,用现代深度学习工具重新实现了一遍。

另一方的看法是:想法早就有了,但真正让它跑起来、并且让整个领域相信它可行的,是 2018 年这次工程实现——尤其是那个能在浏览器里直接玩的交互式论文网页,让「在梦里训练、拿到现实里能用」第一次变得可感可信。这场争论没有共识,但它本身就是理解这个领域的一把钥匙:很多「重回聚光灯」的突破,底子里都能挖到更早的雏形。

原始材料
论文
它在谱系里的位置
被超越 / 被接续
← 回到模型库
指标来源性质:论文实测标 arXiv 号;厂商宣称标「官方口径」。术语表 →最后更新 2026-08