第一次证明智能体可以只在「想象出来的环境」里学会本领,然后把策略搬回现实。
VAE + MDN-RNN + 梦境训练,让「世界模型」重回聚光灯。
2018 年之前,强化学习智能体想学会一件事,就得在真实环境里反复试错几百万次。对游戏来说这只是费电,对机器人来说这意味着摔坏几百台设备。让智能体在脑子里练,是个显而易见的想法,但一直没人做出有说服力的证明。
他们把系统拆成三块,各司其职。第一块叫 V,是个变分自编码器——把每一帧画面压缩成一个几十维的向量,扔掉像素细节,只留下「场景里有什么」。
第二块叫 M,是个循环神经网络,配上混合密度输出。它接过 V 压缩出来的向量,学着预测下一时刻会变成什么样。因为世界本来就不是确定的,M 输出的不是一个答案,而是一个概率分布。
第三块叫 C,控制器,小到只有几百个参数。它不看原始画面,只看 V 和 M 给的内部表征,然后决定动作。
最关键的一步在这里:训练 C 的时候,根本不需要真实环境。M 已经学会了「世界会怎么变」,那就让 C 在 M 生成的梦境里练。练好了再放回真实环境——成绩依然成立。在开车游戏 CarRacing 里,这套「在梦里练出来」的策略拿到了 906 分(100 次试验均值),超过了当时公开排行榜的最好成绩;在射击游戏 VizDoom 的躲避关卡里,它能在真实环境里撑过约 1100 个时间步,远超过关所需的 750 步。
| CarRacing-v0 | 906 ± 21 分(100 次随机试验均值),环境定义的「解决」阈值是连续 100 次试验均分 900 分 | arXiv:1803.10122 |
| VizDoom(DoomTakeCover) | 真实环境中平均存活约 1100 个时间步,超过 750 步的通关线;此前 OpenAI Gym 排行榜最好成绩为 820 ± 58 步 | arXiv:1803.10122 |
这篇论文让「世界模型」一词重回主流,但也直接触发了优先权之争。Schmidhuber 是本文的第二作者,而他 1990 年的《Making the world differentiable》早就提出了预测器 M + 控制器 C 的范式。他此后多次公开强调这一点,认为后来涌现的大量「世界模型」工作都应该引用 1990 年那篇,2018 年这篇论文本质上是把 1990 到 2015 年间他自己一系列工作的思路,用现代深度学习工具重新实现了一遍。
另一方的看法是:想法早就有了,但真正让它跑起来、并且让整个领域相信它可行的,是 2018 年这次工程实现——尤其是那个能在浏览器里直接玩的交互式论文网页,让「在梦里训练、拿到现实里能用」第一次变得可感可信。这场争论没有共识,但它本身就是理解这个领域的一把钥匙:很多「重回聚光灯」的突破,底子里都能挖到更早的雏形。