同一套超参数,从雅达利游戏到 Minecraft 挖钻石都能用,不用为每个任务重新调参。
单套超参跨 150+ 任务,Nature 2025,从零采到钻石。
在 DreamerV3 之前,几乎每一种强化学习算法都得给每类任务单独调参:连续控制和离散动作要分开调,像素输入和低维状态要分开调,奖励密集和奖励稀疏的场景要分开调。研究者换个任务往往就要重新跑一轮超参搜索,这让「通用智能体」这个说法名不副实——所谓通用,很多时候只是在说这套代码能改着用,而不是同一套配置真的能直接搬过去。
DreamerV3 延续了「世界模型 + 想象中训练」的思路:先学一个能预测环境会怎么变化的模型,再让智能体在这个模型生成的「想象」序列里练习决策,而不是每一步都要跟真实环境打交道。
让它能跨任务通用的关键,不是换了新算法,而是一堆看似朴素的「鲁棒化」处理:把数值做对称压缩(symlog)避免不同任务奖励量纲差异太大把网络搞炸、给学习信号做百分位数归一化而不是简单除以最大值、限制单步更新幅度防止某次异常数据把参数带跑偏。这些技巧单独看都不起眼,合在一起就让同一套超参数在连续动作和离散动作、二维画面和三维画面、稀疏奖励和密集奖励之间都能稳定工作。
论文用「单套配置跑赢 150 多个专用任务的最优方法」来证明这一点,覆盖 Atari 街机、DeepMind Control 连续控制、Crafter 生存游戏等一大批风格迥异的基准。这不是说 DreamerV3 在每一项上都是最强,而是说不用为每一项单独调参就能接近或超过那些专门为它调过参的方法。
最受关注的演示是 Minecraft 里从零采钻石:不给人类示范、不给课程学习引导,智能体只凭稀疏奖励和探索,在约 3000 万环境步(游戏内约 17 天时长)左右第一次挖到钻石——这是此前被公认很难啃的开放世界探索难题,之前的方法几乎都要靠人类演示数据打底才能做到。这项工作后来发表在 2025 年的《自然》期刊上,是原始 arXiv 论文的正式发表版本。
| 跨任务通用性 | 单套超参数配置在 150+ 个任务上超越各领域专用方法 | arXiv:2301.04104 |
| 期刊出处 | Nature 640, 647–653(2025) | Nature 640, 647–653 (2025); DOI:10.1038/s41586-025-08744-2 |
| Minecraft 采钻石 | 无人类数据/课程,从零训练;首块钻石约在 3000 万环境步(约 17 天游戏内时长)出现 | arXiv:2301.04104;danijar.com 项目页(官方口径) |
「单套超参数、免调参」这个说法后来被拿到别的场景里检验,结果没那么干净。一篇把 DreamerV3 用在交通信号控制上的复现研究(arXiv:2503.02279)发现,实际部署时至少还有两个超参数——模型大小和更新频率(UTD 比率)——绕不开,训练奖励曲线在早期会明显震荡,调大更新频率也不一定能让收敛变快。换句话说,「不需要调参」更准确的说法或许是「比大多数强化学习算法需要调的参数少得多」,而不是字面意义上的零调参。
另一条争议线在于「样本效率」和「算力效率」是两回事。DreamerV3 这类基于模型的方法确实能用更少的环境交互步数学会任务,但每一步都要多做一次「想象」推演,单步计算开销比无模型方法(比如 PPO)大得多。一个常被提到的反例是:在仿真速度本身很快的场景(比如用 Isaac Lab 这类高速模拟器)下,无模型的 PPO 在墙钟时间上很难被基于世界模型的方法超过——因为省下来的是环境步数,不是算力和时间。这意味着「用相同预算比谁更强」这个问题,答案要看你数的是步数还是秒数。