Dreamer 与 Genie 两条线同时押注,是世界模型领域投入最深的机构。
DeepMind 是这个领域投入最深、押注路线最多的机构:一条是达尼亚尔·哈夫纳主导的 Dreamer 系列,把「在梦境里训练、拿到现实里能用」做成路线 1(基于模型的强化学习)的旗舰配方;另一条是 Genie 系列,押注路线 3——不靠动作标注,只从视频里学出一个能实时走进去的可交互世界。
两条线都拿出过硬交付。DreamerV3 用同一套超参数跨 150 多个任务超越各领域专用方法,2025 年发表于《自然》(Nature 640, 647–653);Genie 3 于 2025 年 8 月发布,能以 720p、24fps 实时生成场景,环境一致性可维持数分钟(官方口径)。
但两条线眼下都添了变数。Genie 3 至今没有发表论文,外界只能看官方精选演示,无法独立复现验证;2025 年 11 月,在 DeepMind 工作近十年的哈夫纳宣布离职,去向未公开(据其本人社交媒体账号 x.com/danijarh 及 36kr 报道);2026 年 8 月上旬 DeepMind 又经历高层重组,首席执行官哈萨比斯卸任 CEO、转任 Alphabet 首席科学家兼 Google DeepMind 董事长,原首席技术官考瑞·卡武克奥卢升任 Google DeepMind 高级副总裁、直接向 Sundar Pichai 汇报(据 Axios、Fortune 等报道)。两条曾经并驾齐驱的路线能否保持同等投入,眼下还看不清。
从 PlaNet 到 DreamerV4 的十年长跑:RSSM、离散隐变量,一路把「梦境训练」做成通用配方。DreamerV3 无人工数据从零采到 Minecraft 钻石,2025 年登上 Nature——经典 MBRL 路线最有耐心的证明。
三代 Genie 的核心问题只有一个:能否不靠任何动作标注,让模型从视频里自己悟出「按键 → 后果」?从 2D 平台游戏到 720p 可交互 3D 世界,他们把「可玩性」变成了世界模型的试金石。