不靠动作标注、只看视频就学出一个能实时走进去交互的世界,但至今没有论文可查。
无标注视频学出可交互世界,文本事件注入。
此前的可交互世界生成模型,要么局限在特定游戏(比如专门为 DOOM 训练的实时生成模型),要么交互时长和画质做了明显取舍——想要能玩得动,就得牺牲清晰度或者只能撑几秒钟;想要画质高,往往就成了不能操控的纯视频生成。让一个通用、不针对特定游戏训练的模型,既能实时响应操作,又能在相当长的时间里保持场景一致,此前没有公开案例做到。
Genie 3 由 Google DeepMind 于 2025 年 8 月发布,训练时不需要人工标注的动作标签,只从大量无标注视频里学出「潜在动作空间」——也就是说,模型自己总结出一套「操作」的抽象表示,再学会「做出某个操作之后画面会怎么变」,而不需要人告诉它每一帧对应哪个按键。
官方给出的规格是 720p 分辨率、24fps 的实时生成速度,环境一致性可以维持数分钟,视觉记忆可以回溯到大约一分钟之前——也就是说你转身看别处再回头,之前看到的场景大概率还在那里,这在此前的实时交互生成模型里是明显的进步。它还支持用文字指令实时往场景里「注入」事件,比如让天气突然变化、让某个角色出现。
值得注意的是它的开放路径:2025 年 8 月发布时只是面向一小批学术研究者和创作者的封闭研究预览,外界几乎无法验证官方宣称的效果。直到 2026 年 1 月底,DeepMind 才通过一款叫 Project Genie 的原型应用把它开放给美国地区的 Google AI Ultra 付费订阅用户(每月约 250 美元),但单次生成时长被限制在 60 秒以内,也没有开放公开 API,普通开发者依然无法直接调用底层模型做二次开发。
| 生成规格 | 720p 分辨率、24fps 实时交互生成 | 官方口径 |
| 一致性维持 | 环境一致性可维持数分钟,视觉记忆可回溯约 1 分钟前的画面 | 官方口径 |
| 开放状态 | 2025-08 发布时仅面向小规模学术/创作者研究预览;2026-01-29 起以「Project Genie」形式向美国 Google AI Ultra 订阅用户开放,单次生成上限 60 秒,无公开 API | 官方口径(Google DeepMind 博客) |
最大的软肋是「拿不出论文、验证不了」。Genie 3 至今没有发表对应的技术论文,公众能接触到的只有官方博客里的演示视频和精选案例,独立研究者无法复现训练过程,也无法在标准化的测试集上核实它的真实边界——它的能力评价目前几乎完全依赖 DeepMind 自己挑选的展示素材,这与业内通常要求「论文+可复现实验」的规范有明显差距。
另一条争议是:「能玩」到底能不能作为衡量世界模型的试金石?一方认为实时交互性本身就是重要的能力信号,能做到「转身看别处再回来场景还在」,说明模型确实学到了某种空间记忆和状态维护能力,这是纯视频生成模型做不到的。另一方则指出,可玩性和物理准确性其实是两件相对独立的事——交互式世界模型评测基准 WBench(arXiv:2605.25874)发现,画面质量与物理合理性之间有较强的正相关,但操控能力(导航、交互)和物理准确性得分之间几乎不相关,也就是说一个模型「玩起来很顺」不代表它「物理上讲得通」。批评者由此提出一种「可靠性悖论」:如果一个世界模型本身还存在明显的物理失真和画面幻觉,用它训练出来的智能体又怎么能指望在真实世界里可靠工作?