世界模型WORLD MODELS · 月更
路线3 视频模拟器 · MODEL

Genie 3

Google DeepMind2025-08仅演示

不靠动作标注、只看视频就学出一个能实时走进去交互的世界,但至今没有论文可查。

无标注视频学出可交互世界,文本事件注入。

它解决了什么问题

此前的可交互世界生成模型,要么局限在特定游戏(比如专门为 DOOM 训练的实时生成模型),要么交互时长和画质做了明显取舍——想要能玩得动,就得牺牲清晰度或者只能撑几秒钟;想要画质高,往往就成了不能操控的纯视频生成。让一个通用、不针对特定游戏训练的模型,既能实时响应操作,又能在相当长的时间里保持场景一致,此前没有公开案例做到。

怎么做的

Genie 3 由 Google DeepMind 于 2025 年 8 月发布,训练时不需要人工标注的动作标签,只从大量无标注视频里学出「潜在动作空间」——也就是说,模型自己总结出一套「操作」的抽象表示,再学会「做出某个操作之后画面会怎么变」,而不需要人告诉它每一帧对应哪个按键。

官方给出的规格是 720p 分辨率、24fps 的实时生成速度,环境一致性可以维持数分钟,视觉记忆可以回溯到大约一分钟之前——也就是说你转身看别处再回头,之前看到的场景大概率还在那里,这在此前的实时交互生成模型里是明显的进步。它还支持用文字指令实时往场景里「注入」事件,比如让天气突然变化、让某个角色出现。

值得注意的是它的开放路径:2025 年 8 月发布时只是面向一小批学术研究者和创作者的封闭研究预览,外界几乎无法验证官方宣称的效果。直到 2026 年 1 月底,DeepMind 才通过一款叫 Project Genie 的原型应用把它开放给美国地区的 Google AI Ultra 付费订阅用户(每月约 250 美元),但单次生成时长被限制在 60 秒以内,也没有开放公开 API,普通开发者依然无法直接调用底层模型做二次开发。

关键数字 · 来源可溯
生成规格720p 分辨率、24fps 实时交互生成官方口径
一致性维持环境一致性可维持数分钟,视觉记忆可回溯约 1 分钟前的画面官方口径
开放状态2025-08 发布时仅面向小规模学术/创作者研究预览;2026-01-29 起以「Project Genie」形式向美国 Google AI Ultra 订阅用户开放,单次生成上限 60 秒,无公开 API官方口径(Google DeepMind 博客)
能力证据 · 记录证据强度,不是能力强弱
时序一致性有演示无数据
官方称环境一致性可维持数分钟;至今没有发表技术论文,24fps/720p 为 2025-08 研究预览版规格,非独立可复现的测量结果。
官方口径(Google DeepMind 博客)
动作可控性有演示无数据
支持用文字指令实时向场景「注入」事件(如天气变化、角色出现),为官方演示描述,无量化可控性指标。
官方口径(Google DeepMind 博客)
物理合理性未涉及
长程记忆有演示无数据
官方称视觉记忆可回溯约 1 分钟前的画面(转身再回头场景大概率还在),该规格适用于 2025-08 研究预览版,2026-01 后的开放版本未见重新公布。
官方口径(Google DeepMind 博客)
规划与反事实未涉及
真机迁移未涉及
争议与软肋

最大的软肋是「拿不出论文、验证不了」。Genie 3 至今没有发表对应的技术论文,公众能接触到的只有官方博客里的演示视频和精选案例,独立研究者无法复现训练过程,也无法在标准化的测试集上核实它的真实边界——它的能力评价目前几乎完全依赖 DeepMind 自己挑选的展示素材,这与业内通常要求「论文+可复现实验」的规范有明显差距。

另一条争议是:「能玩」到底能不能作为衡量世界模型的试金石?一方认为实时交互性本身就是重要的能力信号,能做到「转身看别处再回来场景还在」,说明模型确实学到了某种空间记忆和状态维护能力,这是纯视频生成模型做不到的。另一方则指出,可玩性和物理准确性其实是两件相对独立的事——交互式世界模型评测基准 WBench(arXiv:2605.25874)发现,画面质量与物理合理性之间有较强的正相关,但操控能力(导航、交互)和物理准确性得分之间几乎不相关,也就是说一个模型「玩起来很顺」不代表它「物理上讲得通」。批评者由此提出一种「可靠性悖论」:如果一个世界模型本身还存在明显的物理失真和画面幻觉,用它训练出来的智能体又怎么能指望在真实世界里可靠工作?

它在谱系里的位置
被超越 / 被接续
← 回到模型库
指标来源性质:论文实测标 arXiv 号;厂商宣称标「官方口径」。术语表 →最后更新 2026-08