世界模型WORLD MODELS
路线 3 · VIDEO-SIM

规模化像素预测, 能「涌现」出对物理的理解吗?

2024 — 至今代表:Sora · GameNGen · Oasis · Genie 1–3 · LingBot-World
§1 起源故事

2024 年 2 月,OpenAI 发布 Sora,技术报告里写下一个大胆的说法:视频生成模型是「世界模拟器」。争论立刻爆发——生成的视频里杯子会凭空消失、手指会穿过桌面,这算「理解世界」吗?LeCun 的回应尖锐:「看起来对 ≠ 理解。」

同月,DeepMind 的 Genie 给出另一种答案:不追求电影感,而是让模型从无标注游戏视频里自己学出「动作 → 后果」的映射——生成的世界是可玩的。8 月 GameNGen 用 Stable Diffusion 以 20fps 实时跑起 DOOM,10 月 Oasis 成为首个公开可玩的 AI 游戏。到 Genie 3(2025.8,720p/24fps、数分钟一致性)与国内蚂蚁灵波 LingBot-World 的开源对标(720p/60fps、小时级生成,官方口径),这条路线已从争议走向产品。

§2 核心原理图解
无标注视频
互联网 + 游戏引擎
时空 tokenizer
视频压缩成 token 序列
潜在动作推断
无监督学出「按键」空间
帧预测
自回归 / 扩散生成下一帧
用户动作条件化
实时注入操控与事件
可玩世界
边生成边交互
视频生成式模拟器(Genie 系范式):从无标注视频学出「动作 → 后果」,把生成变成可玩
§3 代表模型
Sora
OpenAI · 2024.2
「世界模拟器」争议的起点:扩散 Transformer 生成分钟级视频,但不可交互。
分钟级视频官方口径
GameNGen
Google · 2024.8
Stable Diffusion 实时模拟 DOOM,第一次用神经网络替代游戏引擎。
20fps 实时arXiv:2408.14837
Genie 3
DeepMind · 2025.8
从无标注视频学出可交互 3D 世界,支持文本提示的实时事件注入。
720p / 24fps官方口径
LingBot-World 2
蚂蚁灵波 · 2026
开源对标 Genie 3:因果预训练 + MoBA,主打时长与帧率(缺独立复现)。
720p / 60fps官方口径
完整档案与筛选见 模型库 →
§4 权威视频
YouTube ▶
DeepMind 官方 Genie 3 访谈
访谈 · 英语 · 看点:Shlomi Fruchter & Jack Parker-Holder 亲述无标注视频如何学出可玩世界
✓ 已核验 2026-07-19
本站只展示经核验的视频链接;未核验资源一律不上线。
§5 这条路线的赌注与软肋
赌注 THE BET
规模化的像素预测能「涌现」物理理解——就像语言模型规模化后涌现推理。数据(互联网视频)近乎无限,飞轮已经转起来。
软肋 THE WEAKNESS
LeCun 批评「看起来对 ≠ 理解」;几何一致性与长时稳定性存疑——绕场一周回来,世界还是原来那个吗?
下一条路线:路线 4 · 具身 / VLA 与世界基础模型统一模板:起源 → 原理 → 模型 → 视频 → 赌注与软肋