Sora 把「视频生成是不是世界模型」这场争论推到台前。
OpenAI 押注的是路线 3:把视频生成模型做大,本身就能通向「通用物理世界模拟器」。这个判断直接写在 2024 年 Sora 技术报告的标题里——《视频生成模型作为世界模拟器》,报告原文称「扩大视频生成模型的规模,是通往构建通用物理世界模拟器的一条有前途的路径」(官方口径)。
Sora 于 2024 年 2 月 15 日公开预览,同年 12 月 9 日起向美国、加拿大付费用户开放;2025 年 9 月 30 日 Sora 2 上线,官方强调物理表现更真实——比如投篮不中时球会按篮板弹开,而不是像早期模型那样凭空「瞬移」进筐(官方口径)。同时上线的还有面向社交分享的 Sora App 和面向开发者的 Video API。
最大的不确定性,是「视频生成算不算世界模型」这场争论本身还没有答案。支持者认为长视频里出现的三维一致镜头运动、遮挡关系说明模型隐式学到了空间结构;反对者指出,画面逼真不等于遵守物理规律——字节跳动与清华大学的研究(arXiv:2411.02385)发现这类模型更像是在模仿训练集里最接近的样本,一旦场景超出训练分布就会在基础物理上出错,OpenAI 自己在技术报告里也承认「模拟复杂物理、理解因果和分辨左右的能力有限」。另外,OpenAI 的组织重心仍主要押在通用推理与智能体模型上,视频世界模拟器能否获得与语言模型同等量级的持续投入,目前还看不出来。