OpenAI 把「视频生成模型」称为「世界模拟器」,一句话点燃了视频生成算不算世界模型的争论。
「世界模拟器」争议起点,分钟级视频生成。
2024 年之前,文本生成视频的模型大多只能生成几秒钟、动作简单、场景单一的短片,稍微复杂一点的运动、遮挡或者多主体互动就会露馅。业界一直缺一个足够有说服力的例子,来证明「把视频生成模型做大」这条路能不能真的走到「理解物理世界如何运作」,而不只是拼接好看的画面。
Sora 在 2024 年 2 月 15 日公开预览,展示了大量长达一分钟、分辨率和连贯性都远超此前公开模型的生成视频:镜头运动、光影变化、多个物体的互动在很长时间跨度里都保持了相当程度的一致性。它到 2024 年 12 月 9 日才正式向美国和加拿大的 ChatGPT Plus/Pro 付费用户开放。
技术上,Sora 把视频切成时空「patch」(一小段时空块),用类似大语言模型处理文字 token 的方式处理这些视频块,再用扩散模型逐步把噪声还原成连贯画面。这套架构的好处是可以直接利用不同分辨率、不同时长、不同宽高比的视频数据联合训练,不需要像早期视频模型那样把所有素材都裁剪成统一尺寸。
真正引发讨论的是 OpenAI 给这套技术下的定位。他们把技术报告标题定为「视频生成模型作为世界模拟器」,原文写道:「我们的结果表明,扩大视频生成模型的规模,是通往构建通用物理世界模拟器的一条有前途的路径。」这句话把 Sora 从「视频生成工具」直接架到了「世界模型」的框架下讨论,也让后续所有关于它到底理解不理解物理规律的争论有了靶子。
| 发布 | 2024 年 2 月 15 日公开预览;2024 年 12 月 9 日起向美国/加拿大 ChatGPT Plus/Pro 付费用户开放 | 官方口径 |
| 生成能力 | 最长可生成 1 分钟高保真视频 | 官方口径 |
| 官方定位 | 「Our results suggest that scaling video generation models is a promising path towards building general purpose simulators of the physical world.」 | 官方口径(OpenAI《Video generation models as world simulators》) |
| 官方承认的局限 | 「limited capacity to simulate complex physics, to understand causality and to differentiate left from right」 | 官方口径 |
核心争议就是:视频生成本身算不算世界模型?支持的一方认为,Sora 生成的长视频里出现了三维一致的镜头运动、遮挡关系、甚至研究者所说的「未经提示自动生成不同视角」这类现象,说明模型在训练中隐式学到了某种空间和物理结构,而不只是记忆画面拼贴。反对的一方则指出,视频生成不等于世界模型:世界模型的核心要求是遵循物理规律去推演状态变化,而「画面看起来真实」和「行为真的符合物理规律」是两件事——现实要求的是对重力、光学、流体力学等规律的严格服从,而不只是视觉上说得过去。
物理违例的公开例证并不难找:玻璃破碎的方式不符合材料力学、气球之间该有的同性电荷排斥没有发生、钢球砸在软泥上不会留下凹陷、剪刀剪纸时纸张不会真的被剪开。字节跳动和清华大学的一项研究(arXiv:2411.02385)进一步指出,这类视频模型并没有真正抽象出通用的物理规则,而是表现出一种「基于案例的泛化」——遇到分布外场景时,更像是在模仿训练集里最接近的那个训练样本;论文观察到模型参照训练数据的优先级依次是颜色、大小、速度、形状(越靠前影响越大),一旦场景组合超出训练分布,模型就会在最基础的直线运动、碰撞这类物理常识上出错——扩大模型规模也未必能补上这个窟窿。OpenAI 自己在技术报告中也承认了类似局限,写明模型「模拟复杂物理的能力有限,理解因果关系和分辨左右的能力也有限」。这场争论至今没有定论,双方都同意 Sora 生成的画面令人印象深刻,分歧在于这种「像」是不是等于「懂」。