世界模型WORLD MODELS · 月更
路线3 视频模拟器 · MODEL

Sora

OpenAI2024-02闭源 API

OpenAI 把「视频生成模型」称为「世界模拟器」,一句话点燃了视频生成算不算世界模型的争论。

「世界模拟器」争议起点,分钟级视频生成。

它解决了什么问题

2024 年之前,文本生成视频的模型大多只能生成几秒钟、动作简单、场景单一的短片,稍微复杂一点的运动、遮挡或者多主体互动就会露馅。业界一直缺一个足够有说服力的例子,来证明「把视频生成模型做大」这条路能不能真的走到「理解物理世界如何运作」,而不只是拼接好看的画面。

怎么做的

Sora 在 2024 年 2 月 15 日公开预览,展示了大量长达一分钟、分辨率和连贯性都远超此前公开模型的生成视频:镜头运动、光影变化、多个物体的互动在很长时间跨度里都保持了相当程度的一致性。它到 2024 年 12 月 9 日才正式向美国和加拿大的 ChatGPT Plus/Pro 付费用户开放。

技术上,Sora 把视频切成时空「patch」(一小段时空块),用类似大语言模型处理文字 token 的方式处理这些视频块,再用扩散模型逐步把噪声还原成连贯画面。这套架构的好处是可以直接利用不同分辨率、不同时长、不同宽高比的视频数据联合训练,不需要像早期视频模型那样把所有素材都裁剪成统一尺寸。

真正引发讨论的是 OpenAI 给这套技术下的定位。他们把技术报告标题定为「视频生成模型作为世界模拟器」,原文写道:「我们的结果表明,扩大视频生成模型的规模,是通往构建通用物理世界模拟器的一条有前途的路径。」这句话把 Sora 从「视频生成工具」直接架到了「世界模型」的框架下讨论,也让后续所有关于它到底理解不理解物理规律的争论有了靶子。

关键数字 · 来源可溯
发布2024 年 2 月 15 日公开预览;2024 年 12 月 9 日起向美国/加拿大 ChatGPT Plus/Pro 付费用户开放官方口径
生成能力最长可生成 1 分钟高保真视频官方口径
官方定位「Our results suggest that scaling video generation models is a promising path towards building general purpose simulators of the physical world.」官方口径(OpenAI《Video generation models as world simulators》)
官方承认的局限「limited capacity to simulate complex physics, to understand causality and to differentiate left from right」官方口径
能力证据 · 记录证据强度,不是能力强弱
时序一致性有演示无数据
官方技术报告展示长达 1 分钟、镜头运动与光照保持较高一致性的精选视频,但无第三方可复现的定量连贯性指标。
官方口径
动作可控性未涉及
物理合理性有演示无数据
OpenAI 官方承认「模拟复杂物理的能力有限,理解因果关系和分辨左右的能力也有限」;另有研究(arXiv:2411.02385,测试的是自建的同类扩散视频模型而非 Sora 本身)发现规模扩大不足以让此类模型学到可泛化的物理规律。
官方口径
长程记忆未涉及
规划与反事实未涉及
真机迁移未涉及
争议与软肋

核心争议就是:视频生成本身算不算世界模型?支持的一方认为,Sora 生成的长视频里出现了三维一致的镜头运动、遮挡关系、甚至研究者所说的「未经提示自动生成不同视角」这类现象,说明模型在训练中隐式学到了某种空间和物理结构,而不只是记忆画面拼贴。反对的一方则指出,视频生成不等于世界模型:世界模型的核心要求是遵循物理规律去推演状态变化,而「画面看起来真实」和「行为真的符合物理规律」是两件事——现实要求的是对重力、光学、流体力学等规律的严格服从,而不只是视觉上说得过去。

物理违例的公开例证并不难找:玻璃破碎的方式不符合材料力学、气球之间该有的同性电荷排斥没有发生、钢球砸在软泥上不会留下凹陷、剪刀剪纸时纸张不会真的被剪开。字节跳动和清华大学的一项研究(arXiv:2411.02385)进一步指出,这类视频模型并没有真正抽象出通用的物理规则,而是表现出一种「基于案例的泛化」——遇到分布外场景时,更像是在模仿训练集里最接近的那个训练样本;论文观察到模型参照训练数据的优先级依次是颜色、大小、速度、形状(越靠前影响越大),一旦场景组合超出训练分布,模型就会在最基础的直线运动、碰撞这类物理常识上出错——扩大模型规模也未必能补上这个窟窿。OpenAI 自己在技术报告中也承认了类似局限,写明模型「模拟复杂物理的能力有限,理解因果关系和分辨左右的能力也有限」。这场争论至今没有定论,双方都同意 Sora 生成的画面令人印象深刻,分歧在于这种「像」是不是等于「懂」。

它在谱系里的位置
被超越 / 被接续
← 回到模型库
指标来源性质:论文实测标 arXiv 号;厂商宣称标「官方口径」。术语表 →最后更新 2026-08