输入一句话或一张图,输出一个可以走进去探索、还能给物理引擎用的持久 3D 世界。
文本/图像生成可探索持久 3D 世界,双表征输出。
文本或图像生成三维场景的技术(比如 NeRF、3D 高斯泼溅)解决了「怎么把一堆照片或一段描述变成三维表征」的问题,但生成出来的大多只能用来看——渲染质量高,却缺一套供物理引擎直接调用的碰撞结构,机器人仿真、游戏引擎这类需要「知道东西在哪、能不能穿过去」的下游应用没法直接拿来用,还得靠人工重新建模或者补一层几何处理。
Marble 由李飞飞创立的 World Labs 于 2025 年 11 月正式商用发布。它接收文本、图片、视频或简单的空间草图作为输入,生成一个可以在里面走动、四处探索的三维环境,而且这个环境是「持久」的——你从不同角度绕回同一个位置,看到的还是同一批物体在同样的位置,不会像早期的实时生成式世界模型那样一转身场景就悄悄变了样。
它的关键设计是同一个模型同时输出两种表征:一种是高斯泼溅(用来做逼真的视觉渲染,负责「看起来对不对」),另一种是碰撞网格(供物理引擎直接运算,负责「摸起来、撞起来对不对」)。这意味着同一个生成结果既能拿来做视觉展示,也能直接喂给机器人仿真环境或游戏引擎当作可交互的场地,不需要额外的人工转换步骤。
商业化路径上,Marble 一开始是消费级应用,提供免费和多档付费订阅(按月生成次数和功能分级);到 2026 年初又推出了面向开发者的 World API,允许程序化调用生成能力,按生成的信用点计费,方便集成到 Unity 等游戏引擎或机器人仿真流水线里。
World Labs 背后的资金也说明了这个方向被看重的程度:公司 2024 年 9 月以约 10 亿美元估值完成 2.3 亿美元的种子轮融资,2026 年 2 月又由 Autodesk 领投完成 10 亿美元的 B 轮融资,估值升到 50 亿美元,两轮累计融资约 12.3 亿美元。
| 双表征输出 | 同一模型同时输出高斯泼溅(视觉探索用)与碰撞网格(可供物理引擎运算) | 官方口径(World Labs 博客) |
| 开放状态 | 2025-11-12 正式商用发布,免费/付费订阅分级;2026-01 起提供付费 World API 供程序化调用 | 官方口径 |
| 融资 | 2024-09 以约 10 亿美元估值获 2.3 亿美元种子/A 轮;2026-02 由 Autodesk 领投完成 10 亿美元 B 轮,估值升至 50 亿美元,累计融资约 12.3 亿美元 | 官方口径/公开报道(TechCrunch、SiliconANGLE) |
李飞飞在 2026 年 6 月 3 日发表的 Substack 文章《A Functional Taxonomy of World Models》(drfeifei.substack.com/p/a-functional-taxonomy-of-world-models)里,把「世界模型」按输出内容分成三类:渲染器(只输出给人看的像素画面)、模拟器(输出可供计算的、几何和物理上都站得住脚的状态)、规划器(负责决策)。文章的核心批评是,市面上很多号称「世界模型」的系统其实只是渲染器——画面好看,但你真的走进去互动,很快就会露馅,因为它输出的从来不是可计算的「状态」。
问题在于,这把刀落到自家产品 Marble 头上会怎样?李飞飞在文中的说法是 Marble 属于例外:因为它同时输出高斯泼溅和碰撞网格,「消解了渲染器和模拟器之间的边界」,不属于她批评的那类「只是渲染器」的产品。但这个自我豁免本身也是争议点——毕竟 World Labs 自己的技术博客也承认,AI 生成的几何结构可能看起来正确、实际却包含自相交或比例错误,会导致碰撞网格算出「不合理的物理」;多种物理效应(刚体、可变形物体、流体、布料)同时存在时的仿真,计算成本比单一类型的仿真高出多个数量级,目前还远谈不上成熟。这场分类法是不是一把只对别人适用、对自己格外宽松的尺子,外部还缺少独立评测来给出答案。