世界模型WORLD MODELS · 月更
ROUTES · 六条并行的技术路线

六条路线

每条路线一个统一模板:起源故事 → 核心原理图解 → 代表模型 → 权威视频 → 这条路线的赌注与软肋。建议从路线 0 顺序读起;也可以先看下面的关系总览, 再决定从哪条路线切入。

路线关系总览 · 从认知到行动

LLM 不等于世界模型,
但正在成为它的认知中枢

更可能的未来不是一种模型取代另一种,而是基础模型、智能体、世界预测与行动策略逐步汇合。下面先看四层能力栈,再看世界模型内部六条路线如何竞争、互补与融合。

01
前沿基础模型
语言、视觉、推理与知识工作的认知中枢
02
智能体系统
工具、记忆、Computer Use 与长程任务
03
世界模型
环境状态、动力学预测与反事实模拟
04
行动系统
规划、VLA、机器人与物理闭环
注:这是功能分层,不假设未来一定由四个独立模型实现;统一模型也需要完成同样的四类功能。
世界模型内部:竞争、互补与融合
route:3视频模拟器route:2JEPAroute:1经典 MBRLroute:4具身/VLAroute:0起源 1990route:5空间智能
竞争(LeCun 判别派 vs 生成派)互补(哲学源头 / 三分法)融合(三大合流趋势)
三维度分类:一张表看清六条路线
路线
预测空间
可交互可控?
面向具身控制?
0 起源
隐状态(RNN)
—(理论范式)
是(M+C 闭环)
1 经典 MBRL
隐空间
是(梦境内)
2 JEPA
隐空间
渐进(V-JEPA 2-AC)
3 视频模拟器
像素
是(Genie 系)
否 → 融合中
4 具身/VLA
像素 + 动作
是(核心目标)
5 空间智能
显式 3D
是(可探索)
间接(供模拟)
李飞飞三分法专栏
「大多数自称世界模型的系统只停留在渲染器阶段,却当作三合一来卖。」
① 渲染器 Renderer
生成给人看的像素。Sora、Kling 大体停在这里。
② 模拟器 Simulator
程序可算的几何与物理状态。Marble 的双表征在此下注。
③ 规划器 Planner
输出动作、闭环控制。V-JEPA 2-AC、LingBot-VA 的目标。
三大融合趋势
融合 ①
视频世界模型 + 机器人控制
LingBot-VA、GR00T-Dreams:先预测视频,再用逆动力学反解动作。
融合 ②
自回归 + 扩散
Diffusion Forcing、块因果注意力:兼得长时一致与逐帧质量。
融合 ③
视频渲染 + 3D 模拟
HunyuanWorld、World Labs 双表征:像素好看,几何也可算。
六条路线一览
路线 0 · ORIGIN
起源:1990 让世界可微分
Schmidhuber 的预测器 M + 控制器 C 范式与 1991 好奇心机制,一切模型驱动 RL 的哲学源头。
1990 — 1991
路线 1 · MBRL
经典模型驱动强化学习
《World Models》在梦境中训练智能体;Dreamer 系十年长跑,Nature 2025 从零采到钻石。
2018 — 至今
路线 2 · JEPA
LeCun 的反主流赌注
「生成像素浪费容量在树叶抖动上」——隐空间预测才是通往规划的正道。V-JEPA 2 零样本控制。
2022 — 至今
路线 3 · VIDEO-SIM
视频生成式模拟器
从 Sora 争议到 GameNGen 跑 DOOM、Genie 3 可玩世界,与国内 LingBot-World 的开源对标。
2024 — 至今
路线 4 · EMBODIED
具身 / VLA 与世界基础模型
RT 系 → OpenVLA → π0;NVIDIA Cosmos 与 GR00T;自动驾驶 GAIA 系;灵波 LingBot-VA。
2022 — 至今
路线 5 · SPATIAL-3D
3D 空间智能
NeRF / 3DGS 打地基;李飞飞 World Labs 与 Marble 生成可探索、持久的 3D 世界。
2020 — 至今
路线 0 · 起源:1990 让世界可微分开始,按顺序读完六条路线。术语表 →最后更新 2026-08