面向没有 AI 科研背景的读者。每条只解释「它到底在说什么」,并链回相关的路线与模型。
用几百万个带颜色和透明度的三维「小椭球」来表示一个场景,渲染时直接把它们泼到屏幕上。相比 NeRF 快了两个数量级,是空间智能路线能实时跑起来的技术地基。
一种压缩再还原的神经网络:一半把画面压成隐空间里的一个向量,另一半把向量还原回画面,训练时逼着中间向量必须概括出画面的关键信息。World Models 里的 V 模块用的就是它。
自监督学习的一个陷阱:模型发现「不管输入是什么都输出同一个答案」也能让损失变小,于是偷懒摆烂,学不到任何区分能力。JEPA 系列需要专门的正则化手段(如 VICReg)来防止它。
一个生成的三维或交互世界,不管从哪个角度、哪个时间点回去看,物体是否还在原来的位置、长原来的样子。这是判断一个空间生成模型是不是真的在「建模一个世界」、而不只是「变一次戏法」的关键标准。
让模型参与改进自己:改自己的提示词、改自己的代码、甚至安排自己的下一轮训练。它先在编程和数学上跑通,不是因为那两件事更简单,而是因为那里有便宜的验证器——编译器和测试立刻告诉你改好没有。物理世界没有这种东西,所以有人认为世界模型才是 RSI 走进物理域的前提。
两种传统三维表示方法:点云是空间里一堆离散的点,网格是用三角形面片拼出物体表面。它们在计算机图形学里用了几十年,是高斯泼溅、NeRF 这些新方法出现之前的主流三维表征方式。
机器人策略不是一次只输出下一瞬间的动作,而是一口气输出未来一小段时间(比如几十步)的完整动作序列再执行。这样动作更连贯流畅,也减少了每一步都重新决策带来的抖动。
先在便宜、安全、可以快进的仿真环境里训练机器人策略,再把训练好的模型搬到真实机器人上用。核心难点是仿真和现实总有细微差异(材质、光照、物理参数),这道「差距」常让仿真里练得好、真机上却打折扣。
厂商自己公布、但没有经过同行评审或独立第三方复核的数字或说法,比如产品博客里的「成功率约 94%」。它不代表数字是假的,只代表这个数字目前只有厂商一家背书,读者需要知道这一点再决定信几分。
不给单一确定答案、而是输出一整个概率分布的神经网络。World Models 里的 M 模块用它预测下一时刻的隐状态——因为环境的未来本就不确定,一个分布比一个死板的数字更诚实。
不同团队、不同论文报的分数,往往测试条件(试验次数、环境版本、失败判定标准)各不相同,直接把数字摆在一起比较容易得出错误结论。看到「谁的分数更高」,先看清楚是不是在同一套标准下测的。
「开放权重」通常只公开训练好的模型参数,可下载运行、微调,但训练代码和数据未必公开;「开源」在软件领域一般还要求代码和构建方式都可复现。很多号称「开源」的模型发布,严格说其实只是开放权重。
先把清晰图片一步步加噪声直到变成纯噪点,再训练网络学会逆过程——从噪点里一步步还原出图片。生成时从随机噪声出发反复去噪,就能造出新画面。Sora、DIAMOND、GameNGen 都用它生成视频或游戏画面。
LeCun 主张的路线:不预测像素,而是在抽象表征空间里预测。他的理由是「生成像素是在浪费容量模拟树叶抖动」——真正重要的是理解结构,不是画得像。
不在真实环境里反复试错,而是让智能体在世界模型脑补出的「梦境」序列里练习,练好了再搬回现实用。World Models、Dreamer 系列靠这一招大幅减少真实环境交互次数。
不靠试错和奖励信号学习,而是直接给机器人看大量人类(或遥操作者)完成任务的示范轨迹,让它学着模仿。这是目前训练机器人操作策略最主流的方式之一,π0、OpenVLA 都依赖大量示范数据。
强化学习的一个分支:先学一个能预测「做了某个动作后环境会怎么变」的模型,再靠它做规划或生成训练数据,而不是每一步决策都要靠海量真实试错去学,通常更省真实环境交互次数。
Anthropic 在 2026 年 8 月发布研究预览的一份规范,可以理解成「物理版的 MCP」:用 read/write 一组极简原语,让 AI 智能体不必写定制驱动就能操作显微镜、机械臂这类设备。它是接口而不是能力——不预测任何物理规律,只是把模型接到真机上的成本降下来。
已知「现在是什么状态、下一刻会变成什么状态」,反推出「需要执行什么动作才能造成这个变化」。有些世界模型先预测画面会怎么变,再用逆动力学模块把预测「翻译」成机器人可执行的具体动作。
Genie 的核心技巧:训练数据里的视频没有任何按键标注,模型自己从「前后两帧的差别」里反推出有哪几种动作,于是无标注视频也能学出可交互的世界。
用一个神经网络记住一个三维场景:给它任意观察位置和角度,它能算出从那里看过去应该是什么画面。它是三维空间智能路线的起点,但渲染速度慢,后来被更快的 3D 高斯泼溅取代。
不写传统渲染代码,而是用训练好的神经网络实时生成每一帧画面来「跑」一个游戏,玩家的按键直接作为输入喂给网络。GameNGen 用扩散模型实时生成 DOOM 画面,是这类思路最早的公开验证之一。
生成的画面或状态在时间上是否连贯、不崩坏——转身走开又走回来,场景还是原来的样子吗?这是评价视频类世界模型最基础也最容易露馅的一项,能力矩阵里专门有一列对应它。
一个能在脑子里「预演」环境如何变化的系统:给它当前状态和一个动作,它能说出接下来会发生什么。注意这个词被四类差异极大的系统同时使用——视频生成器、强化学习里的梦境机、抽象表征学习器、动作预测基础模型。
把「看见什么 + 被告知做什么 + 该输出什么动作」放进同一个模型。它和世界模型的关系是互补的:世界模型预测「会发生什么」,VLA 决定「该做什么」。
只给模型看几张(甚至一张)某个场景的照片,让它「脑补」出从没拍过的角度看这个场景会是什么样。这是空间智能路线最基础的能力测试:能不能凭有限的观察,合理推断出没见过的视角。
PlaNet 提出的结构:把环境状态拆成「确定性的记忆」与「随机的不确定性」两部分一起往前推演,让模型既能记住长期信息,又能表达「我不确定」。Dreamer 系列的地基。
判断一个结果好不好的东西。它有强弱之分:最强的是形式化验证器(数学上能证明对错),最弱的是让模型自己给自己打分。一个自我改进的环能不能闭上,取决于这一环是否可靠且便宜——这也是世界模型在物理领域被寄予厚望的位置。
由人远程操控机械臂完成任务、同时把动作和传感器数据完整记录下来的训练数据。这类数据采集成本很高(每条轨迹都要真人操作),但比游戏或仿真数据更贴近真实世界。
把高维、杂乱的原始输入(比如一张图的几十万像素)压缩成一小串数字,只留下对任务重要的信息。世界模型通常先压缩进隐空间,再在这个更小的空间里做预测,省算力也更稳定。
训练时故意把输入的一部分(一块画面、一段视频)遮起来,让模型根据剩下的部分去猜被遮住的内容长什么样。这逼着模型学会理解结构和上下文,而不是死记硬背,是 JEPA 系列的核心训练方式。
厂商公布的「24fps」「720p」这类数字,往往只对应某个特定版本或演示条件,换个开放阶段就可能不再适用。比较不同世界模型时,要留意这些指标是不是在同一版本、同一条件下测出来的。
机器人策略在训练时见过的房间、物体上表现很好,但换到一个完全陌生的真实环境(新厨房、新物体)还能不能完成任务,就是真机泛化能力,通常是机器人学习里最难、也最容易被吹嘘过头的一项。
像接龙一样一步步生成:先生成第一部分,再拿它当输入生成下一部分,如此反复。视频世界模型里的「因果预训练」(如 LingBot-World 2)按时间顺序逐帧生成,好处是长序列后半段不容易突然失真。