世界模型WORLD MODELS
路线 2 · JEPA

拒绝生成像素: 一场反主流的豪赌

2022 — 至今代表:I-JEPA · V-JEPA · V-JEPA 2 / 2-AC · AMI Labs
§1 起源故事

2022 年 6 月,图灵奖得主 Yann LeCun 在 OpenReview 上发布了一份 60 多页的立场文件《A Path Towards Autonomous Machine Intelligence》:一张通往自主机器智能的蓝图,六大模块(感知、世界模型、代价、行动者、短期记忆、配置器),核心是一种叫 JEPA(联合嵌入预测架构)的学习方法。他的论证直指行业主流:视频里树叶怎么抖、光斑怎么闪,本质上不可预测——生成式模型在像素空间做预测,等于把模型容量浪费在模拟噪声上。正确的做法是在抽象表征空间里预测:忽略不可预测的细节,聚焦结构性、可规划的低熵信息。

Meta AI 沿这条路连出三代:I-JEPA(2023,图像)、V-JEPA(2024,视频),到 V-JEPA 2(arXiv:2506.09985,2025)——用超过 100 万小时互联网视频预训练,再用仅 62 小时无标注机器人视频后训练出动作条件版 V-JEPA 2-AC,实现零样本机械臂控制。2025 年 11 月,LeCun 确认离开 Meta,创立 AMI Labs;2026 年 3 月,这家公司拿下 10.3 亿美元种子轮(投前估值 35 亿美元,欧洲史上最大种子轮)。当整个行业涌向视频生成,市场依然愿意为这场反主流赌注下注真金白银。

§2 核心原理图解
上下文输入
可见的视频片段
编码器
映射到抽象表征
预测器
在隐空间预测目标表征
目标表征
未来 / 被遮挡部分
表征对比
能量模型度量,不重建像素
JEPA(LeCun 2022):在表征空间预测,主动忽略树叶抖动这类不可预测的像素细节
§3 代表模型
I-JEPA
Meta AI · 2023
图像隐空间预测的第一个 JEPA 实例:用上下文表征预测被遮挡区域的表征。
隐空间预测arXiv:2301.08243
V-JEPA
Meta AI · 2024
把 JEPA 扩展到视频:从时序遮挡中学运动与交互的抽象表征。
视频表征arXiv:2404.08471
V-JEPA 2 / 2-AC
Meta AI · 2025
100 万小时视频预训练;62 小时机器人视频后训练出动作条件版,零样本机械臂控制。
零样本控制arXiv:2506.09985
AMI Labs
LeCun · 2026
LeCun 离开 Meta 后的新公司,专攻 JEPA 路线;10.3 亿美元种子轮(欧洲史上最大)。
$1.03B 种子轮TechCrunch 2026-03
完整档案与筛选见 模型库 →
§4 权威视频
YouTube ▶
Yann LeCun × Lex Fridman #416
访谈 · 英语 · 看点:JEPA 章节 31:59 起,V-JEPA 45:44 起,为何反对像素生成
✓ 已核验 2026-07-19
本站只展示经核验的视频链接;未核验资源一律不上线。
§5 这条路线的赌注与软肋
赌注 THE BET
忽略不可预测的细节、只在抽象空间里预测结构,才是通往推理与规划的正确表征——就像人脑不会逐像素想象未来。
软肋 THE WEAKNESS
不生成可玩世界,成果难以直观展示——发布会上放不出震撼演示;判别式训练容易表征塌缩,工程门槛高;在生成派的数据飞轮面前,这条路线的进度显得孤独。
下一条路线:路线 3 · 视频生成式模拟器统一模板:起源 → 原理 → 模型 → 视频 → 赌注与软肋