2022 年 6 月,图灵奖得主 Yann LeCun 在 OpenReview 上发布了一份 60 多页的立场文件《A Path Towards Autonomous Machine Intelligence》:一张通往自主机器智能的蓝图,六大模块(感知、世界模型、代价、行动者、短期记忆、配置器),核心是一种叫 JEPA(联合嵌入预测架构)的学习方法。他的论证直指行业主流:视频里树叶怎么抖、光斑怎么闪,本质上不可预测——生成式模型在像素空间做预测,等于把模型容量浪费在模拟噪声上。正确的做法是在抽象表征空间里预测:忽略不可预测的细节,聚焦结构性、可规划的低熵信息。
Meta AI 沿这条路连出三代:I-JEPA(2023,图像)、V-JEPA(2024,视频),到 V-JEPA 2(arXiv:2506.09985,2025)——用超过 100 万小时互联网视频预训练,再用仅 62 小时无标注机器人视频后训练出动作条件版 V-JEPA 2-AC,实现零样本机械臂控制。2025 年 11 月,LeCun 确认离开 Meta,创立 AMI Labs;2026 年 3 月,这家公司拿下 10.3 亿美元种子轮(投前估值 35 亿美元,欧洲史上最大种子轮)。当整个行业涌向视频生成,市场依然愿意为这场反主流赌注下注真金白银。