不重建像素、只在抽象表征空间里预测未来,用不到 62 小时的机器人视频就学会零样本抓取。
2-AC 版用 62 小时机器人视频后训练,零样本控制。
让机器人从视频里学会「预判物理世界怎么变化」,一直卡在一个矛盾上:想要模型理解真实世界的动态,似乎就得让它学会生成逼真的画面;但生成逼真画面本身极其昂贵,而且画面里大部分细节(光影闪烁、布料褶皱的具体纹理)对「接下来该怎么做」这件事其实无关紧要。用重建像素的方式学世界模型,容易把大量算力浪费在预测不了、也不需要预测的细节上。
V-JEPA 2 走的是另一条路:联合嵌入预测架构(JEPA)。它不要求模型把下一帧画面「画出来」,而是让模型在一个抽象的表征空间里预测「接下来的状态大概长什么样」,跳过不可预测、也不重要的像素细节。训练时用海量互联网视频(超过 100 万小时量级)做自监督预训练,学会理解物体、运动和场景变化的通用规律。
光有这套「看懂视频」的能力还不够用来指挥机器人干活,因为它不知道「做了某个动作之后世界会怎么变」。于是团队做了一个后训练版本 V-JEPA 2-AC(action-conditioned,动作条件版):用不到 62 小时的、来自 DROID 数据集的未标注机器人视频,教会模型把「机械臂做出某个动作」和「场景会如何随之变化」联系起来。62 小时相比互联网视频规模小得多,但因为底子里的世界理解已经学好了,这点数据就足够让模型学会「动作会带来什么后果」。
有了这个动作条件世界模型,机器人规划就变成了一种「脑内试错」:给定一张目标图像,模型在表征空间里想象一串候选动作会带来的后果,挑出最接近目标的那条动作序列去执行,而不需要针对每个新环境重新训练一个专门的抓取策略。
效果上,团队把 V-JEPA 2-AC 部署到两个不同实验室、此前从未训练过的 Franka 机械臂上做零样本抓取和放置,成功率在不同物体上大致在 65% 到 80% 之间浮动,明显高于 Octo 等基线方法(多数任务上不到一半);而且这套方法单步动作规划只要约 16 秒,比 Cosmos 这类生成式基线(约 4 分钟一步)快了一个数量级。
| 后训练数据 | V-JEPA 2-AC 用不到 62 小时的 DROID 数据集未标注机器人视频做动作条件后训练 | arXiv:2506.09985 |
| 零样本抓取放置 | 两个实验室的 Franka 机械臂上零样本部署,pick-and-place 成功率约 65%–80%(因物体而异),显著高于 Octo 基线(约 0%–70%) | arXiv:2506.09985 |
| 规划速度 | 每步动作规划约 16 秒,比 Cosmos 基线(约 4 分钟/步)快一个数量级 | arXiv:2506.09985 |
V-JEPA 2 是 Yann LeCun 「生成像素是浪费算力」这一论断的旗舰实证。他的核心论点是:视频里大多数细节——树叶的抖动、光线的闪烁、空气分子的运动——本质上不可预测,强迫模型去预测这些细节,不仅浪费容量,还会污染学到的表征,让模型学不到真正有用的抽象规律。JEPA 系列选择在表征空间里预测,用 VICReg 一类的正则化手段防止模型「摆烂」(表征坍缩成一个常数),以此换取效率和泛化能力。
生成派的反驳集中在「验证」这个环节。2026 年 3 月,MBZUAI 校长邢波(Eric Xing)在摩洛哥本盖里 UM6P 举办的 Spring School『AI For Impact』上与杨立昆公开辩论 JEPA 与他自己提出的 GLP 路线(该场对谈的视频记录见 youtube.com/watch?v=8LKgvrNYZz0)。他的核心立场是:GLP 保留生成式重建作为验证机制——不是最终目标,而是用来检验模型是否真正理解了信号;纯隐空间预测器存在「坍缩」风险,需要靠人工设计的正则项硬撑住,而生成式重建损失天然就不会坍缩,因为它必须真的把细节画出来接受检验。这场分歧目前没有定论:一方押注抽象带来的效率与泛化,另一方押注生成带来的可验证性,两条路线仍在并行推进。