机器人第一次被证明能在从没见过的陌生家庭里,独立完成打扫厨房这种长程任务。
开放世界泛化:陌生厨房里收拾台面。
机器人操作策略长期以来有一个「关起门来很能干、出门就抓瞎」的毛病:在训练时见过的房间、见过的物体上表现很好,一旦换一个没见过的厨房、没见过的杯子,成功率就会断崖式下跌。这背后的原因是训练数据规模和多样性有限——采集真实机器人操作数据非常昂贵,很难覆盖现实世界里家庭环境的全部变化。让机器人具备「开放世界泛化」能力,也就是能在真正陌生的环境里完成有意义的任务,此前一直没有有说服力的公开演示。
π0.5 由 Physical Intelligence 提出,走的是「异构数据协同训练」的路子:把来自不同机器人平台的操作数据、网络图文数据、高层语义子任务标注等多种不同性质的数据混合起来一起训练,而不是只用某一种机器人自己采集的操作轨迹。这样做的逻辑是,网络数据能教会模型「世界上有什么东西、它们大概长什么样」,跨机器人数据能教会模型「操作的通用规律」,两者结合能让模型在没见过的新环境里也不至于两眼一抹黑。
真机测试用的是双臂各 6 自由度的机械臂加全向移动底座的平台,本体状态是 14 维、动作空间是 17 维——一个具备移动能力的双臂机器人,能在房间里走动、伸手够到不同高度的物体,而不是固定在某个工位上的机械臂。
评测任务是让机器人在训练阶段完全没见过的新家庭、新卧室里完成打扫厨房、整理卧室这类长程、多阶段任务,单次执行可以持续 10 到 15 分钟,中间要完成拿取、挪动、归位等一连串子步骤,任何一步出错都可能导致整个任务失败。
官方给出的消融实验数据显示,完整模型在这些陌生环境里的整体任务成功率约为 94%;如果去掉网络数据协同训练,成功率降到约 74%;如果再去掉高层子任务预测(也就是模型对「接下来该做什么」的语义层规划能力),成功率会大幅跌到约 31%。这组对比数据说明,让机器人在开放世界里泛化,靠的不是某一个单一技巧,而是多种数据来源和多层次能力叠加的结果。
| 真机构型 | 双臂各 6 自由度 ARX 机械臂 + 全向移动底座(Mobile 平台),14 维本体状态、17 维动作空间 | 官方口径(Physical Intelligence 论文/博客) |
| 开放世界泛化成功率 | 在训练时从未见过的新家庭/新卧室环境中,完整模型整体任务成功率约 94%;去掉网络数据协同训练后降到约 74%,去掉高层子任务预测后降到约 31% | 官方口径(Physical Intelligence 官网博客 pi05) |
| 任务类型 | 长程、多阶段收拾任务(如清理厨房/卧室),单次执行可达 10–15 分钟 | arXiv:2504.16054 |
这类真机成功率数字最大的软肋是难以在不同团队之间横向比较。机器人仿真公司 Bifrost AI 在一篇评测方法论博客(2026 年 7 月)中指出,目前行业里大量真机评测遵循的做法是:在固定超时时间内跑不到 25 次试验,报一个二值化的成功率,既不给置信区间,也不做配对统计检验——这样的样本量按统计学要求本来就不足以支撑可靠的排名结论,而且几乎不可能被实验室之外的团队复现,因为具体的场景布置、物体选择、失败判定标准往往都没有统一标准可依。
同一篇博客给出一个具体例子:70 次 rollout 测得 90% 成功率,其 95% 置信区间可以跨到 80.5% 至 95.9%,足足 15 个百分点宽——即使两个团队都报「90% 成功率」,背后的置信区间可能天差地别;不同团队对「什么算失败」(比如物体没抓稳算不算,超时算不算)的判定尺度也常常不一致。这意味着 π0.5 报告的 94% 这类数字,更适合用来看「相对自己不同配置的提升幅度」(比如加不加网络数据协同训练的对比),而不适合直接拿来和别的团队、别的模型的成功率数字做「谁更强」式的排名比较。