世界模型WORLD MODELS · 月更
路线3 视频模拟器 · MODEL

LingBot-World 2

蚂蚁灵波2026-07开放权重

对标 Genie 3 的开源世界模型,把权重和代码一起公开,主打小时级生成时长与更高帧率。

因果预训练 + MoBA,开源对标 Genie 3,主打帧率与时长。

它解决了什么问题

Genie 3 这类实时交互世界模型证明了「无标注视频学出可交互世界」这条路能走通,但它既没有发表论文,也不对外开放权重和代码,外界只能通过官方精选的演示视频远远围观,没法在自己的机器上跑一遍、验证边界在哪里。开源社区一直缺一个真正能下载、能复现、能拿来做二次研发的同类模型。

怎么做的

LingBot-World 2(又称 LingBot-World-Infinity)由蚂蚁集团旗下的具身智能团队灵波科技于 2026 年 7 月 9 日在「蚂蚁灵波开源周」上发布,同时公开了论文、模型权重和推理代码,采用非商用开源协议——这意味着任何人都可以下载模型自己跑,而不只是看官方放出的演示片段。

技术上它用了「因果预训练」范式:让模型按时间先后顺序学习世界如何演变,而不是像很多视频生成模型那样对整段视频做双向建模,目的是减少长时间生成时容易累积的「越往后越走样」的误差。配合一种叫 MoBA 的注意力机制处理长序列,模型能支持小时级的持续生成,而不是像早期交互式世界模型那样只能撑几十秒到几分钟。

官方给出的实时变体规格是 720p 分辨率、60fps,帧率上明显高于 Genie 3 官方公布的 24fps;同时提供 14B(追求效果)和 1.3B(追求单卡可跑的轻量版)两种参数规模的模型,覆盖不同算力条件下的使用需求。它还首次把「智能体」机制引入世界模型,能根据设定的角色行为自动生成环境事件,并支持多个玩家同时进入同一个生成世界互动。

官方宣传材料里直接把它和 Genie 3 摆在一起对比,强调自己在生成时长、动作自由度、语义交互丰富度和视频清晰度等方面全面领先。第三方上手测评也证实了它的可玩性和物理表现令人印象深刻,但同时也记录了明显的短板:当玩家操控角色转身之后再返回原来的位置时,画面里出现了一堵此前并不存在的墙——也就是「空间一致性不足」,这是交互式世界模型的经典难题,测评作者认为体验版为了控制这个问题限制了模型的上下文缓存长度,属于发布前的工程取舍。

关键数字 · 来源可溯
生成规格实时变体支持 720p 视频流、60fps;小时级超长时程生成官方口径(arXiv:2607.07534)
开源范围14B 与 1.3B 两种参数规模模型权重及推理代码开源(非商用协议),2026-07-09「蚂蚁灵波开源周」首发官方口径
模型规模14B(主力)+ 1.3B(轻量,单卡可跑)arXiv:2607.07534
能力证据 · 记录证据强度,不是能力强弱
时序一致性有演示无数据
论文摘要称因果预训练配合 MoBA 注意力可支持『unbounded interaction horizon』的小时级持续生成,但 60fps 衡量的是吞吐而非时序一致性本身,论文未给出独立的场景一致性量化指标。
arXiv:2607.07534
动作可控性有演示无数据
论文摘要描述 pilot agent 负责规划角色行为、director agent 负责合成新环境元素,并支持多名玩家同时进入同一世界互动,但这是架构层面的定性描述,没有单独的可控性量化指标。
arXiv:2607.07534
物理合理性有演示无数据
第三方实测认为可玩性与物理表现令人印象深刻,但为主观定性评价,没有公开的物理合规性/碰撞基准数字。
第三方实测(爱范儿 ifanr.com/1671406)
长程记忆有演示无数据
官方展示多人同时进入同一持续生成的世界互动,但第三方实测记录了转身返回后出现此前不存在的墙这一空间不一致问题(官方称为体验版工程限制),暂无量化场景一致性数字。
arXiv:2607.07534;第三方实测(爱范儿 ifanr.com/1671406)
规划与反事实未涉及
真机迁移未涉及
争议与软肋

「开源对标 Genie 3」这个说法本身就有争议的空间。支持的一方认为,开放权重和代码这件事本身就比闭源演示更有价值:任何人都可以下载下来自己验证效果、复现结果,这是 Genie 3 做不到的,对整个领域的推进意义可能比「哪个模型分数更高」更大。

质疑的一方则指出,官方给出的「全面领先 Genie 3」这类比较,双方并没有跑在同一个公开、标准化的基准测试集上——Genie 3 本身也没有开放到可以被第三方拿来做严格对照实验的程度,双方的评测环境、任务设置、评价标准都是各自挑选的,这种「隔空喊话」式的对比缺少第三方独立复现和第三方裁判介入,读者很难判断这种「领先」在多大程度上站得住脚。目前公开渠道里能看到的还只是官方演示和零星的媒体上手测评,缺少学术界或独立第三方在统一条件下的正式评测数据。

原始材料
论文
它在谱系里的位置
← 回到模型库
指标来源性质:论文实测标 arXiv 号;厂商宣称标「官方口径」。术语表 →最后更新 2026-08