对标 Genie 3 的开源世界模型,把权重和代码一起公开,主打小时级生成时长与更高帧率。
因果预训练 + MoBA,开源对标 Genie 3,主打帧率与时长。
Genie 3 这类实时交互世界模型证明了「无标注视频学出可交互世界」这条路能走通,但它既没有发表论文,也不对外开放权重和代码,外界只能通过官方精选的演示视频远远围观,没法在自己的机器上跑一遍、验证边界在哪里。开源社区一直缺一个真正能下载、能复现、能拿来做二次研发的同类模型。
LingBot-World 2(又称 LingBot-World-Infinity)由蚂蚁集团旗下的具身智能团队灵波科技于 2026 年 7 月 9 日在「蚂蚁灵波开源周」上发布,同时公开了论文、模型权重和推理代码,采用非商用开源协议——这意味着任何人都可以下载模型自己跑,而不只是看官方放出的演示片段。
技术上它用了「因果预训练」范式:让模型按时间先后顺序学习世界如何演变,而不是像很多视频生成模型那样对整段视频做双向建模,目的是减少长时间生成时容易累积的「越往后越走样」的误差。配合一种叫 MoBA 的注意力机制处理长序列,模型能支持小时级的持续生成,而不是像早期交互式世界模型那样只能撑几十秒到几分钟。
官方给出的实时变体规格是 720p 分辨率、60fps,帧率上明显高于 Genie 3 官方公布的 24fps;同时提供 14B(追求效果)和 1.3B(追求单卡可跑的轻量版)两种参数规模的模型,覆盖不同算力条件下的使用需求。它还首次把「智能体」机制引入世界模型,能根据设定的角色行为自动生成环境事件,并支持多个玩家同时进入同一个生成世界互动。
官方宣传材料里直接把它和 Genie 3 摆在一起对比,强调自己在生成时长、动作自由度、语义交互丰富度和视频清晰度等方面全面领先。第三方上手测评也证实了它的可玩性和物理表现令人印象深刻,但同时也记录了明显的短板:当玩家操控角色转身之后再返回原来的位置时,画面里出现了一堵此前并不存在的墙——也就是「空间一致性不足」,这是交互式世界模型的经典难题,测评作者认为体验版为了控制这个问题限制了模型的上下文缓存长度,属于发布前的工程取舍。
| 生成规格 | 实时变体支持 720p 视频流、60fps;小时级超长时程生成 | 官方口径(arXiv:2607.07534) |
| 开源范围 | 14B 与 1.3B 两种参数规模模型权重及推理代码开源(非商用协议),2026-07-09「蚂蚁灵波开源周」首发 | 官方口径 |
| 模型规模 | 14B(主力)+ 1.3B(轻量,单卡可跑) | arXiv:2607.07534 |
「开源对标 Genie 3」这个说法本身就有争议的空间。支持的一方认为,开放权重和代码这件事本身就比闭源演示更有价值:任何人都可以下载下来自己验证效果、复现结果,这是 Genie 3 做不到的,对整个领域的推进意义可能比「哪个模型分数更高」更大。
质疑的一方则指出,官方给出的「全面领先 Genie 3」这类比较,双方并没有跑在同一个公开、标准化的基准测试集上——Genie 3 本身也没有开放到可以被第三方拿来做严格对照实验的程度,双方的评测环境、任务设置、评价标准都是各自挑选的,这种「隔空喊话」式的对比缺少第三方独立复现和第三方裁判介入,读者很难判断这种「领先」在多大程度上站得住脚。目前公开渠道里能看到的还只是官方演示和零星的媒体上手测评,缺少学术界或独立第三方在统一条件下的正式评测数据。