世界模型WORLD MODELS · 月更
MONTHLY · 2026-08

创刊号:世界模型志改版,从此按月更新

把「前沿模型」让位给「世界模型」,把一次性快照改成每月增量。这一期说明改了什么、以后怎么更。

本月最重要的一件事

先说改版本身:这个站原来叫「前沿模型学习」,是一份一次性写完就不再更新的快照。这一版把主角换成了世界模型——「前沿基础模型 → 智能体 → 世界模型 → 行动系统」这条叙事线里,世界模型是最容易被忽略、也最考验耐心的一段,六条技术路线(MBRL、JEPA、视频模拟器、具身/VLA、空间智能,加一条起源线)横跨 1990 到 2026 年,很难用一次性快照讲清楚。从这一期开始,站点按月发增量:新模型、新证据、新术语放进对应的内容文件,月报只负责把这个月的变化说清楚——包括「这个月其实没什么好写」这种情况。

落到本月的世界模型进展本身,8 月没有出现类似 DreamerV3、Genie 3 那种改变格局的单点突破。相对有分量的一件事,是做视频生成起家的 LTX(从 Lightricks 拆分出来的公司)在 8 月 11 日发布了 LTX-2.5:一个 220 亿参数、双流架构(视频+音频联合建模)的开放权重模型(官方口径),官方直接把它称为「world model」,支持 720p 到原生 4K、6 到 20 秒的视频片段(官方口径),在两块 NVIDIA GB200 芯片上能把一张图变成 10 秒 720p 视频、耗时约 6.8 秒,快于实时播放速度(VentureBeat 2026-08-11 报道,测试由 LTX 自己在 720p、稳态条件下完成)。它还带了一个面向物理 AI/机器人的预训练检查点,机器人公司 Markov Robotics 联合创始人公开表示正用它来做「让机器人对物理环境建模、跨场景泛化」的工作(roboticsandautomationnews.com 2026-08-13 报道)。

但这条新闻本身就是本站长期强调的那个争议的又一次重演:它究竟是不是「世界模型」?LTX 自己的 Hugging Face 模型卡上写的是「an open world model with open weights」,同时也承认「applicability to emerging domains such as robotics and physical AI is developing」——也就是说,机器人/物理 AI 方向目前更接近「正在发展中」而不是已经成熟可用的能力,这与部分二手报道里「已经带了成熟的物理 AI 检查点」的说法并不完全一致,读者应该以官方模型卡这句更谨慎的表述为准。归根结底,LTX-2.5 首先是一个视频+音频生成模型,「世界模型」这个标签目前主要来自厂商自己的定位,与 Sora、Genie 3 当年面对的质疑是同一个问题:生成得像,不等于理解得对。

对照组观察:通用大模型自己变成世界模型了吗

本月七个对照组模型都有动态,但没有一个把重心移向「预测物理世界如何演变」这件事。GPT-5.6 Sol(OpenAI,2026-07-09 发布)在 8 月的更新集中在网络安全和成本上:8 月 10 日推出的 GPT-5.6-Cyber 变体在自家安全评测里号称解决了 95% 的题目(官方口径),8 月 21 日起 API 与额度定价又下调了两成以上(官方口径,OpenAI 2026-08-21 公告)——都是数字任务范畴内的优化,没有涉及物理环境建模或机器人部署的新证据。

Claude Fable 5 与 Claude Opus 5(Anthropic)8 月的更新主要是安全侧的调整:官方更新了生物安全防护措施,将生物相关请求的误拦截率降低了约 85%(官方口径),涉及双重用途的生物类请求仍会退回给 Opus 5 处理。两个模型的核心定位——长程自主工作、Computer Use、知识任务——没有变化,仍然是通过观察屏幕反馈来行动,而不是维护一个可供反事实推演的环境状态。

Kimi K3(Moonshot,2.8T 参数,官方口径)在 7 月底完成完整权重发布;GLM-5.3(智谱,2026-08-14 发布,官方口径 z.ai/blog/glm-5.3)则在同一套基座上做了强化学习后训练,重点提升编程、Agent 环境和网络安全能力(在自家 CyberGym 基准上刷到新高,官方口径)——GLM-5.3 目前已可通过 API 正式访问,但权重截至 2026-08-26 仍未公开,官方称因安全能力具双重用途、需完成额外安全评估后再开放(官方口径;Hugging Face zai-org 组织下最新仍为 GLM-5.2)。检索范围内没有找到这两个模型在物理理解、具身能力上的专门更新。

本月对照组新收两条,都来自开放阵营,也都在 8 月发布。深度求索的 DeepSeek-V4-Pro-0813 是 1.7 万亿参数、MIT 协议的开放权重模型,官方称其「广泛可比于最强的专有模型」,自报 Terminal Bench 2.1 得分 87.9(官方口径,Hugging Face 模型卡,无第三方复现)——MIT 是目前开放阵营里最宽松的许可,这一点比分数更值得记。阿里的 Qwen3.8-2.4T-A95B 则是 Qwen 首次把 Max 级模型直接开放:2.4 万亿总参数、950 亿激活,原生 262,144 token 上下文可扩展到 1,010,000(官方口径,Hugging Face 模型卡),但它用的是自定义的 qwen3.8-max 协议,而非 Qwen3/Qwen3.5 主线的 Apache 2.0。

把这两条与 GLM-5.3 权重迟迟不放、万相 Wan 自 2.2 之后不再开源放在一起看,本月开放阵营呈现的是一条分叉而不是一条趋势:有人把最强的模型用最宽松的协议放出来,有人一边发布一边收紧。「开源」正在从一种立场退化成一种逐次决策。

汇总下来:本月七个对照组模型的动态清一色落在成本、速度、安全护栏和数字任务能力这几件事上,没有一个模型给出新的、可核对的证据表明自己在往「维护显式物理环境状态」这个方向移动——各自的 gap 描述在本月依然成立。

交叉地带:前沿侧这个月递了什么过来

从这一期起,月报多一个固定栏目。原因是上面那一栏问的「通用大模型离世界模型更近了吗」,答案长期是「没有」——逐月复核 gap 是必要的,但只写这一问,一年十二期都是同一句话。真正每月有料的是对称的另一问:前沿侧发生的事,有没有传导到世界模型这边。这些东西挂不到模型库上,它们是协议、方法和议题,所以单开了一页「交叉地带」,本月首发两条。

第一条是递归自我改进(RSI)。它和世界模型的关联方向与直觉相反:不是 RSI 顺带产生世界模型,而是世界模型很可能是 RSI 走出数字域的前置条件。RSI 之所以先在代码和数学上发生,是因为那两个领域有便宜可靠的验证器——一篇梳理了 1250 篇论文的综述把评估器排成强弱序列,最强是形式化验证器,最弱是模型的内省式自评(arXiv:2607.07663)。物理世界没有便宜的验证器,而这正是世界模型被期待去填的位置。这条关联本月拿到了实测数字:《World Action Verifier》把状态预测拆成「状态是否合理」与「动作是否可达」两个更容易的验证任务,世界模型学习的样本效率提高约 2 倍、下游策略表现提升约 18%,并同时拿下 ICLR 2026 World Models 工作坊的 Outstanding Paper 与 RSI 工作坊的 Spotlight。

第二条是 Anthropic 于 8 月 27 日发布研究预览的 Model Hardware Standard(MHS),可以理解成「物理版的 MCP」:用 read/write 这样一组极简原语加上标准化的设备发现格式,让智能体直接操作显微镜、液体处理器、机械臂,官方称硬件集成工作可从数周压缩到数小时(官方口径)。必须说清楚的是它的层级——MHS 是接口,不是能力,它不预测任何东西。但它冲着的正是能力矩阵里最空的那一列「真实世界」:那一列之所以空,是因为填它需要真机数据,而真机数据贵在机器人本身和把模型接到机器人上的定制集成。它现在只是研究预览、尚未开源,强度只能给到「有论证,无实验」——它是否在年底前真的开源、有多少设备厂商实际实现,是可以逐月核对的事实,会跟。

一句话速览

  • Genie 3 于 2026-01-29 起以 Project Genie 形式向美国 Google AI Ultra 订阅用户开放,单次生成上限 60 秒,至今未发表技术论文。官方口径(Google DeepMind 博客 blog.google/.../project-genie/)
  • LTX 于 2026-08-11 发布开放权重视频/世界模型 LTX-2.5(220 亿参数),并提供面向机器人与物理 AI 的预训练检查点。官方口径(huggingface.co/Lightricks/LTX-2.5);VentureBeat 2026-08-11 报道
  • GLM-5.3 于 2026-08-14 发布,在同一基座上做强化学习后训练,重点提升编程、Agent 环境与网络安全能力,未见世界模型/物理理解方向的专门更新。官方口径(z.ai/blog/glm-5.3)
  • GPT-5.6-Cyber(Daybreak Blue/Red)于 2026-08-10 发布,官方称在自家网络安全评测中解决了 95% 的题目。官方口径(OpenAI)
  • Anthropic 于 2026 年 8 月更新生物安全防护措施,官方称误拦截率降低约 85%,双重用途生物类请求仍退回 Opus 5 处理。官方口径(Anthropic)
  • 阿里万相 Wan3.0 于 2026-08-06 开启公测,单次可生成 30 秒视频并支持 doc/ppt/pdf 等文档输入,但未开源——Hugging Face 的 Wan-AI 组织下最新仍是 2025 年 7 月以 Apache 2.0 开源的 Wan2.2。官方口径(通义实验室发布公告);开源状态为本站 2026-08-28 直接查证 huggingface.co/Wan-AI
  • DeepSeek-V4-Pro-0813(1.7T 参数,MIT 协议)与 Qwen3.8-2.4T-A95B(2.4T 总参 / 95B 激活)先后于 8 月以开放权重发布,两者均已收入对照组。官方口径(Hugging Face 模型卡 deepseek-ai/DeepSeek-V4-Pro-0813、Qwen/Qwen3.8-2.4T-A95B)
  • 字节 Seedance 2.0 论文题为《Advancing Video Generation for World Complexity》,但摘要通篇未涉及物理模拟、因果或世界建模——「world」在标题里,证据不在论文里。arXiv:2604.14148(本站通读摘要核对)
本月数据增量 · 自动聚合
新增模型 · 47
可微 RNN 世界模型好奇心机制World ModelsPlaNetDreamerV1DreamerV2DreamerV3DIAMONDI-JEPAV-JEPAV-JEPA 2SoraGenie 1GameNGenOasisGenie 3Hunyuan-GameCraftKling 可灵万相 Wan2.2万相 Wan3.0Seedance 2.0LingBot-WorldLingBot-World 2RT-1RT-2OpenVLAπ0π0.5CosmosGR00T N11X World ModelGAIA-1GAIA-2GR-3LingBot-VALingBot-VLA 2NeRF3DGSMarbleHunyuanWorldGPT-5.6 SolClaude Fable 5Claude Opus 5Kimi K3GLM-5.3DeepSeek-V4-ProQwen3.8-2.4T-A95B
能力矩阵变动 · 25
  • World Models · 时序一致性🟢 有公开数据arXiv:1803.10122
  • World Models · 动作可控性🟡 有演示无数据arXiv:1803.10122
  • World Models · 规划与反事实🟢 有公开数据arXiv:1803.10122
  • DreamerV3 · 时序一致性🟢 有公开数据arXiv:2301.04104
  • DreamerV3 · 动作可控性🟡 有演示无数据arXiv:2301.04104
  • DreamerV3 · 规划与反事实🟢 有公开数据arXiv:2301.04104
  • V-JEPA 2 · 时序一致性🟢 有公开数据arXiv:2506.09985
  • V-JEPA 2 · 动作可控性🟢 有公开数据arXiv:2506.09985
  • V-JEPA 2 · 规划与反事实🟢 有公开数据arXiv:2506.09985
  • V-JEPA 2 · 真机迁移🟢 有公开数据arXiv:2506.09985
  • Sora · 时序一致性🟡 有演示无数据官方口径
  • Sora · 物理合理性🟡 有演示无数据官方口径
  • Genie 3 · 时序一致性🟡 有演示无数据官方口径(Google DeepMind 博客)
  • Genie 3 · 动作可控性🟡 有演示无数据官方口径(Google DeepMind 博客)
  • Genie 3 · 长程记忆🟡 有演示无数据官方口径(Google DeepMind 博客)
  • LingBot-World 2 · 时序一致性🟡 有演示无数据arXiv:2607.07534
  • LingBot-World 2 · 动作可控性🟡 有演示无数据arXiv:2607.07534
  • LingBot-World 2 · 物理合理性🟡 有演示无数据第三方实测(爱范儿 ifanr.com/1671406)
  • LingBot-World 2 · 长程记忆🟡 有演示无数据arXiv:2607.07534;第三方实测(爱范儿 ifanr.com/1671406)
  • π0.5 · 时序一致性🟢 有公开数据arXiv:2504.16054
  • π0.5 · 动作可控性🟢 有公开数据arXiv:2504.16054
  • π0.5 · 规划与反事实🟡 有演示无数据官方口径(Physical Intelligence 官网博客 pi05)
  • π0.5 · 真机迁移🟢 有公开数据arXiv:2504.16054
  • Marble · 物理合理性🟡 有演示无数据官方口径(World Labs 博客)
  • Marble · 长程记忆🟡 有演示无数据官方口径(World Labs 博客)
新增时间线节点 · 19
  • 1990《Making the world differentiable》
  • 1991好奇心与内在动机
  • 2018Ha & Schmidhuber《World Models》
  • 2017–22Transformer → 指令模型 → ChatGPT
  • 2019–25PlaNet → Dreamer V1/V2/V3 → V4
  • 2020/23NeRF 与 3D Gaussian Splatting
  • 2022LeCun 蓝图与 JEPA 登场
  • 2024 · 2月Sora 与 Genie 1 同月发布
  • 2024 · 8月GameNGen:神经网络跑 DOOM
  • 2024 · 9–12月World Labs 成立 · Oasis · Genie 2
  • 2025 · 1月NVIDIA Cosmos 发布(CES)
  • 2025 · 6–8月V-JEPA 2 · Genie 3
  • 2025 · 11月Marble 发布 · LeCun 离开 Meta
  • 2026 · 6–8月Fable 5 · GPT-5.6 · Opus 5
  • 2026 · 7–8月Kimi K3 开放 · GLM-5.3 发布
  • 2026 · 1月/7月LingBot 开源周
  • 2026 · 3月AMI Labs 10.3 亿美元种子轮
  • 2026 · 8月开放阵营分叉:DeepSeek-V4-Pro / Qwen3.8 开放,Wan3.0 收紧
  • 2026 · 6月李飞飞《A Functional Taxonomy of World Models》
交叉地带 · 2
  • 递归自我改进🟢 有实测数据
    方向和直觉相反:不是 RSI 顺带产生世界模型,而是世界模型是 RSI 走出数字域的前置条件——因为物理世界没有便宜的验证器。
  • 物理版 MCP:Model Hardware Standard🔵 有论证,无实验
    它一行动力学预测能力都不提供,但它降低的恰恰是能力矩阵「真实世界」那一列最贵的东西——把模型接到真机上的成本。
新机构 · Google DeepMind新机构 · Google Brain新机构 · Meta AI(FAIR)新机构 · OpenAI新机构 · NVIDIA新机构 · World Labs新机构 · Physical Intelligence新机构 · Wayve新机构 · 1X Technologies新机构 · Decart / Etched新机构 · 蚂蚁灵波新机构 · 腾讯混元新机构 · 快手可灵新机构 · 慕尼黑工大 / IDSIA新机构 · 斯坦福大学新机构 · 加州大学伯克利分校新机构 · Inria 等新机构 · 日内瓦大学 / 爱丁堡大学新机构 · Anthropic新机构 · 月之暗面新机构 · 智谱 AI新机构 · 深度求索新机构 · 阿里通义新机构 · 字节跳动 Seed新术语 · 世界模型新术语 · 循环状态空间模型新术语 · 联合嵌入预测架构新术语 · 潜在动作模型新术语 · 视觉-语言-动作模型新术语 · 3D 高斯泼溅新术语 · 梦境训练新术语 · 模型驱动强化学习新术语 · 隐空间新术语 · 变分自编码器新术语 · 混合密度网络新术语 · 自监督学习新术语 · 表征坍缩新术语 · 遮挡预测新术语 · 扩散模型新术语 · 自回归生成新术语 · 时序一致性新术语 · 帧率与分辨率的口径问题新术语 · 神经网络游戏引擎新术语 · 模仿学习新术语 · 动作分块新术语 · 逆动力学新术语 · 真机泛化新术语 · 遥操作数据新术语 · 仿真到现实迁移新术语 · 神经辐射场新术语 · 新视角合成新术语 · 点云与网格新术语 · 场景持久性新术语 · 基准测试的可比性新术语 · 官方口径新术语 · 递归自我改进新术语 · 验证器新术语 · 模型硬件标准新术语 · 开放权重与开源的区别
← 回到月报归档
数据增量由 addedIn / updatedIn 字段自动聚合,不需要人工维护。术语表 →最后更新 2026-08