把「前沿模型」让位给「世界模型」,把一次性快照改成每月增量。这一期说明改了什么、以后怎么更。
先说改版本身:这个站原来叫「前沿模型学习」,是一份一次性写完就不再更新的快照。这一版把主角换成了世界模型——「前沿基础模型 → 智能体 → 世界模型 → 行动系统」这条叙事线里,世界模型是最容易被忽略、也最考验耐心的一段,六条技术路线(MBRL、JEPA、视频模拟器、具身/VLA、空间智能,加一条起源线)横跨 1990 到 2026 年,很难用一次性快照讲清楚。从这一期开始,站点按月发增量:新模型、新证据、新术语放进对应的内容文件,月报只负责把这个月的变化说清楚——包括「这个月其实没什么好写」这种情况。
落到本月的世界模型进展本身,8 月没有出现类似 DreamerV3、Genie 3 那种改变格局的单点突破。相对有分量的一件事,是做视频生成起家的 LTX(从 Lightricks 拆分出来的公司)在 8 月 11 日发布了 LTX-2.5:一个 220 亿参数、双流架构(视频+音频联合建模)的开放权重模型(官方口径),官方直接把它称为「world model」,支持 720p 到原生 4K、6 到 20 秒的视频片段(官方口径),在两块 NVIDIA GB200 芯片上能把一张图变成 10 秒 720p 视频、耗时约 6.8 秒,快于实时播放速度(VentureBeat 2026-08-11 报道,测试由 LTX 自己在 720p、稳态条件下完成)。它还带了一个面向物理 AI/机器人的预训练检查点,机器人公司 Markov Robotics 联合创始人公开表示正用它来做「让机器人对物理环境建模、跨场景泛化」的工作(roboticsandautomationnews.com 2026-08-13 报道)。
但这条新闻本身就是本站长期强调的那个争议的又一次重演:它究竟是不是「世界模型」?LTX 自己的 Hugging Face 模型卡上写的是「an open world model with open weights」,同时也承认「applicability to emerging domains such as robotics and physical AI is developing」——也就是说,机器人/物理 AI 方向目前更接近「正在发展中」而不是已经成熟可用的能力,这与部分二手报道里「已经带了成熟的物理 AI 检查点」的说法并不完全一致,读者应该以官方模型卡这句更谨慎的表述为准。归根结底,LTX-2.5 首先是一个视频+音频生成模型,「世界模型」这个标签目前主要来自厂商自己的定位,与 Sora、Genie 3 当年面对的质疑是同一个问题:生成得像,不等于理解得对。
本月七个对照组模型都有动态,但没有一个把重心移向「预测物理世界如何演变」这件事。GPT-5.6 Sol(OpenAI,2026-07-09 发布)在 8 月的更新集中在网络安全和成本上:8 月 10 日推出的 GPT-5.6-Cyber 变体在自家安全评测里号称解决了 95% 的题目(官方口径),8 月 21 日起 API 与额度定价又下调了两成以上(官方口径,OpenAI 2026-08-21 公告)——都是数字任务范畴内的优化,没有涉及物理环境建模或机器人部署的新证据。
Claude Fable 5 与 Claude Opus 5(Anthropic)8 月的更新主要是安全侧的调整:官方更新了生物安全防护措施,将生物相关请求的误拦截率降低了约 85%(官方口径),涉及双重用途的生物类请求仍会退回给 Opus 5 处理。两个模型的核心定位——长程自主工作、Computer Use、知识任务——没有变化,仍然是通过观察屏幕反馈来行动,而不是维护一个可供反事实推演的环境状态。
Kimi K3(Moonshot,2.8T 参数,官方口径)在 7 月底完成完整权重发布;GLM-5.3(智谱,2026-08-14 发布,官方口径 z.ai/blog/glm-5.3)则在同一套基座上做了强化学习后训练,重点提升编程、Agent 环境和网络安全能力(在自家 CyberGym 基准上刷到新高,官方口径)——GLM-5.3 目前已可通过 API 正式访问,但权重截至 2026-08-26 仍未公开,官方称因安全能力具双重用途、需完成额外安全评估后再开放(官方口径;Hugging Face zai-org 组织下最新仍为 GLM-5.2)。检索范围内没有找到这两个模型在物理理解、具身能力上的专门更新。
本月对照组新收两条,都来自开放阵营,也都在 8 月发布。深度求索的 DeepSeek-V4-Pro-0813 是 1.7 万亿参数、MIT 协议的开放权重模型,官方称其「广泛可比于最强的专有模型」,自报 Terminal Bench 2.1 得分 87.9(官方口径,Hugging Face 模型卡,无第三方复现)——MIT 是目前开放阵营里最宽松的许可,这一点比分数更值得记。阿里的 Qwen3.8-2.4T-A95B 则是 Qwen 首次把 Max 级模型直接开放:2.4 万亿总参数、950 亿激活,原生 262,144 token 上下文可扩展到 1,010,000(官方口径,Hugging Face 模型卡),但它用的是自定义的 qwen3.8-max 协议,而非 Qwen3/Qwen3.5 主线的 Apache 2.0。
把这两条与 GLM-5.3 权重迟迟不放、万相 Wan 自 2.2 之后不再开源放在一起看,本月开放阵营呈现的是一条分叉而不是一条趋势:有人把最强的模型用最宽松的协议放出来,有人一边发布一边收紧。「开源」正在从一种立场退化成一种逐次决策。
汇总下来:本月七个对照组模型的动态清一色落在成本、速度、安全护栏和数字任务能力这几件事上,没有一个模型给出新的、可核对的证据表明自己在往「维护显式物理环境状态」这个方向移动——各自的 gap 描述在本月依然成立。
从这一期起,月报多一个固定栏目。原因是上面那一栏问的「通用大模型离世界模型更近了吗」,答案长期是「没有」——逐月复核 gap 是必要的,但只写这一问,一年十二期都是同一句话。真正每月有料的是对称的另一问:前沿侧发生的事,有没有传导到世界模型这边。这些东西挂不到模型库上,它们是协议、方法和议题,所以单开了一页「交叉地带」,本月首发两条。
第一条是递归自我改进(RSI)。它和世界模型的关联方向与直觉相反:不是 RSI 顺带产生世界模型,而是世界模型很可能是 RSI 走出数字域的前置条件。RSI 之所以先在代码和数学上发生,是因为那两个领域有便宜可靠的验证器——一篇梳理了 1250 篇论文的综述把评估器排成强弱序列,最强是形式化验证器,最弱是模型的内省式自评(arXiv:2607.07663)。物理世界没有便宜的验证器,而这正是世界模型被期待去填的位置。这条关联本月拿到了实测数字:《World Action Verifier》把状态预测拆成「状态是否合理」与「动作是否可达」两个更容易的验证任务,世界模型学习的样本效率提高约 2 倍、下游策略表现提升约 18%,并同时拿下 ICLR 2026 World Models 工作坊的 Outstanding Paper 与 RSI 工作坊的 Spotlight。
第二条是 Anthropic 于 8 月 27 日发布研究预览的 Model Hardware Standard(MHS),可以理解成「物理版的 MCP」:用 read/write 这样一组极简原语加上标准化的设备发现格式,让智能体直接操作显微镜、液体处理器、机械臂,官方称硬件集成工作可从数周压缩到数小时(官方口径)。必须说清楚的是它的层级——MHS 是接口,不是能力,它不预测任何东西。但它冲着的正是能力矩阵里最空的那一列「真实世界」:那一列之所以空,是因为填它需要真机数据,而真机数据贵在机器人本身和把模型接到机器人上的定制集成。它现在只是研究预览、尚未开源,强度只能给到「有论证,无实验」——它是否在年底前真的开源、有多少设备厂商实际实现,是可以逐月核对的事实,会跟。