Schmidhuber 的学术根据地,1990/1991 两篇奠基论文的出处。
慕尼黑工业大学与瑞士 IDSIA 研究所,是于尔根·施密德胡伯的学术根据地,也是全站叙事的起点。1990 年他在技术报告《Making the World Differentiable》(编号 FKI-126-90)中提出:用一个循环神经网络(M)学习预测环境接下来会发生什么,再用这个学到的模型训练一个小型控制器(C)在「想象」出的环境里练习决策——这就是三十年后几乎每一个世界模型系统都在重复的 M+C 范式。1991 年他又在 IJCNN 上发表论文,提出用预测误差本身作为内在奖励,让智能体主动探索让自己「意外」的地方,这是好奇心驱动探索机制的开山之作。
这两篇论文本身都不缺发表记录,但在很长时间里几乎无人问津,也几乎没法真正跑起来。核心症结在于:论文设想的「用循环神经网络学习预测世界」,依赖的是能稳定训练深层循环网络的技术,而这项技术当时还不存在——能缓解普通 RNN 训练中梯度消失问题的长短期记忆网络(LSTM),要到 1997 年才由 IDSIA 的霍克赖特与施密德胡伯合作提出(Neural Computation 9(8): 1735–1780);同时代个人电脑和工作站的算力,也远不足以支撑一个训练稳定、效果可信的深度网络。想法比能让它跑起来的硬件和算法,早到了将近三十年。
直到 2018 年,大卫·哈与施密德胡伯合作发表《World Models》,用现代深度学习工具把同一套 M+C 范式重新实现了一遍,「世界模型」这个词才重新回到聚光灯下。施密德胡伯此后多次公开强调,后来几乎所有自称「世界模型」的工作都应该引用他 1990 年的论文——这场优先权之争没有共识,却恰好说明了这个领域的一个特点:不少「全新突破」,往细里刨,常常能挖到几十年前就已经存在的雏形。这条线索,就是理解整个世界模型研究史的钥匙。
1990 年写下《Making the world differentiable》时无人在意;三十年后每一个自称「世界模型」的系统都绕不开他的 M + C 范式。他把大半生用来提醒世界:这些想法我早就发表过——优先权之争成了他公众形象的一部分,也是理解这段历史的钥匙。