1990 年,慕尼黑工业大学一份编号 FKI-126-90 的技术报告悄悄出版,标题野心勃勃:《Making the world differentiable》——让世界可微分。作者 Jürgen Schmidhuber 提出了一个在当时看来近乎空想的架构:用一个循环神经网络(RNN)充当世界模型 M,从过去的动作与观测序列中预测未来的感官输入(连奖励信号一起预测);再让另一个控制器 C 借助 M 的内部表征来学习行为。预测器 + 控制器,这对搭档后来成了所有模型驱动强化学习的原型。
第二年他更进一步:如果智能体主动往预测误差大的地方走呢?《Curious model-building control systems》(1991)给了智能体一种内在动机——好奇心。学习的动力不再只来自外部奖励,还来自「惊讶」本身。这两篇论文在此后近三十年里少有人问津,直到算力与数据追上了想法;而 Schmidhuber 本人则把大半生用来提醒世界:这些点子我早就发表过。优先权之争成了他公众形象的一部分,也是理解这段历史绕不开的一把钥匙。