世界模型WORLD MODELS
路线 0 · ORIGIN

1990 年,慕尼黑: 让世界变得可微分

1990 — 1991代表:可微 RNN 世界模型 · 好奇心机制
§1 起源故事

1990 年,慕尼黑工业大学一份编号 FKI-126-90 的技术报告悄悄出版,标题野心勃勃:《Making the world differentiable》——让世界可微分。作者 Jürgen Schmidhuber 提出了一个在当时看来近乎空想的架构:用一个循环神经网络(RNN)充当世界模型 M,从过去的动作与观测序列中预测未来的感官输入(连奖励信号一起预测);再让另一个控制器 C 借助 M 的内部表征来学习行为。预测器 + 控制器,这对搭档后来成了所有模型驱动强化学习的原型。

第二年他更进一步:如果智能体主动往预测误差大的地方走呢?《Curious model-building control systems》(1991)给了智能体一种内在动机——好奇心。学习的动力不再只来自外部奖励,还来自「惊讶」本身。这两篇论文在此后近三十年里少有人问津,直到算力与数据追上了想法;而 Schmidhuber 本人则把大半生用来提醒世界:这些点子我早就发表过。优先权之争成了他公众形象的一部分,也是理解这段历史绕不开的一把钥匙。

§2 核心原理图解
世界
观测 + 奖励
RNN 预测器 M
预测下一时刻感官输入
内部表征
对世界的压缩理解
控制器 C
借助 M 学习行为
动作
作用于世界
动作改变世界,闭环继续
M + C 范式(Schmidhuber 1990):预测世界的模块与利用预测行动的模块分工合作
§3 代表模型
可微 RNN 世界模型
慕尼黑工大 · 1990
「世界模型」术语进入机器学习的起点:RNN 从动作与观测序列预测未来感官输入。
M + C 范式FKI-126-90
好奇心机制
Schmidhuber · 1991
《Curious model-building control systems》:预测误差即内在奖励,智能体主动探索。
内在动机开山IJCNN 1991
完整档案与筛选见 模型库 →
§4 权威视频
YouTube ▶
Schmidhuber × Lex Fridman #11
访谈 · 英语 · 看点:LSTM 之父亲述世界模型、创造力理论与「一切始于 1990」
✓ 已核验 2026-07-20
本站只展示经核验的视频链接;未核验资源一律不上线。
§5 这条路线的赌注与软肋
赌注 THE BET
预测器 + 控制器可以从预测误差中「免费」获得学习信号——不需要人类标注,世界本身就是老师。这个赌注在三十年后被证明是对的。
软肋 THE WEAKNESS
想法早生了三十年:1990 年的算力与数据撑不起 RNN 世界模型,论文长期无人问津。而当想法终于被验证时,署名权与引用又成了旷日持久的争论。
下一条路线:路线 1 · 经典模型驱动强化学习统一模板:起源 → 原理 → 模型 → 视频 → 赌注与软肋