世界模型(World Model)
世界模型是指智能体在内部建立的一套”世界如何运转”的模型,让它能预测”如果我做了 X,接下来会发生什么”——不用真的去做,在脑子里就能”推演”后果。它是规划、想象、深谋远虑的基础,也被很多人(包括 Yann LeCun)看作通往更高级自主 Agent / AGI 的关键缺口。
本质:把外部环境的”运行规律(动力学)“压进模型内部,于是智能体可以离线地在想象中试错,而不必事事在真实世界里付出代价。
一句话类比:你过马路不会真的走上去试试会不会被撞。 脑子里有个世界模型——车速多快、多久到、我走过去几秒——你在想象里预演一遍,推断”现在走安全”,才迈步。这个”在脑内预演后果”的能力,就是世界模型。
0. 统一视角:智能体的”三重建模”
世界模型不是孤立概念,它和你研究线里的两块拼成一张图。智能的核心母题就是建立内部模型来预测:
| 建模对象 | 概念 | 笔记 |
|---|---|---|
| 外部环境 | 世界模型 (World Model) | 本篇 |
| 他人的心智 | 心智理论 (ToM) | ../research/emotional-intelligence/theory-of-mind.md |
| 自己 | 自我模型 / 自我认知 | ../research/emotional-intelligence/emotion-as-skill.md KP4/5 |
一个真正通用的 Agent 三样都需要:懂世界(才能规划)、懂别人(才能协作)、懂自己(才能反思)。三者共享同一个机制——用内部模型预测外部。
1. 核心价值:预测 → 想象 → 规划
有了世界模型,智能体能做两件反应式系统做不到的事:
- 规划 (Planning):在脑内模拟多条行动路径的后果,挑最优的再真正执行(而不是走一步看一步)。
- 样本高效 (Sample Efficiency):大量学习可以在”想象/做梦”里完成,不必在真实环境里反复试错——现实中的试错往往很贵、很慢、甚至危险。
对比:没有世界模型的智能体是反应式 (reactive) 的——看到当前状态直接给动作;有世界模型的是深思式 (deliberative) 的——先在内部推演”如果……那么……”,再决定。
2. 经典结构:V-M-C(Ha & Schmidhuber, 2018)
“世界模型”这个词流行起来很大程度来自这篇论文。它把 Agent 拆成三块:
观察(一帧画面) ─▶ [V 视觉编码] ─▶ 压缩成精简隐向量 z
│
[M 记忆/动态模型] ─▶ 由 z + 历史预测"下一刻的 z"
│ (这就是"世界怎么演变"的模型)
[C 控制器] ─▶ 看 z + M 的状态,输出"做什么动作"
| 模块 | 作用 | 关联 |
|---|---|---|
| V (Vision) | 把高维观察(整张画面)压成低维”要点”向量 | 呼应 embedding_model.md 的表征压缩 |
| M (Memory/Model) | 核心:学环境的动力学——“当前状态 + 动作 → 下一状态” | 世界模型的”模型”就在这 |
| C (Controller) | 很小的决策模块,基于前两者选动作 | 呼应 agent.md 的决策 |
论文的惊艳演示:Agent 可以完全在自己学出来的”梦境”(世界模型模拟的环境)里训练,再把学到的策略搬回真实环境,居然能用。这就是”在想象里学习”的雏形。
3. 关键分野:Model-Based vs Model-Free(强化学习)
世界模型最直接的战场是强化学习 (RL),核心区分:
| 无模型 (Model-Free) | 有模型 (Model-Based,用世界模型) | |
|---|---|---|
| 怎么学 | 直接试错,记”什么状态做什么动作得分高” | 先学环境模型,再用它推演/规划 |
| 样本效率 | 低,要海量真实交互 | 高,能在想象里练 |
| 稳定性 | 通常更稳 | 依赖模型质量,模型错则规划错 |
| 代表 | DQN、PPO | Dreamer 系列、MuZero |
MuZero 值得单记:它不需要人告诉它游戏/围棋规则,而是自己学出一个”够用来规划”的世界模型,再在脑内搜索最优招法。AlphaGo → MuZero 这条线,内核就是”世界模型 + 前瞻搜索”。
4. 和大模型(LLM / Agent)的关系——争论最热处
这块直接连到 Agent,而且和 ToM 那场争论同构。
问题:大语言模型内部有没有”世界模型”?
| 观点 | 主张 | 证据/代表 |
|---|---|---|
| 有,涌现了 | 预测下一个词的训练中,模型自发学出了对世界的内部表征 | Othello-GPT:只喂棋谱文本,模型内部竟自发形成了”棋盘”的表征 |
| 没有,是模式匹配 | 纯预测下一词学到的是语言统计规律,非真正的因果世界模型 | Yann LeCun 的批评;主推 JEPA:在抽象表征空间预测世界,而非逐词/逐像素 |
核心质疑与
../research/emotional-intelligence/theory-of-mind.md第 5 节完全同构:通过行为测试(会下棋、会推理)≠ 真的拥有内部模型?还是高级模式匹配?判断标准之争(看行为 vs 看内部机制)悬而未决——这也是../research/emotional-intelligence/emotion-as-skill.mdKP2”功能 vs 体验”之分的又一次现身。
“世界模型”的新形态:
- Sora / Genie 这类视频生成/可交互环境生成模型,被称为”世界模拟器”——能生成物理上大致合理的画面,似乎隐含了对世界的建模。但”真懂物理”还是”学了表面规律”,同样在争。
5. 为什么 Agent 尤其需要它
呼应 loop_engineering.md 和 ai_predictability.md:
- 当前 LLM Agent 大多是反应式的(看当前状态 → 下一步动作),缺乏深谋远虑。
- 有世界模型的 Agent 能向前推演多步(“我这样改代码,测试会不会挂?部署会不会出问题?”),做真正的规划。
- 更好的世界模型 → 更少的盲目试错 → 行为更可预测(呼应
ai_predictability.md:能预判后果的 Agent 更可控)。
这被不少研究者视作从”会聊天的 LLM”迈向”会办事的自主 Agent”的关键一环。
6. 常见坑 / 误区
- ❌ “世界模型就是 3D 场景/游戏引擎” → 那是显式模拟器;这里的世界模型是学出来的、可能是抽象隐空间的预测模型,不一定长得像世界
- ❌ “LLM 会推理就证明它有世界模型” → 行为通过 ≠ 具备内部模型,可能是模式匹配(见第 4 节,同 ToM 之争)
- ❌ “世界模型 = 强化学习专属” → RL 是主战场,但认知科学的”心智模型”、LLM 的内部表征、视频生成都属这个大概念
- ❌ “有世界模型就一定更好” → 模型不准时,基于它的规划会系统性犯错(garbage in, garbage out);model-free 有时反而更稳
- ❌ “世界模型和 ToM/自我模型没关系” → 三者同构,都是”用内部模型预测外部”,只是建模对象不同(见第 0 节)
7. 延伸阅读 / 关联概念
- 心智理论 (ToM) — 给他人建模,与世界模型同构、争论也同构;见
../research/emotional-intelligence/theory-of-mind.md - 情感是一种技能 — 自我模型作为技能载体,“建模三兄弟”的另一角;见
../research/emotional-intelligence/emotion-as-skill.md - Embedding / 表征 — V 模块压缩观察的思路;见
embedding_model.md - 基座模型 — LLM 有没有世界模型的争论主体;见
foundation_model.md - Loop Engineering — 世界模型让 Agent 从反应式走向规划式;见
loop_engineering.md - AI 可预测性 — 能预判后果的 Agent 更可控;见
ai_predictability.md - 梯度下降 — 世界模型也靠它训练;见
../machine-learning/gradient-descent.md - 强化学习 (RL) / Model-Based RL — 世界模型的主战场(DQN/PPO vs Dreamer/MuZero)
- JEPA (LeCun) — 在抽象表征空间预测的世界模型路线
- Othello-GPT — “语言模型涌现世界模型”的经典证据实验
- 涌现 vs 模式匹配 — “LLM 有没有世界模型”背后的通用争论专篇;见
../research/ai-cognition/emergence-vs-pattern-matching.md