从预测环境,到学习如何行动
World Model
如何走到今天.
如果先在内部模型里试一试,
智能体能否少走弯路?
从 Sutton 的 Dyna 出发,沿着控制、表征预测、交互视频和三维空间四条路线,理解每一步改变了什么。
沿时间线开始阅读 ↓模型预测后果,
决策系统选择行动。
概念示意,非模型推理结果。画面、表征、奖励和三维场景,都可能成为建模对象。
这里把 World Model 理解为:对环境及其变化的内部建模,用于预测、学习、规划或模拟。不同工作对状态、动作和评测的定义不同;本页按具体能力连接它们,不把所有路线视为同一套架构。
THE READING MAP
时间展开,问题分岔。
按公开时间排序,节点间距不代表时间长度。
“逻辑联系”表示阅读关系,不必然表示直接技术继承。
同一年,可以沿着不同问题前进。
下面的箭头表示建议阅读顺序。交叉节点连接多条路线;更晚发表,不意味着解决了更早工作的所有问题。
最值得停下来比较的三个转折
名称相似,预测对象可能完全不同。
选两项工作,检查它们的输入、训练信号与用途。
读完之后,带走一个判断方法
预测得好,
具体帮助了什么?
画面逼真、表征好用、任务成功和空间一致,回答的是不同问题。阅读新论文时,先找它实际验证的那一项。
- 01看预测对象
下一帧、下一状态、特征、奖励,还是三维几何?
- 02找动作的位置
观察中的动作、模型的条件输入、智能体输出,三者是否区分?
- 03追到用途与证据
用于规划、训练策略、理解视频或生成场景?实验是否检验了这个用途?
- 04确认有效范围
用了什么数据、在哪些环境验证、长预测和新场景下有什么限制?
日期、选文与资料说明
这是面向快速理解的精选发展路线,不是完整文献史,也不主张 World Model 起源于 1991 年。保留 Dyna、World Models、PlaNet、MuZero、Dreamer、DreamerV3、Dreamer 4、TD-MPC2、JEPA、I-JEPA、V-JEPA、V-JEPA 2、Genie、Genie 3、DIAMOND、Cosmos,并加入 LingBot-World 与 HY-World 2.0。
日期优先采用预印本首次公开时间;会议或期刊出版年可晚于公开年。V-JEPA 按 2024 年 2 月公开时间排列。Genie 3 引用官方系统介绍,JEPA 2022 是立场论文。LingBot-World 采用 2026 年 1 月报告,HY-World 2.0 采用 2026 年 4 月报告;后续版本不自动替换这些历史节点。
每个节点的原始论文或官方资料支持其事实描述。“逻辑联系”与阅读建议是本页整理者的归纳。页面可离线浏览;原始资料链接需要联网。资料核对:2026-09-08。