博士论文 | 因果归纳偏置如何塑造结构化世界模型

论文题目:Causal Inductive Biases for Learning Structured World Models 作者:Anson Lei 机构:Mansfield College, University of Oxford 学位:Doctor of Philosophy 时间:Michaelmas 2025 论文链接:https://ora.ox.ac.uk/objects/uuid:e14fe66f-83bf-4faa-a658-b87e3a168f55/files/dj38607754

导读

世界模型是强化学习与智能体研究中的核心范式:如果智能体能学习一个环境预测模型,就可以在想象中推演未来,从而进行规划和决策。过去几年,世界模型在游戏、机器人和视觉控制中表现突出,但很多方法仍采用密集、整体式的神经网络结构,把环境动态压缩进一个难解释的黑箱。 这篇 Oxford 博士论文提出一个清晰问题:真实世界往往由稀疏、局部、可复用的因果机制组成,那么世界模型是否也应该显式利用这种结构?作者围绕“因果归纳偏置”展开,试图让模型不仅预测准确,还能更好地适应分布变化、抵抗无关干扰,并提供可解释的内部结构。 论文主体由三条技术路线组成。第一,VCD 将潜在变量学习、稀疏因果图和变分世界模型结合起来,使模型能学习更解耦的表示并进行模块化适应。第二,COMET 用 competition-of-experts 机制学习可复用的独立动力学机制,再在新环境中组合这些机制。第三,SPARTAN 使用稀疏注意力学习局部因果依赖,把结构发现嵌入 Transformer-like 世界模型。最后,论文还把 SPARTAN 扩展到强化学习优势估计和语言模型机制可解释性,展示稀疏结构不只适用于世界模型,也可能成为更通用的可解释建模工具。 这篇论文的价值在于,它没有把世界模型只看作“预测下一个状态”的网络,而是把它看作对环境结构的学习:哪些变量真正相关,哪些机制在不同环境中保持不变,哪些局部交互决定未来。对于希望构建可迁移、可诊断、可解释智能体的人来说,这是一条非常值得关注的路线。

Introduction | 引言

世界模型需要结构

世界模型通常由表示模型、动力学模型和规划或策略学习模块组成。表示模型把高维观测压缩为潜在状态,动力学模型预测潜在状态如何随动作和时间演化,智能体再基于预测结果进行决策。

然而,真实环境并不是一个均质整体。物体之间通常只发生局部交互,一些因果机制在环境变化时保持不变,另一些机制会因干预而改变。比如物体碰撞、弹簧约束、交通参与者之间的相互影响,都具有稀疏性和模块性。 论文认为,如果世界模型能够显式表示这些结构,就能获得三类优势:适应性、鲁棒性和可解释性。适应性来自只更新受干预影响的机制;鲁棒性来自忽略非因果干扰;可解释性来自可以查看潜在变量、机制模块或稀疏注意力边。

论文贡献

作者把论文组织成七章。第 1 章给出动机和贡献,第 2 章回顾世界模型、结构与因果、相关工作;第 3 章提出 Variational Causal Dynamics;第 4 章提出通过竞争学习独立机制的 COMET;第 5 章提出用稀疏 Transformer 学习局部依赖结构的 SPARTAN;第 6 章展示稀疏 Transformer 在世界模型之外的两个案例;第 7 章总结贡献、局限和未来方向。 整体看,论文试图回答三个递进问题:如何学习因果表示,如何学习独立机制,如何发现局部依赖结构。VCD、COMET 和 SPARTAN 分别对应这三个问题。

Background | 背景

从表示到机制

早期世界模型常把观测压缩到一个连续潜在空间,再用递归或前馈动力学网络预测未来。这种方式可以提高计算效率,但潜在变量未必对应真实世界中的可解释因素。对象中心表示学习试图把场景分解为 object slots,让每个 slot 对应一个物体或部件;但仅有对象分解还不够,模型还需要理解对象之间如何交互。 论文将这个问题放入因果建模框架。因果图中的每个变量由父变量和对应机制决定,环境变化常可视为对少数机制的干预。独立因果机制原则认为,不同机制可以相对独立地变化;稀疏机制转移假设进一步指出,分布变化通常只影响少数机制。因此,如果世界模型显式学习稀疏因果结构,就有机会在新环境中只更新必要部分。

三类结构偏置

论文综述了三类关键结构偏置。第一是因果表示学习,即让潜在变量对应真实因素,并让动力学图尽可能稀疏。第二是独立机制学习,即把环境动力学分解为可复用的交互原语。第三是结构发现,即在复杂场景中识别哪些实体之间存在局部依赖。 这些偏置共同指向一个目标:让模型的计算结构更接近世界的生成结构。论文后续三章分别从不同角度实现这一目标。

Variational Causal Dynamics | 变分因果动力学

方法思想

VCD 面向的核心问题是:能否同时学习潜在表示和稀疏因果动力学,使世界模型在环境变化时进行模块化适应?它以潜在状态空间模型为基础,但不把动力学建成一个整体网络,而是把潜在变量视为因果变量,每个变量只依赖其因果父节点。

VCD 的动力学模型由独立机制、稀疏因果依赖和稀疏干预三部分构成。不同环境共享未受干预的机制,只为受干预变量学习环境特定参数。这样,当模型进入新环境时,它不需要整体重训,而是识别变化发生在哪些机制上,并只更新相关部分。

实验结果

作者在二维多体模拟环境上评估 VCD。环境包含多个粒子,粒子之间通过类似弹簧或电磁力的交互影响彼此,动作则对其中一个粒子施加外力。实验包含混合状态观测和图像观测两种设置,并与 RSSM 和 MultiRSSM 比较。

结果显示,VCD 在预测误差上优于整体式 RSSM,并能达到或接近多模型专家式 MultiRSSM 的表现。更重要的是,VCD 学到的表示更解耦,能更准确识别稀疏因果关系和干预目标。论文报告的 modified MCC 中,VCD 在 mixed-state 设置达到 0.975,在 image 设置达到 0.908,均显著高于 RSSM。 这一章的关键结论是:稀疏因果图不仅能提高可解释性,也能作为学习解耦表示和模块化适应的归纳偏置。

Learning Independent Mechanisms via Competition | 通过竞争学习独立机制

为什么需要机制复用

VCD 强调潜在变量和因果图,COMET 则进一步关注动力学机制本身。人类理解世界时,往往会把变化归结为可复用规则:碰撞、堆叠、滚动、吸引、排斥、速度限制等。这些规则可以在不同环境中重新组合。 COMET 的目标是学习一组独立参数化的机制模块,并在新环境中组合它们。它采用两阶段训练:第一阶段是竞争,让多个机制解释来自多环境的数据,预测误差最低的机制获得更新;第二阶段是组合,在新环境中学习如何选择和组合这些已学机制。

适应与解释

COMET 的优势在于,它不是为每个环境训练一套完整动力学模型,也不是用一个整体网络平均所有环境动态,而是学习跨环境可迁移的交互机制。进入新环境后,模型可以少量数据学习机制组合,而不是重学全部动力学。 实验显示,COMET 能在图像观测环境中学习可识别的机制,并在物体数量变化的新环境里用更少样本完成适应。论文也指出,竞争机制并非没有难点:如果初始阶段某些机制过强,可能垄断更新,导致其他机制难以学习;因此 warm-start 和机制有效时间范围等设计会影响训练稳定性。 这一章的贡献在于说明,结构化世界模型不只需要“变量解耦”,也需要“规则解耦”。当环境变化可以被解释为机制重新组合时,机制级模块化比整体参数更新更自然。

Learning Local Dependency Structures with Sparse Transformers | 用稀疏变换器学习局部依赖结构

从全局图到局部图

第 5 章提出 SPARTAN,解决固定全局因果图在复杂物理环境中不够灵活的问题。在真实场景里,并不是所有对象始终相互作用。一个物体在某一时刻只与附近对象产生因果关系,而这种关系会随状态变化。因此,局部、状态依赖的因果图比固定全局图更合适。 SPARTAN 使用稀疏硬注意力来学习对象之间的局部依赖。模型以对象嵌入为输入,通过稀疏注意力选择当前状态下真正相关的父节点,从而把 Transformer 的注意力模式转化为可解释的局部因果结构。

鲁棒性与少样本适应

论文在 Interventional Pong、CREATE 和 Traffic 等环境上评估 SPARTAN。与普通 Transformer 和全局图基线相比,SPARTAN 在保持预测能力的同时,更准确恢复局部因果图,并在少量轨迹适应新环境时表现更好。

论文还通过移除非因果实体来测试鲁棒性。若模型依赖虚假相关,移除无关对象会显著改变预测;如果模型抓住真正因果父节点,则应保持稳定。结果显示,SPARTAN 相比非正则化 Transformer 更能抵抗这类无关干扰。 SPARTAN 的意义在于,它把 Transformer 的强表达能力与因果结构发现结合起来:注意力不再只是可视化工具,而是被稀疏约束塑造成可解释的局部依赖图。

Sparse Transformers Beyond World Models | 世界模型之外的稀疏变换器

强化学习中的优势估计

第 6 章把 SPARTAN 拓展到世界模型之外。第一个案例是强化学习中的 Direct Advantage Estimation。作者使用稀疏 Transformer 从图像 patch 中同时学习价值函数和优势函数,并通过稀疏注意力识别哪些图像区域影响决策。

这种结构带来两个好处。第一,显式优势学习可以改善策略泛化。第二,稀疏注意力让人能够观察模型依赖哪些视觉区域,从而判断策略是否关注真正与任务相关的对象,而不是被外源奖励或无关背景吸引。

语言模型机制解释

第二个案例是语言模型机制可解释性。作者将标准 Transformer 的 dense attention 替换为 SPARTAN 式稀疏硬注意力,并将其作为 post-training 技术用于 GPT-2 和 LLaMA-1B 等模型。实验表明,稀疏模型可以用更少 attention heads 解释相当比例的行为效应。 这说明稀疏注意力不仅可用于物理世界模型,也可能帮助构建更可解释的语言模型内部机制。论文强调这仍是初步探索,但方向很有启发:如果模型计算本身更稀疏、更局部,分析者就更容易定位真正起作用的组件。

Conclusion | 结论

主要贡献

这篇论文围绕一个核心主张展开:当模型计算结构尊重世界中的因果结构时,适应性、鲁棒性和可解释性会自然受益。VCD 展示了如何用稀疏因果图推动表示解耦和模块化适应;COMET 展示了如何通过竞争学习可复用的独立机制;SPARTAN 展示了如何用稀疏注意力发现局部、状态依赖的因果结构。 三者是互补的。VCD 偏向因果表示学习,COMET 偏向机制学习,SPARTAN 偏向局部结构发现。它们共同说明,结构化世界模型不应该只追求预测误差最低,还应追求能解释、能迁移、能在变化环境中快速调整。

局限与未来方向

论文也指出了重要局限。首先,许多实验仍依赖模拟环境和可控干预,真实世界中的观测噪声、部分可观测性和复杂交互会更难。其次,因果结构的可识别性依赖数据分布和归纳偏置,若真实机制高度耦合或图结构过密,稀疏假设可能失效。第三,SPARTAN 等稀疏结构在更大规模模型和真实机器人任务中的效果还需要进一步验证。 未来方向包括把三类方法结合起来:例如把 SPARTAN 的稀疏注意力正则与 VCD 的联合表示学习结合,把 COMET 的机制竞争引入 Transformer-like 架构,或者在机器人、自动驾驶和长期智能体任务中检验结构化世界模型的可扩展性。

最后观点

这篇论文提醒我们,世界模型的目标不只是“预测未来像素”,而是学习世界如何组织自身。一个真正有用的世界模型,应该知道哪些变量重要、哪些机制可复用、哪些变化需要适应、哪些干扰可以忽略。因果归纳偏置正是朝这个方向迈出的一步。 对于智能体研究而言,这条路线尤其关键。未来的自主系统需要在变化环境中持续行动,如果它们的内部模型只是密集黑箱,就很难诊断失败、快速适应和安全部署。结构化世界模型则提供了一种更可控的可能:让模型不仅学会预测世界,也学会以更接近世界本身结构的方式理解世界。

Appendices | 附录

补充内容

论文附录提供了 VCD、COMET、SPARTAN 和第 6 章案例的推导、实现细节、数据集说明和更多实验结果。其中包括 VCD 的潜在空间可视化、COMET 的消融实验、SPARTAN 的超参数和数据集细节,以及稀疏语言模型的更多注意力模式分析。对复现实验或深入理解模型训练细节的读者,附录是重要补充。

成为VIP会员查看完整内容
1

相关内容

VIP会员
最新内容
博士论文 | 因果归纳偏置如何塑造结构化世界模型
失去控制的指挥:人工智能时代的任务式指挥
专知会员服务
8+阅读 · 9月11日
美国的新国家安全科技战略思考
专知会员服务
4+阅读 · 9月11日
综述 | 面向大模型智能体的图结构个性化记忆
专知会员服务
7+阅读 · 9月10日
微信扫码咨询专知VIP会员