https://aiworldlab.github.io/survey/
考虑这样一个场景:一个人本能地伸出手去接住一个即将摔碎的玻璃杯,或者一位司机在看到一个孩子追球跑到马路前提前刹车。这些日常场景揭示了人类智能的一个基本方面:可靠的决策不仅依赖于识别当前正在发生的事情,还依赖于形成对世界如何随时间变化的稳健理解,并利用这种理解来预测接下来可能发生的事情。通过想象局势可能如何发展,人类可以在事件实际发生之前提前行动并调整行为。这种预见性决策被认为是智能的核心要素,也是追求通用人工智能(AGI)的中心目标。 为了使人工智能系统具备这种能力,研究界逐渐转向世界模型的范式。该范式认为,智能体应学习世界状态如何随时间演化的基础知识(例如物理过程如何展开、动作如何影响未来结果),通过构建世界动态的内部模型,智能体能够在行动之前预测可能的未来状态,从而做出更明智、更安全的决策,而无需过度依赖昂贵的真实世界试错。然而,世界模型的有效性在很大程度上取决于世界本身如何被揭示和感知,特别是物理现象(如运动、交互以及动作/事件的因果后果)如何随时间展开。 近期工作通过文本推理探索了世界建模,通常利用大语言模型从语言描述中推断结果。虽然这类方法在捕捉高层概念方面有效,但它们无法接触到描述现实世界变化的详细过程(语言可以表述“玻璃破碎了”,但无法说明碎片如何飞散或材料相互作用在撞击后如何展开)。这一限制源于物理世界并不以符号或预定义规则的形式呈现自己,而是以连续的、高维的感官信号呈现。相比之下,视觉流直接编码这些信号,共同捕捉外观、动态和潜在的因果关系。因此,视觉观察是物理世界行为最直接、最全面的证据。 基于这一洞察,直接从视觉信号中学习世界知识成为一个关键方向。视觉学习模仿了人类如何形成对世界的直觉理解:通过视觉观察,人类逐渐形成对支配世界变化原则的连贯理解。在互联网规模视频数据的支持下,该领域日益趋同于一个统一的建模范式,我们称之为视觉世界模型(VWM)——一种直接从视觉信号学习世界知识并实现交互条件化未来模拟的范式。 近年来,VWM的研究迅速推进,涵盖了生成建模、表示学习和具身智能等领域。尽管这些工作源自不同的研究社区,但它们在理解与模拟世界这一共同追求上高度重叠。如图1所示,现有方法可以根据其表示视觉信号和预测未来状态的方式加以组织。自回归和扩散方法主要专注于合成视觉上连贯的未来内容;嵌入预测方法强调在表示空间中学习预测结构;状态转换方法则将视觉输入抽象为紧凑的潜在状态以进行长时域建模。尽管这些范式捕捉了世界建模的互补方面,但它们往往孤立发展,导致了术语的不一致、评估实践的脱节以及跨范式比较的困难。 图1: 图1展示了VWM研究的全景图。上半部分将设计架构分为四大族系(自回归、扩散、嵌入预测、状态转换),下半部分按应用领域组织数据集和基准。 已有若干综述尝试总结现有工作,它们可分为两类:应用聚焦综述在特定领域(如机器人或自动驾驶)内分析世界模型,将VWM视为支持组件而非核心框架;高级概述综述则提供世界建模的高层概览,但通常仅将视觉视为输入模态,而未审视视觉的独特属性如何从根本上塑造表示、学习目标和评估。因此,该领域仍然缺乏一个清晰的、以视觉为中心的路线图来说明不同建模选择之间的关系以及如何评估进展。为填补这一空白,我们倡导以视觉为中心的视角,将视觉不仅仅视为输入模态,而是塑造世界模型的关键因素。在此视角下,我们提出一个用于理解和组织VWM的统一框架。我们的主要贡献包括:
范围: 本综述聚焦于直接从视觉信号学习世界如何随时间变化的世界模型。仅基于符号状态且没有视觉基础的模型不属于本综述范围。此外,虽然机器人、自动驾驶和交互环境等应用被用来激励设计选择和评估标准,但我们的分析集中于VWM本身,而非针对每个应用场景定制的下游控制或策略优化。 路线图: 第2节介绍VWM的定义并呈现统一框架。第3节根据该框架组织现有VWM架构并分析其设计权衡。第4节回顾评估指标、数据集和基准。最后,第5节讨论开放挑战和未来方向。 图 1:视觉世界模型(VWM)研究全景。上半部分按自回归、扩散、嵌入预测和状态转移四类设计架构组织代表性工作,下半部分按交互与游戏、具身AI与机器人、预测与模拟、物理与因果、自动驾驶等领域梳理数据集和基准,并展示截至 2026 年 4 月 1 日的论文增长趋势。来源:原论文 PDF 第 2 页。
为提供视觉世界模型(VWM)的统一视角,我们引入了一个总结现有方法共同设计原则的框架。如图2所示,VWM可分解为三个核心组件:视觉编码(第2.2节)描述原始视觉数据如何转换为适合建模世界变化的表示;知识学习(第2.3节)关注模型如何从视觉数据中学习世界知识;可控模拟(第2.4节)描述VWM如何基于动作或指令生成可能的未来世界状态。 图2: 图2展示了VWM的统一框架。VWM编码视觉观测,学习关于世界如何变化的结构化世界知识,并在交互条件下执行未来模拟。 图 2:视觉世界模型的统一框架。VWM 从多样视觉数据中进行视觉编码,学习时空连贯性、物理动力学和因果机制等结构化世界知识,并在智能体、机器人或用户交互条件下执行未来状态的可控模拟。来源:原论文 PDF 第 4 页。
核心上,我们将VWM定义如下:视觉世界模型(VWM)是一种从视觉数据学习世界知识并在交互条件下生成未来世界状态的人工智能模型。 具体地,VWM学习世界如何随时间变化,通过从视觉数据中捕捉潜在原理和机制,并利用这些知识在交互信号条件下执行未来模拟。形式化描述为:一个概率模型 ( f_\theta ) 参数化给定视觉上下文和交互条件下的未来世界状态的分布。与通常采用低维或预定义状态空间并将视觉仅视为输入模态的传统世界模型相比,VWM依赖高维视觉数据作为建模世界变化的基础,从根本上重塑了世界知识的表示和学习方式。
原始视觉数据提供了关于世界的丰富信息,但也纠缠了多种变化因素。视觉编码在VWM中的作用是将原始视觉数据转换为分离相关因素以建模世界变化的表示,同时抑制无关变化。这种转换决定了保留哪些视觉信息、以何种抽象级别编码,以及如何支持世界知识建模。
VWM可以训练在多种视觉输入上,从标准RGB图像/视频到深度图、光流、鸟瞰图等专门模态。标准RGB输入因其广泛可用性和对真实世界环境的广泛覆盖而被广泛使用,但模型必须直接从像素推断几何、运动和场景布局。为降低难度,许多方法加入额外视觉模态:深度图、点云、多视图几何提供3D几何信息;光流显式编码运动信息;在自动驾驶领域,BEV数据在统一坐标系中组织空间信息。多视图静态相机设置和第一人称记录进一步提供互补视角。
视觉表示不同在于它们保留的视觉信息方面,从而决定了可以学到的世界知识。我们按组织视觉信息的方式对现有方法进行分组:
基于第2.2节引入的表示,VWM必须学习支配世界变化的世界知识。我们将这些知识分为三个互补方面:时空连贯性、物理动力学和因果机制。
时空连贯性指的是实体在空间和时间上的一致性存在和身份,构成了世界建模其他方面的基础。空间层面要求模型在不同视角下保持一致的对象身份(多视图一致性、几何稳定性);时间层面要求实体随时间持续存在(对象永续性、状态平滑演进)。
物理动力学描述实体状态在物理约束下如何变化,确保预测的运动和交互在物理上合理而非仅是视觉上可信。包括基础运动(经典力学)、高级场景(可变形材料、流体行为),以及守恒原理(能量、动量)提供的约束。
因果机制描述动作和事件如何产生结果。与依赖统计关联的模型不同,VWM需要学习动作与结果之间的基本因果关系,从而在更广泛的条件下实现可靠预测。关键能力包括反事实推理(考虑不同动作下结果如何不同)以及处理人类社会规范和意图。
VWM利用所学世界知识模拟在不同交互条件下世界如何演化。模拟和交互共同定义了VWM如何在外部输入下产生未来轨迹。
模拟指基于当前视觉上下文和所学世界知识生成未来世界状态。模拟的未来状态形式多样:
交互指定模拟的未来如何响应外部条件。常见形式包括:
本节将VWM设计分为四个架构族系,涵盖七种代表性子设计。我们按架构形式分组,这很大程度上决定了世界知识如何表示、学习和模拟。图3提供了这些设计的简明概述。 图3: 图3展示了VWM设计的分类法,分为四个架构族系(顺序生成、扩散生成、嵌入预测、状态转换)和七种子设计。每种子设计的上半部分展示其典型输入-输出流程,下半部分突出其在本框架三个组件下的关键设计选择。
顺序生成方法将视觉世界建模视为标记序列生成。典型地将视觉上下文(和可选条件)编码为标记流,并逐步产生未来结果。
视觉自回归方法首先将视频转换为离散序列,然后将世界建模视为顺序标记生成。
当任务涉及语言表达的目标时,MLLM引导的方法通过将视觉观测投影为与语言兼容的标记并生成多模态标记流来扩展顺序生成。
扩散方法通过迭代去噪在连续潜在空间中建模未来世界状态,而非顺序预测标记。
结合顺序生成与潜在扩散,通过将每个去噪步骤条件于先前生成的结果来传播生成。
嵌入预测方法在表示空间中直接建模世界变化,而非生成像素。典型例子是联合嵌入预测架构(JEPA)。
状态转换方法将世界表示为紧凑的潜在状态并建模其随时间演化,而非生成像素。
以Dreamer系列为代表,核心是编码视觉观测为循环潜在状态并随时间更新。
将状态分解为一组实体槽位,显式建模个体对象的交互。通过槽位注意力机制提取对象表示,用图网络或Transformer在槽位间建模交互,模拟以槽位状态展开形式进行。优势在于组合泛化能力和对交互的显式建模,但需强对象先验且处理大量对象时可能困难。
除了上述主要架构,近期还出现了一些新方向,例如将世界模型与强化学习、推理或符号方法相结合的混合范式,以及在更大规模数据和计算资源下的持续演进。这些方向展示了VWM研究的多样性,也为未来提供了新的可能性。
VWM的评估涉及多个维度:视觉质量、物理合理性、任务性能等。本节回顾常用评估指标、数据集和基准。 图1(重复提及): 图1的下半部分按应用领域列出了多个数据集和基准,涵盖基础世界建模和特定领域世界建模。 图 3:VWM 评估体系总览。论文将评估组织为视觉质量、物理合理性和任务表现三类指标,并将数据集与基准分为基础世界建模和特定领域世界建模两大类,覆盖预测与模拟、具身AI与机器人、自动驾驶、交互环境与游戏、物理与因果等方向。来源:原论文 PDF 第 13 页。
评估指标用于量化VWM模拟的质量。常见指标包括:
数据集为VWM的训练和评估提供基础。我们将现有资源分为两类:
这类基准关注通用世界建模能力,包括从合成数据(如ShapeStacks、Physion、CLEVRER)中评估物理直觉和因果推理,以及从真实视频数据(如Something-Something V2、EPIC-KITCHENS)中评估时空预测。
针对具体应用领域的数据集和基准:
这些基准在任务设定、评估协议和覆盖范围上各有侧重,尚无统一标准。未来的评估应超越外观级相似度,更关注物理和因果一致性。
图 4:视觉世界模型开放挑战与未来方向。论文将下一代世界模型的发展概括为重新扎根(Re-grounding)、重新评估(Re-evaluation)和重新扩展(Re-scaling)三条路线,分别强调知识基础、评价协议和规模化能力。来源:原论文 PDF 第 16 页。
当前VWM的“知识基础”仍然薄弱。未来需要从以下方面加强:
现有模型主要学习时空连贯性和简单的物理动力学,但对更深入的世界知识(如真实物理定律、因果关系、常识推理)仍显不足。未来需要更明确的结构化归纳偏置(如物理引擎嵌入、符号约束),以及从视觉数据中学习更丰富的因果结构。此外,模型应处理社会规范、意图等人类环境中的非纯物理因素。 进一步方向: 结合神经符号方法、物理模拟器以及更大的数据规模,使VWM具备更强的泛化和推理能力。同时,评估也需进入更前沿的因果和反事实层面,推动模型从“看起来合理”向“本质上正确”演进。