从视觉观察中直接获取世界知识是实现通用人工智能的基础。为此,视觉世界模型(VWM)应运而生,它通过学习视觉流中世界随时间的演化来构建这一能力。然而,当前研究来自不同社区,导致问题表述、分类体系和评估协议不一致。我们认为,弥合这一鸿沟需要一场概念转变:视觉不应仅仅被视为输入模态,而应作为塑造世界模型表示、学习和评估的主要驱动力。立足于这一以视觉为中心的视角,我们提出了一个统一框架,将VWM研究组织为三个核心组件:视觉编码、知识学习和可控模拟,并以此分析现有模型设计和评估方法。最后,我们指出了未来研究方向,强调加强物理和因果基础、推进超越外观的更有意义评估、以及向更通用和可靠的世界建模能力扩展。

https://aiworldlab.github.io/survey/

1 INTRODUCTION / 引言

考虑这样一个场景:一个人本能地伸出手去接住一个即将摔碎的玻璃杯,或者一位司机在看到一个孩子追球跑到马路前提前刹车。这些日常场景揭示了人类智能的一个基本方面:可靠的决策不仅依赖于识别当前正在发生的事情,还依赖于形成对世界如何随时间变化的稳健理解,并利用这种理解来预测接下来可能发生的事情。通过想象局势可能如何发展,人类可以在事件实际发生之前提前行动并调整行为。这种预见性决策被认为是智能的核心要素,也是追求通用人工智能(AGI)的中心目标。 为了使人工智能系统具备这种能力,研究界逐渐转向世界模型的范式。该范式认为,智能体应学习世界状态如何随时间演化的基础知识(例如物理过程如何展开、动作如何影响未来结果),通过构建世界动态的内部模型,智能体能够在行动之前预测可能的未来状态,从而做出更明智、更安全的决策,而无需过度依赖昂贵的真实世界试错。然而,世界模型的有效性在很大程度上取决于世界本身如何被揭示和感知,特别是物理现象(如运动、交互以及动作/事件的因果后果)如何随时间展开。 近期工作通过文本推理探索了世界建模,通常利用大语言模型从语言描述中推断结果。虽然这类方法在捕捉高层概念方面有效,但它们无法接触到描述现实世界变化的详细过程(语言可以表述“玻璃破碎了”,但无法说明碎片如何飞散或材料相互作用在撞击后如何展开)。这一限制源于物理世界并不以符号或预定义规则的形式呈现自己,而是以连续的、高维的感官信号呈现。相比之下,视觉流直接编码这些信号,共同捕捉外观、动态和潜在的因果关系。因此,视觉观察是物理世界行为最直接、最全面的证据。 基于这一洞察,直接从视觉信号中学习世界知识成为一个关键方向。视觉学习模仿了人类如何形成对世界的直觉理解:通过视觉观察,人类逐渐形成对支配世界变化原则的连贯理解。在互联网规模视频数据的支持下,该领域日益趋同于一个统一的建模范式,我们称之为视觉世界模型(VWM)——一种直接从视觉信号学习世界知识并实现交互条件化未来模拟的范式。 近年来,VWM的研究迅速推进,涵盖了生成建模、表示学习和具身智能等领域。尽管这些工作源自不同的研究社区,但它们在理解与模拟世界这一共同追求上高度重叠。如图1所示,现有方法可以根据其表示视觉信号和预测未来状态的方式加以组织。自回归和扩散方法主要专注于合成视觉上连贯的未来内容;嵌入预测方法强调在表示空间中学习预测结构;状态转换方法则将视觉输入抽象为紧凑的潜在状态以进行长时域建模。尽管这些范式捕捉了世界建模的互补方面,但它们往往孤立发展,导致了术语的不一致、评估实践的脱节以及跨范式比较的困难。 图1: 图1展示了VWM研究的全景图。上半部分将设计架构分为四大族系(自回归、扩散、嵌入预测、状态转换),下半部分按应用领域组织数据集和基准。 已有若干综述尝试总结现有工作,它们可分为两类:应用聚焦综述在特定领域(如机器人或自动驾驶)内分析世界模型,将VWM视为支持组件而非核心框架;高级概述综述则提供世界建模的高层概览,但通常仅将视觉视为输入模态,而未审视视觉的独特属性如何从根本上塑造表示、学习目标和评估。因此,该领域仍然缺乏一个清晰的、以视觉为中心的路线图来说明不同建模选择之间的关系以及如何评估进展。为填补这一空白,我们倡导以视觉为中心的视角,将视觉不仅仅视为输入模态,而是塑造世界模型的关键因素。在此视角下,我们提出一个用于理解和组织VWM的统一框架。我们的主要贡献包括:

  • 提出VWM的统一框架,围绕三个核心组件(视觉编码、知识学习和可控模拟)组织世界建模。
  • 基于该框架,将现有VWM方法分为四大架构族系:顺序生成、扩散生成、嵌入预测和状态转换,并分析其关系与关键设计权衡。
  • 系统回顾VWM的评估协议,总结不同指标和基准如何评估视觉质量、物理合理性和任务性能。
  • 指出关键开放挑战和未来研究方向,重点关注加强物理和因果基础、推进超越外观的评估、以及向更通用和可靠的世界建模能力扩展。

范围: 本综述聚焦于直接从视觉信号学习世界如何随时间变化的世界模型。仅基于符号状态且没有视觉基础的模型不属于本综述范围。此外,虽然机器人、自动驾驶和交互环境等应用被用来激励设计选择和评估标准,但我们的分析集中于VWM本身,而非针对每个应用场景定制的下游控制或策略优化。 路线图: 第2节介绍VWM的定义并呈现统一框架。第3节根据该框架组织现有VWM架构并分析其设计权衡。第4节回顾评估指标、数据集和基准。最后,第5节讨论开放挑战和未来方向。 图 1:视觉世界模型(VWM)研究全景。上半部分按自回归、扩散、嵌入预测和状态转移四类设计架构组织代表性工作,下半部分按交互与游戏、具身AI与机器人、预测与模拟、物理与因果、自动驾驶等领域梳理数据集和基准,并展示截至 2026 年 4 月 1 日的论文增长趋势。来源:原论文 PDF 第 2 页。

2 A UNIFIED FRAMEWORK FOR VISION WORLD MODELS / 视觉世界模型的统一框架

为提供视觉世界模型(VWM)的统一视角,我们引入了一个总结现有方法共同设计原则的框架。如图2所示,VWM可分解为三个核心组件:视觉编码(第2.2节)描述原始视觉数据如何转换为适合建模世界变化的表示;知识学习(第2.3节)关注模型如何从视觉数据中学习世界知识;可控模拟(第2.4节)描述VWM如何基于动作或指令生成可能的未来世界状态。 图2: 图2展示了VWM的统一框架。VWM编码视觉观测,学习关于世界如何变化的结构化世界知识,并在交互条件下执行未来模拟。 图 2:视觉世界模型的统一框架。VWM 从多样视觉数据中进行视觉编码,学习时空连贯性、物理动力学和因果机制等结构化世界知识,并在智能体、机器人或用户交互条件下执行未来状态的可控模拟。来源:原论文 PDF 第 4 页。

2.1 定义

核心上,我们将VWM定义如下:视觉世界模型(VWM)是一种从视觉数据学习世界知识并在交互条件下生成未来世界状态的人工智能模型。 具体地,VWM学习世界如何随时间变化,通过从视觉数据中捕捉潜在原理和机制,并利用这些知识在交互信号条件下执行未来模拟。形式化描述为:一个概率模型 ( f_\theta ) 参数化给定视觉上下文和交互条件下的未来世界状态的分布。与通常采用低维或预定义状态空间并将视觉仅视为输入模态的传统世界模型相比,VWM依赖高维视觉数据作为建模世界变化的基础,从根本上重塑了世界知识的表示和学习方式。

2.2 Vision Encoding: Learning Representations from Visual Data / 视觉编码:从视觉数据学习表示

原始视觉数据提供了关于世界的丰富信息,但也纠缠了多种变化因素。视觉编码在VWM中的作用是将原始视觉数据转换为分离相关因素以建模世界变化的表示,同时抑制无关变化。这种转换决定了保留哪些视觉信息、以何种抽象级别编码,以及如何支持世界知识建模。

# 2.2.1 世界建模的视觉输入

VWM可以训练在多种视觉输入上,从标准RGB图像/视频到深度图、光流、鸟瞰图等专门模态。标准RGB输入因其广泛可用性和对真实世界环境的广泛覆盖而被广泛使用,但模型必须直接从像素推断几何、运动和场景布局。为降低难度,许多方法加入额外视觉模态:深度图、点云、多视图几何提供3D几何信息;光流显式编码运动信息;在自动驾驶领域,BEV数据在统一坐标系中组织空间信息。多视图静态相机设置和第一人称记录进一步提供互补视角。

# 2.2.2 视觉表示的形式

视觉表示不同在于它们保留的视觉信息方面,从而决定了可以学到的世界知识。我们按组织视觉信息的方式对现有方法进行分组:

  • 连续潜在表示 许多世界模型使用卷积网络或视觉Transformer将观测编码为连续的潜在状态,形成紧凑、随时间平滑演化的连续状态空间。
  • 离散标记化表示 另一条工作线将视觉输入离散化为有限词汇的标记,通过将视觉内容映射到固定大小的字典,实现更高效的计算建模,并桥接视觉建模和基于序列的生成框架。
  • 以对象/实体为中心的表示 一些方法围绕具有持久身份的对象或实体显式构建表示,使实体边界显式化,促进学习时空连贯性和因果交互。
  • 混合与层次表示 近期模型组合多种表示形式(如连续表示与离散标记或对象中心的混合),在可扩展性、物理一致性和表达能力之间取得更好权衡。

2.3 Knowledge Learning: Structured World Knowledge in VWMs / 知识学习:VWM中的结构化世界知识

基于第2.2节引入的表示,VWM必须学习支配世界变化的世界知识。我们将这些知识分为三个互补方面:时空连贯性、物理动力学和因果机制。

# 2.3.1 时空连贯性

时空连贯性指的是实体在空间和时间上的一致性存在和身份,构成了世界建模其他方面的基础。空间层面要求模型在不同视角下保持一致的对象身份(多视图一致性、几何稳定性);时间层面要求实体随时间持续存在(对象永续性、状态平滑演进)。

# 2.3.2 物理动力学

物理动力学描述实体状态在物理约束下如何变化,确保预测的运动和交互在物理上合理而非仅是视觉上可信。包括基础运动(经典力学)、高级场景(可变形材料、流体行为),以及守恒原理(能量、动量)提供的约束。

# 2.3.3 因果机制

因果机制描述动作和事件如何产生结果。与依赖统计关联的模型不同,VWM需要学习动作与结果之间的基本因果关系,从而在更广泛的条件下实现可靠预测。关键能力包括反事实推理(考虑不同动作下结果如何不同)以及处理人类社会规范和意图。

2.4 Controllable Simulation: Simulating the Future through Interaction / 可控模拟:通过交互模拟未来

VWM利用所学世界知识模拟在不同交互条件下世界如何演化。模拟和交互共同定义了VWM如何在外部输入下产生未来轨迹。

# 2.4.1 模拟

模拟指基于当前视觉上下文和所学世界知识生成未来世界状态。模拟的未来状态形式多样:

  • 潜在状态 在压缩的潜在空间中进行模拟,适合规划和推理任务。
  • 视觉状态 在视觉空间中进行模拟(生成图像/视频/几何形式),适用于人类可解释性、合成数据生成和闭环评估。
  • 结构化输出 产生对象属性、空间配置或动作轨迹等结构化表示,直接用于控制或规划。

# 2.4.2 交互

交互指定模拟的未来如何响应外部条件。常见形式包括:

  • 动作信号 对控制信号(机器人指令、键盘鼠标输入)的条件化模拟。
  • 多模态交互 使用语言提示、视觉-语言-动作框架统一指定任务级目标,使模拟更可解释。

3 DESIGNS OF VISION WORLD MODELING / 视觉世界建模的设计

本节将VWM设计分为四个架构族系,涵盖七种代表性子设计。我们按架构形式分组,这很大程度上决定了世界知识如何表示、学习和模拟。图3提供了这些设计的简明概述。 图3: 图3展示了VWM设计的分类法,分为四个架构族系(顺序生成、扩散生成、嵌入预测、状态转换)和七种子设计。每种子设计的上半部分展示其典型输入-输出流程,下半部分突出其在本框架三个组件下的关键设计选择。

3.1 Sequential Generation / 顺序生成

顺序生成方法将视觉世界建模视为标记序列生成。典型地将视觉上下文(和可选条件)编码为标记流,并逐步产生未来结果。

# 3.1.1 视觉自回归模型

视觉自回归方法首先将视频转换为离散序列,然后将世界建模视为顺序标记生成。

  • 离散视觉标记 通过VQ-VAE或VQ-GAN将视觉信号转换为离散标记。关键区别在于token化方式:空间token化(逐帧序列)或时空token化(多帧共享标记)。3D场景中可对体素网格进行token化。
  • 下一标记预测 通过下一标记预测目标学习世界知识,鼓励模型捕捉时空连贯性(实体一致性、时间连续性)。长时域中预测误差累积是挑战,常用策略是增加有效上下文长度。动作条件建模通过潜在动作学习实现。
  • 自回归标记展开 模拟在标记空间中自回归展开,交互通过插入条件标记实现,支持多种控制模态。
  • 优势与局限 优势在于可扩展性和灵活性,可生成任意长度;局限是长时域易误差累积,离散token化可能丢失精细几何细节,物理和因果主要通过大规模数据推断而非显式约束。

# 3.1.2 MLLM引导的多模态自回归模型

当任务涉及语言表达的目标时,MLLM引导的方法通过将视觉观测投影为与语言兼容的标记并生成多模态标记流来扩展顺序生成。

  • 语言对齐的多模态标记 通过可学习的连接器将视觉观测映射为可与文本一起处理的标记序列。
  • 利用语言先验的多模态推理 利用预训练语言模型的知识作为语义先验,在视觉证据不完整时引导预测。
  • 交错多模态展开 生成包含预测视觉输出、文本解释和动作的交错序列。
  • 优势与局限 受益于语言模型知识、灵活的交互和更好的可解释性;但视觉内容投影可能丢失细节,语言先验可能偏离视觉证据,长时域仍受误差累积影响。

3.2 Diffusion-based Generation / 基于扩散的生成

扩散方法通过迭代去噪在连续潜在空间中建模未来世界状态,而非顺序预测标记。

# 3.2.1 潜在扩散

  • 连续潜在表示 使用VAE编码观测,避免硬量化,保留精细视觉信息。近期工作采用3D-aware表示(高斯溅射、体素网格)使场景布局显式化。
  • 迭代去噪 通过去噪目标学习知识,在时空块上进行去噪,自然鼓励时空依赖性。物理和动作条件通过结构化空间线索注入。
  • 块级去噪生成 对整个时间窗口联合去噪并解码为帧块,与逐帧自回归相比,块内一致性更好。交互通过条件扩散支持。
  • 优势与局限 高视觉质量,连续潜在保留细节,块级生成减少短期漂移。但扩散推理计算昂贵,生成通常绑定固定窗口,扩展至长时域困难。

# 3.2.2 自回归扩散

结合顺序生成与潜在扩散,通过将每个去噪步骤条件于先前生成的结果来传播生成。

  • 训练-推理不匹配 训练时去噪条件于真实历史,推理时依赖已生成且可能偏离的状态。近期方法通过噪声增强、自回归模拟或记忆机制解决。
  • 连续与离散潜在 继承自回归token模型和潜在扩散的表示选择。
  • 顺序条件去噪 逐步条件于已生成历史,可扩展至长时域,但小偏差会累积。辅助机制(记忆模块、几何引导)增强鲁棒性。
  • 顺序去噪展开 以顺序方式产生去噪潜在状态,支持多种交互模态,部分已实现近实时交互。
  • 优势与局限 结合高视觉保真度与扩展序列生成能力,但误差累积和计算成本仍是挑战。

3.3 Embedding Prediction / 嵌入预测

嵌入预测方法在表示空间中直接建模世界变化,而非生成像素。典型例子是联合嵌入预测架构(JEPA)。

  • 上下文嵌入 视觉观测通过视觉基础模型(如DINOv2、CLIP)编码为上下文嵌入。常见策略是冻结视觉编码器,仅训练预测模块。
  • 表示空间中的潜在预测 通过“掩码-预测”策略训练预测器近似未来嵌入,鼓励时空连贯性。动作条件下的变体建模因果关系。
  • 嵌入空间展开 模拟以预测的目标嵌入形式进行,可直接用于规划或策略评估,无需视觉解码,计算高效。
  • 优势与局限 计算高效(轻量级特征空间操作),适合长时域规划;但缺乏视觉解码降低了可解释性,依赖冻结基础模型可能限制表示能力。

3.4 State Transition / 状态转换

状态转换方法将世界表示为紧凑的潜在状态并建模其随时间演化,而非生成像素。

# 3.4.1 状态空间建模

以Dreamer系列为代表,核心是编码视觉观测为循环潜在状态并随时间更新。

  • 紧凑循环状态 压缩视觉观测为循环状态,保存预测和决策相关信息。早期用CNN,近期用更强的视觉骨干(ViT)或BEV表示。
  • 循环状态转换 通过状态转换模型(P(s_t+1|s_t, a_t))学习知识。长时域建模依赖改进的状态传播架构(如SSM、Mamba)。
  • 潜在状态展开 在潜在状态空间中进行模拟,支持快速长时域展开以评估候选动作序列。
  • 优势与局限 潜在空间中的高效长时域展开,适合需要评估许多候选未来的场景;但世界知识完全隐含在循环状态中,可能丢失精细细节。

# 3.4.2 以对象为中心的建模

将状态分解为一组实体槽位,显式建模个体对象的交互。通过槽位注意力机制提取对象表示,用图网络或Transformer在槽位间建模交互,模拟以槽位状态展开形式进行。优势在于组合泛化能力和对交互的显式建模,但需强对象先验且处理大量对象时可能困难。

3.5 Other Emerging Directions / 其他新兴方向

除了上述主要架构,近期还出现了一些新方向,例如将世界模型与强化学习、推理或符号方法相结合的混合范式,以及在更大规模数据和计算资源下的持续演进。这些方向展示了VWM研究的多样性,也为未来提供了新的可能性。

4 EVALUATION / 评估

VWM的评估涉及多个维度:视觉质量、物理合理性、任务性能等。本节回顾常用评估指标、数据集和基准。 图1(重复提及): 图1的下半部分按应用领域列出了多个数据集和基准,涵盖基础世界建模和特定领域世界建模。 图 3:VWM 评估体系总览。论文将评估组织为视觉质量、物理合理性和任务表现三类指标,并将数据集与基准分为基础世界建模和特定领域世界建模两大类,覆盖预测与模拟、具身AI与机器人、自动驾驶、交互环境与游戏、物理与因果等方向。来源:原论文 PDF 第 13 页。

4.1 Evaluation Metrics / 评估指标

评估指标用于量化VWM模拟的质量。常见指标包括:

  • 视觉质量指标 PSNR、SSIM、LPIPS、FVD等,衡量生成帧与真实帧在像素或特征层面的相似度。
  • 物理合理性指标 如物理违反检测、物体持久性、接触一致性等,专门评估模型对物理世界的理解。
  • 任务性能指标 在具体应用(如规划、控制)中,通过下游任务的成功率或奖励来评估世界模型的质量。
  • 因果和反事实指标 用于衡量模型对因果关系的理解和反事实预测能力。

4.2 Datasets and Benchmarks / 数据集和基准

数据集为VWM的训练和评估提供基础。我们将现有资源分为两类:

# 4.2.1 基础世界建模

这类基准关注通用世界建模能力,包括从合成数据(如ShapeStacks、Physion、CLEVRER)中评估物理直觉和因果推理,以及从真实视频数据(如Something-Something V2、EPIC-KITCHENS)中评估时空预测。

# 4.2.2 特定领域世界建模

针对具体应用领域的数据集和基准:

  • 交互式游戏与模拟 如Atari Learning Environment、DMC、Crafter、Minecraft相关基准。
  • 具身AI与机器人 如CALVIN、LIBERO、DROID、AgiBot World等。
  • 预测与模拟 如WorldScore、WorldPrediction、Sekai等。
  • 物理与因果 如CoPhy、Physion++、Physics-IQ等。
  • 自动驾驶 如KITTI、nuScenes、WorldModelBench等。

这些基准在任务设定、评估协议和覆盖范围上各有侧重,尚无统一标准。未来的评估应超越外观级相似度,更关注物理和因果一致性。

5 FUTURE RESEARCH DIRECTIONS / 未来研究方向

图 4:视觉世界模型开放挑战与未来方向。论文将下一代世界模型的发展概括为重新扎根(Re-grounding)、重新评估(Re-evaluation)和重新扩展(Re-scaling)三条路线,分别强调知识基础、评价协议和规模化能力。来源:原论文 PDF 第 16 页。

5.1 Re-grounding: Strengthening the Knowledge Foundation / 重新扎根:加强知识基础

当前VWM的“知识基础”仍然薄弱。未来需要从以下方面加强:

# 5.1.1 拓宽世界知识的范围

现有模型主要学习时空连贯性和简单的物理动力学,但对更深入的世界知识(如真实物理定律、因果关系、常识推理)仍显不足。未来需要更明确的结构化归纳偏置(如物理引擎嵌入、符号约束),以及从视觉数据中学习更丰富的因果结构。此外,模型应处理社会规范、意图等人类环境中的非纯物理因素。 进一步方向: 结合神经符号方法、物理模拟器以及更大的数据规模,使VWM具备更强的泛化和推理能力。同时,评估也需进入更前沿的因果和反事实层面,推动模型从“看起来合理”向“本质上正确”演进。

成为VIP会员查看完整内容
17

相关内容

视觉语言模型泛化到新领域:全面综述
专知会员服务
38+阅读 · 2025年6月27日
从二维到三维认知:通用世界模型简要综述
专知会员服务
31+阅读 · 2025年6月26日
视觉通用模型综述
专知会员服务
28+阅读 · 2025年6月12日
视觉语言建模遇见遥感:模型、数据集与前景展望
专知会员服务
17+阅读 · 2025年5月21日
高效视觉语言模型研究综述
专知会员服务
14+阅读 · 2025年4月18日
世界模型:安全性视角
专知会员服务
43+阅读 · 2024年11月17日
《面向视觉语言地理基础模型》综述
专知会员服务
47+阅读 · 2024年6月15日
探索视觉语言模型的前沿:当前方法和未来方向的综述
专知会员服务
49+阅读 · 2024年4月12日
多模态视觉语言表征学习研究综述
专知
27+阅读 · 2020年12月3日
论文浅尝 | 虚拟知识图谱:软件系统和应用案例综述
开放知识图谱
15+阅读 · 2019年5月7日
深度学习与计算机视觉任务应用综述
深度学习与NLP
51+阅读 · 2018年12月18日
【机器视觉】机器视觉全面解析
产业智能官
12+阅读 · 2018年11月12日
【综述】计算机视觉简介:历史、现状和发展趋势【可下载】
机器学习算法与Python学习
15+阅读 · 2018年9月21日
交互设计理论:视觉感知、认知摩擦、认知负荷和情境认知
人人都是产品经理
20+阅读 · 2018年5月10日
【学界】从可视化到新模型:纵览深度学习的视觉可解释性
GAN生成式对抗网络
10+阅读 · 2018年3月4日
展望:模型驱动的深度学习
人工智能学家
12+阅读 · 2018年1月23日
国家自然科学基金
10+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
51+阅读 · 2014年12月31日
国家自然科学基金
6+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2014年12月31日
Arxiv
0+阅读 · 6月11日
Arxiv
10+阅读 · 2023年12月5日
VIP会员
最新内容
《无人机脆弱性利用:网络空间力量的新域》
专知会员服务
2+阅读 · 今天4:08
美空军如何将人工智能从战场部署至后方机关
专知会员服务
11+阅读 · 7月31日
《史诗怒火行动:多域前瞻评估》49页报告
专知会员服务
7+阅读 · 7月31日
《英国防部:未来空战系统数字化战略》33页
专知会员服务
5+阅读 · 7月31日
《面向自主飞行网络的智能体人工智能架构》
专知会员服务
7+阅读 · 7月31日
“史诗怒火”行动:现代多域作战的重要节点
专知会员服务
8+阅读 · 7月30日
《下一代无线网络中的多无人机通信资源管理》
相关VIP内容
视觉语言模型泛化到新领域:全面综述
专知会员服务
38+阅读 · 2025年6月27日
从二维到三维认知:通用世界模型简要综述
专知会员服务
31+阅读 · 2025年6月26日
视觉通用模型综述
专知会员服务
28+阅读 · 2025年6月12日
视觉语言建模遇见遥感:模型、数据集与前景展望
专知会员服务
17+阅读 · 2025年5月21日
高效视觉语言模型研究综述
专知会员服务
14+阅读 · 2025年4月18日
世界模型:安全性视角
专知会员服务
43+阅读 · 2024年11月17日
《面向视觉语言地理基础模型》综述
专知会员服务
47+阅读 · 2024年6月15日
探索视觉语言模型的前沿:当前方法和未来方向的综述
专知会员服务
49+阅读 · 2024年4月12日
相关资讯
多模态视觉语言表征学习研究综述
专知
27+阅读 · 2020年12月3日
论文浅尝 | 虚拟知识图谱:软件系统和应用案例综述
开放知识图谱
15+阅读 · 2019年5月7日
深度学习与计算机视觉任务应用综述
深度学习与NLP
51+阅读 · 2018年12月18日
【机器视觉】机器视觉全面解析
产业智能官
12+阅读 · 2018年11月12日
【综述】计算机视觉简介:历史、现状和发展趋势【可下载】
机器学习算法与Python学习
15+阅读 · 2018年9月21日
交互设计理论:视觉感知、认知摩擦、认知负荷和情境认知
人人都是产品经理
20+阅读 · 2018年5月10日
【学界】从可视化到新模型:纵览深度学习的视觉可解释性
GAN生成式对抗网络
10+阅读 · 2018年3月4日
展望:模型驱动的深度学习
人工智能学家
12+阅读 · 2018年1月23日
相关基金
国家自然科学基金
10+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
51+阅读 · 2014年12月31日
国家自然科学基金
6+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2014年12月31日
微信扫码咨询专知VIP会员