白皮书 | 视觉通用智能:从视觉经验走向通用智能

论文题目:Visual General Intelligence: A White Paper 作者:Hirokatsu Kataoka、Yoshihiro Fukuhara、Yonglong Tian、Shangzhe Wu、Oishi Deb、Ryousuke Yamada、Christian Rupprecht、Jianyuan Wang、Kohsuke Ide、Koichi Namekata、Xianzheng Ma、Yiming Chen、Robert Geirhos、Aditi Raghunathan、Yuki M. Asano、Deva Ramanan、David Fouhey、Andrew J. Davison、Yilun Du、Jiajun Wu、Zhuang Liu 机构:AIST、牛津大学 VGG、CADDi、OpenAI、剑桥大学、纽伦堡工业大学、筑波大学、Google DeepMind、卡内基梅隆大学、纽约大学、帝国理工学院、哈佛大学、斯坦福大学、普林斯顿大学等 论文链接:https://arxiv.org/pdf/2608.25924

导读

大语言模型让“通用智能”再次成为人工智能研究的核心议题,但这篇白皮书提出了一个反向问题:智能是否一定要以语言为中心?视觉在人类和动物智能中出现得远早于现代语言。视觉并不只是一个输入通道,而是捕捉世界结构、预测变化、重建隐藏状态、指导行动和形成经验的基础能力。 论文提出“视觉通用智能”这一研究议程。它不是要给视觉智能下一个唯一的定义,也不是把视觉模型简单接到语言模型上,而是追问:如果模型从图像、视频、几何、运动、触觉、具身交互和科学仪器观测中持续学习,能否产生类似通用智能的能力?这些能力可能包括视觉上下文学习、长期空间记忆、物理世界建模、主动观察、开放式创造、反事实想象、持续适应和可靠行动。 这篇文章来自 CVPR 2026 VGI Workshop 相关讨论,集合了多位视觉、机器人、空间智能、生成模型和科学发现研究者的观点。它更像一份研究宣言:不急于断言哪条路线正确,而是把可能路径摆出来。核心共识是,视觉通用智能不应被简化为更强图像分类器、更逼真视频生成器、更大的视觉编码器,或语言模型的附属模块;它应被理解为从视觉经验中获得、维护、验证和使用世界知识的能力。

1 Introduction:引言

视觉为何重要

从图灵测试、控制论到现代大模型,智能常被描述为从环境信号中获得表征、捕捉规律、泛化到未知情境,并把表征连接到预测或行动的能力。但智能不必被压缩为语言。地球生命史中,高级视觉系统可以追溯到寒武纪,而人类语言和文字系统只是极其晚近的现象。这提示我们,视觉可能不只是传感器,而是理解世界结构的基础智能功能。 语言模型提供了重要参照。GPT 系列证明,简单自监督目标、互联网规模数据和模型扩展能够产生上下文学习、少样本适应等涌现能力。论文由此追问:视觉模型在图像、视频、几何和具身经验上扩展时,是否也会产生类似涌现?如果会,视觉智能需要什么样的数据结构、训练目标、模型架构和评估方法?

视觉与语言的关系

论文并不拒绝语言。CLIP、Flamingo、BLIP、LLaVA 等视觉语言模型已经展示了视觉与语言结合的强大能力。但这类系统也让能力来源变得难以区分:哪些能力来自视觉经验,哪些来自语言模型,哪些来自图文对齐和指令微调? 白皮书因此保留多种视角:视觉单模态、视觉优先、语言介导、多模态融合、具身交互。视觉通用智能强调的是,视觉本身能理解、预测和泛化什么,以及在与语言耦合之前或同时,它能形成怎样的世界知识。

2 Perspectives on Visual General Intelligence:视觉通用智能的多种视角

视频模型作为视觉基础模型

Robert Geirhos 认为,视觉智能可以理解为无需针对每个新任务显式训练,就能解决从感知到推理的广泛视觉任务。语言模型统一了许多自然语言处理任务,视觉领域也需要类似的通用框架。 他押注生成式视频模型。理由有三点。第一,规模仍是人工智能长期进步的核心驱动力,视频模型也应从更大模型和更大规模视觉数据中获益。第二,生成目标比分类目标更难,模型不能只抓纹理、背景等捷径,而必须同时处理对象、背景、形状、光照、阴影和运动。第三,视频比静态图像更一般,静态图像只是视频的特例。近期视频模型已显示出边缘检测、分割、关键点定位、超分、图像编辑、风格迁移、迷宫求解和图遍历等跨任务能力,像早期语言基础模型一样展现出视觉领域的涌现苗头。

创造力作为测试标准

Aditi Raghunathan 提出,智能不能只由有唯一正确答案的任务衡量。开放式视觉智能应能产生新颖、连贯、多样且有用的方案,例如设计物体、规划机器人动作、构造科学图示或想象物理场景的多种演化方式。 她强调两类创造力。组合式创造力是在熟悉元素之间发现不熟悉的联系;探索式创造力是在规则和约束下构造新模式。视觉模型的创造力评估至少应包含三点:输出是否满足物理、几何、语义和时间约束;多次生成是否具有结构性差异,而不只是颜色或纹理变化;输出是否相对训练经验具有原创性。她还指出,随机性不应只来自采样温度,更可以通过持续的样本级潜变量选择高层计划,再生成细节,从而产生整体不同但内部一致的方案。

从一个数据点中学习

Yuki M. Asano 认为,当前最强视觉系统虽然强大,但大多训练一次后固定部署。真正视觉通用的系统应当随着视觉生命历程持续学习:不用标签、不反复重洗历史数据、不预设未来任务,也能发现对象、表面、运动、持久性、视角变化和因果变化。 他提出,一个人工视觉脑不应是单一同质模块,而应包含感知系统、空间与动态世界模型、分层记忆系统、任务与行动接口。这些模块可以是神经化、可微分、联合训练的,但应具有不同角色、更新时间尺度和稳定性机制。语言在这里是后来的接口,可以命名概念、沟通目标、提供偶尔监督,但不能取代视觉系统对深度、运动、接触和可供性的直接学习。

多模态、生成式与高效率

Deva Ramanan 等人从具身机器人角度指出,智能不会只是视觉。机器人依赖视觉、触觉、音频和本体感受等多种信号,许多腿式机器人甚至能在“盲”的情况下依靠本体感受行动。但视觉仍然高度重要,因为它包含丰富的世界信息。 他们同样看好生成学习,认为生成模型可能会接管表征学习,因为生成迫使模型学习更完整的视觉世界。但高质量视频生成成本极高,效率必须成为核心议题。未来方向包括多感官生成、条件生成、长视频生成、递归记忆、三维重建与生成结合、多尺度处理,以及更好的数据筛选。作者还提出一个带有挑战性的观点:真正重要的不是数据规模本身,而是数据多样性;规模常常只是获得多样性的最容易办法。

视觉智能与科学发现

David Fouhey 关注科学发现场景。他认为,视觉智能应支持从专门仪器和有限观测中发现知识,而不仅是完成标准视觉任务。在科学中,数据往往稀缺,无法像互联网图像那样随意扩大;验证也缺少简单 ground truth,需要与物理知识、其他仪器、历史数据和专家直觉对齐。 他强调科学视觉中的几个难点:很多关键数据无法重新采集,例如几十年前的生态观测;科学仪器有单位和系统误差,模型会同时学习真实信号与伪信号;模拟往往只是近似现实,不能简单替代观测;视觉模型只是科学发现管线的一部分,最终还要融入已有科学工作流。这意味着视觉通用智能必须能够处理小数据、系统误差、多源验证和领域知识,而不是只追求榜单数字。

空间智能的计算结构

Andrew J. Davison 从 Spatial AI 出发,强调持久而高效的世界表征。机器人、可穿戴设备和空间助手需要构建可更新、可共享、可组合的环境表示,用于预测、规划和交互。SLAM 是重要前驱:它在固定计算和内存预算下,从连续传感流中增量构建世界表示,并支持长期一致行为。 他认为,未来空间智能系统会融合学习组件和设计组件,关键不是端到端是否完全神经化,而是整体计算结构如何组织。表示应当持久但可适应,局部精确但大尺度可近似;硬件也会走向更细粒度并行、分布式内存、稀疏通信和事件驱动。视觉通用智能如果要进入机器人和可穿戴设备,就必须关心表征如何映射到真实硬件。

视觉智能就是具身智能

Yilun Du 认为,视觉通用智能的中心测试是能否让机器人在物理世界中可靠感知、推理和行动。具身不是下游应用,而是视觉智能的组成部分。通过选择视角和干预世界,智能体可以揭示被动观察难以推断的属性,并用行动结果修正视觉模型。 他提出闭环视觉学习:用生成式世界模型解释观测;维护跨时间一致的场景表示;把视觉理解连接到高层动作计划;主动探索以获得信息;部署后持续适应。视觉计划不必还原所有细节,但必须保留影响行动和任务结果的关键差异。行动既是视觉智能的输出,也是获取视觉证据的机制。

通过代码看见物理世界

Shangzhe Wu 和 Jiajun Wu 把视觉理解描述为从观测中恢复物理世界的“结构”或“代码”。图像只是物理场景投向相机的光信号,而视觉的任务是反推出产生观测的实体、内在属性、外在条件、关系和动态。 这种结构具有可干预性:如果系统知道杯子的形状、材料和位置,就能回答从背后看是什么样、桌子倾斜会怎样、手应该从哪里抓取。作者警惕只看 photorealistic 输出的生成模型:模型能生成一个逼真的杯子下落视频,并不证明它表示了质量、接触和摩擦。有效表示需要同时包含可读、可编辑、可验证的离散关系,以及难以命名的连续视觉细节。代码智能体或许能成为物理结构建模的作者,因为代码可以执行、渲染、模拟并被自动验证。

走向视觉原生智能

Zhuang Liu 认为,当前许多系统仍把视觉作为语言模型的附件,而视觉通用智能应更“视觉原生”。视觉是人类组织世界的核心方式,人类常以场景、空间关系和动作反馈进行思考,而不是只靠文本 token。 视觉扩展与语言扩展不同。语言已有词、短语、句子、文档等符号层级,文本是人类经验的压缩;视觉没有天然 token,像素太低级,patch 只是工程便利,视觉中的对象、部件、关系和场景层级尚无统一表示。模型必须自己学会保留什么、忽略什么、在哪些区域细看。未来视觉系统不应只回答给定图像问题,还应知道什么时候看、看哪里、需要多少细节。

从视觉经验到通用智能

Hirokatsu Kataoka 等人提出,视觉智能是从视觉经验中获得世界知识,并用于预测、想象、重建和新任务的能力。它不是更强分类器,也不是接到语言模型上的视觉编码器。 作者提出三类互补目标:序列预测、开放式生成和重建。序列预测要求模型理解视觉世界如何演化;开放式生成是学习想象,用于产生反事实、模拟结果和探索可能性;重建则从不完整观测中恢复隐藏结构,包括超分、修复、逆渲染、深度估计、多视角重建、三维和四维动态重建。三者结合,可能形成从视觉基础模型到视觉智能,再到通用智能的路径。

3 Summary and Discussion:总结与讨论

观点汇总

论文将十组观点归纳为几条主线。第一是规模化生成学习:生成视频模型可能成为视觉基础模型,生成不只是内容合成,而是迫使模型解释更完整世界的训练压力。第二是创造、预测、想象和重建:视觉智能应能产生多个结构上不同且有用的可能世界,而不只是复现最可能画面。 第三是持续和终身学习:视觉系统应随着经验增长,而不是一次训练后冻结。第四是持久三维和空间世界表示:智能体需要长期、可更新、可组合的世界模型。第五是具身、主动感知和行动:视觉要在行动中被验证,并通过行动获得新证据。第六是多模态和效率:触觉、音频、本体感受、近场视觉和低成本计算都是现实智能不可忽视的组成。第七是科学发现和未知环境泛化:视觉智能需要处理有限数据、仪器偏差和无标准答案验证。第八是组合式物理结构:世界应被表示为可编辑、可模拟、可验证的实体、属性、关系和动态。

视觉经验能否产生智能

讨论部分提出一个直接问题:智能能否从视觉经验本身涌现?当前很多系统把视觉当作输入,把抽象和推理交给语言。多位作者挑战这种划分,认为对象、深度、运动、持久性、可供性和物理动态可以在被命名之前被学习。 这不意味着语言不重要。语言可以成为接口、监督和协作工具,多模态信号也很关键。但视觉不应被降级为语言模型的附属感知端。更开放的问题是:视觉 grounding 应先于多模态整合,还是与多模态共同涌现?

扩展、生成与物理结构

大规模生成模型是共同焦点,但论文也强调,数据规模不等于视觉多样性,逼真生成不等于物理理解。视频模型能生成看似合理的事件,并不必然表示质量、接触、摩擦、材料和因果关系。未来需要研究哪些结构可以从像素预测中自然涌现,哪些结构需要显式目标、可执行代码、可编辑表示或物理约束。

持续学习与评估

视觉通用智能的评估不能停留在静态图像问答或固定 benchmark。它应覆盖迁移、持续适应、主动观察、长期世界知识、创造力、物理一致性、计算效率和可靠行动。科学发现还需要无标准答案场景下的验证;创造力需要多样性和原创性;具身智能需要行动结果和长期场景一致性。

4 Conclusion:结论

核心判断

这篇白皮书没有给视觉通用智能一个单一定义,也没有押注唯一架构。它更重要的贡献是把计算机视觉在 AGI 时代可能承担的角色重新摆到台前:视觉不是语言模型的外设,而可能是通向通用智能的一条独立且互补路径。 视觉通用智能应表现为:从视觉经验中获得知识,发现并维护世界结构,想象和评估可能性,适应新观测,并将视觉知识用于预测、发现和行动。当前系统已经展示了一些碎片化能力:视频模型的跨任务行为、重建模型的几何理解、空间系统的持久表示、创造模型的多方案生成、具身智能体的交互学习。但这些能力尚未整合为一个持续适应的通用视觉系统。

对视觉研究的启示

论文最后留下的问题不是“视觉通用智能是否已经实现”,而是“什么证据能说服我们智能已经开始从视觉中产生”。这种证据不能只是固定任务准确率提升,还应包括可迁移能力、可修订世界知识、创造和反事实推理、主动信息获取、持续适应、空间和物理一致性,以及在未知环境中的可靠行动。 对计算机视觉社区而言,这意味着一个新阶段:研究对象不再只是识别、检测、重建、生成等单独视觉功能,而是探索这些功能如何在同一系统中汇聚为视觉智能。最终答案可能来自大规模生成、空间表征、具身交互、物理结构、视觉原生学习,或这些方向尚未充分想象的组合。

成为VIP会员查看完整内容
0

相关内容

重磅!《智能遥感技术与应用》白皮书,88页pdf
专知会员服务
60+阅读 · 2023年12月25日
重磅!华为等发布《知识计算白皮书》,65页ppt
专知会员服务
172+阅读 · 2022年6月6日
信通院最新发布!《AI 框架发展白皮书(2022年)》
专知会员服务
93+阅读 · 2022年2月27日
《人工智能在化学领域的应用全景》白皮书
专知会员服务
40+阅读 · 2022年1月22日
【机器视觉】计算机视觉研究入门全指南
产业智能官
11+阅读 · 2018年9月23日
车联网白皮书(2017)
智能交通技术
14+阅读 · 2017年10月8日
国家自然科学基金
7+阅读 · 2017年12月31日
国家自然科学基金
1+阅读 · 2016年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
4+阅读 · 2014年12月31日
Arxiv
27+阅读 · 2021年11月11日
VIP会员
最新内容
白皮书 | 视觉通用智能:从视觉经验走向通用智能
综述 | 基础模型无监督后训练:方法、边界与未来
《北约联邦式电子战云架构》
专知会员服务
1+阅读 · 今天13:24
《美陆军野战手册:空域管理战术》
专知会员服务
2+阅读 · 今天13:18
综述 | 终端智能体:命令行环境中的 AI Agents
专知会员服务
6+阅读 · 8月24日
综述 | 多模态智能体框架基础与前沿
专知会员服务
5+阅读 · 8月24日
相关基金
国家自然科学基金
7+阅读 · 2017年12月31日
国家自然科学基金
1+阅读 · 2016年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
4+阅读 · 2014年12月31日
微信扫码咨询专知VIP会员