学习现实世界中的情境感知 (Learning Situated Awareness in the Real World) - 专知论文

会员服务 ·

0

情境 · 情境感知 · 基准 · 视频 · 多模 ·

Learning Situated Awareness in the Real World

翻译：学习现实世界中的情境感知

Chuhan Li,Ruilin Han,Joy Hsu,Yongyuan Liang,Rajiv Dhawan,Jiajun Wu,Ming-Hsuan Yang,Xin Eric Wang

A core aspect of human perception is situated awareness, the ability to relate ourselves to the surrounding physical environment and reason over possible actions in context. However, most existing benchmarks for multimodal foundation models (MFMs) emphasize environment-centric spatial relations (relations among objects in a scene), while largely overlooking observer-centric relationships that require reasoning relative to agent's viewpoint, pose, and motion. To bridge this gap, we introduce SAW-Bench (Situated Awareness in the Real World), a novel benchmark for evaluating egocentric situated awareness using real-world videos. SAW-Bench comprises 786 self-recorded videos captured with Ray-Ban Meta (Gen 2) smart glasses spanning diverse indoor and outdoor environments, and over 2,071 human-annotated question-answer pairs. It probes a model's observer-centric understanding with six different awareness tasks. Our comprehensive evaluation reveals a human-model performance gap of 37.66%, even with the best-performing MFM, Gemini 3 Flash. Beyond this gap, our in-depth analysis uncovers several notable findings; for example, while models can exploit partial geometric cues in egocentric videos, they often fail to infer a coherent camera geometry, leading to systematic spatial reasoning errors. We position SAW-Bench as a benchmark for situated spatial intelligence, moving beyond passive observation to understanding physically grounded, observer-centric dynamics.

翻译：人类感知的一个核心方面是情境感知，即能够将自身与周围的物理环境联系起来，并在特定情境中推理可能的行动。然而，现有的大多数多模态基础模型（MFMs）的基准测试都强调以环境为中心的空间关系（场景中物体之间的关系），而很大程度上忽略了需要相对于智能体视角、姿态和运动进行推理的以观察者为中心的关系。为了弥补这一差距，我们引入了SAW-Bench（现实世界中的情境感知），这是一个利用真实世界视频评估自我中心情境感知的新基准。SAW-Bench包含786个使用Ray-Ban Meta（第二代）智能眼镜自录的视频，涵盖多样化的室内外环境，以及超过2,071个人工标注的问答对。它通过六种不同的感知任务来探究模型以观察者为中心的理解能力。我们的综合评估显示，即使使用性能最佳的多模态基础模型Gemini 3 Flash，人机性能差距仍高达37.66%。除了这一差距，我们的深入分析还揭示了几个值得注意的发现；例如，虽然模型能够利用自我中心视频中的部分几何线索，但它们常常无法推断出一致的相机几何，从而导致系统性的空间推理错误。我们将SAW-Bench定位为情境空间智能的基准，旨在超越被动观察，实现对物理基础、以观察者为中心的动态过程的理解。

0

相关内容

【博士论文】弥合多模态基础模型与世界模型之间的鸿沟

【博士论文】弥合多模态基础模型与世界模型之间的鸿沟

专知会员服务

29+阅读 · 2025年10月9日

从感知到认知：多模态大语言模型中视觉-语言交互推理综述

从感知到认知：多模态大语言模型中视觉-语言交互推理综述

专知会员服务

27+阅读 · 2025年10月1日

面向具身智能的多传感器融合感知综述：背景、方法、挑战与前景

面向具身智能的多传感器融合感知综述：背景、方法、挑战与前景

专知会员服务

18+阅读 · 2025年6月29日

【博士论文】学习视觉-语言表示以实现多模态理解

【博士论文】学习视觉-语言表示以实现多模态理解

专知会员服务

28+阅读 · 2025年2月8日

【斯坦福博士论文】从互联网视频中学习感知物理世界

【斯坦福博士论文】从互联网视频中学习感知物理世界

专知会员服务

23+阅读 · 2024年12月30日

【MIT博士论文】从现实世界中学习并为现实世界服务的三维建模与仿真，251页pdf

【MIT博士论文】从现实世界中学习并为现实世界服务的三维建模与仿真，251页pdf

专知会员服务

32+阅读 · 2024年3月26日

《探索基于深度学习的机器人感知技术，用于在户外地形中导航》美空军研究实验室2022最新20页报告

《探索基于深度学习的机器人感知技术，用于在户外地形中导航》美空军研究实验室2022最新20页报告

专知会员服务

34+阅读 · 2022年12月12日

多模态认知计算

多模态认知计算

专知会员服务

182+阅读 · 2022年9月16日

【含源代码】《用机器学习提高超视距空战中的态势感知能力》最新论文，巴西空军高级研究学院、卡内基梅隆大学机器人研究所

【含源代码】《用机器学习提高超视距空战中的态势感知能力》最新论文，巴西空军高级研究学院、卡内基梅隆大学机器人研究所

专知会员服务

117+阅读 · 2022年6月20日

【ICCV 2019 Tutorial】Learning to enhance in the real world（在现实世界中学习增强），苏黎世联邦理工学院 Martin Danelljan副教授

【ICCV 2019 Tutorial】Learning to enhance in the real world（在现实世界中学习增强），苏黎世联邦理工学院 Martin Danelljan副教授

专知会员服务

19+阅读 · 2019年10月30日

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

专知

12+阅读 · 2023年4月4日

数据驱动的态势认知技术及发展思考

数据驱动的态势认知技术及发展思考

专知

18+阅读 · 2022年7月12日

浅谈主动学习（Active Learning）

浅谈主动学习（Active Learning）

凡人机器学习

32+阅读 · 2020年6月18日

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

专知

21+阅读 · 2019年11月14日

让人工智能有情感的秘诀！清华权威报告看透情感计算【附下载】

让人工智能有情感的秘诀！清华权威报告看透情感计算【附下载】

人工智能学家

21+阅读 · 2019年10月7日

基于虚拟现实环境的深度学习模型构建

基于虚拟现实环境的深度学习模型构建

MOOC

24+阅读 · 2019年9月28日

西北工业大学发布最新遥感图像目标检测综述论文和Benchmark，带你全面了解遥感图像检测方法

西北工业大学发布最新遥感图像目标检测综述论文和Benchmark，带你全面了解遥感图像检测方法

专知

23+阅读 · 2019年9月5日

论具身学习及其设计：基于具身认知的视角

论具身学习及其设计：基于具身认知的视角

MOOC

15+阅读 · 2019年2月18日

具身认知学习环境设计：特征、要素、应用及发展趋势

具身认知学习环境设计：特征、要素、应用及发展趋势

MOOC

10+阅读 · 2018年10月30日

交互设计理论：视觉感知、认知摩擦、认知负荷和情境认知

交互设计理论：视觉感知、认知摩擦、认知负荷和情境认知

人人都是产品经理

20+阅读 · 2018年5月10日

基于时空模式的复杂行为识别方法研究

国家自然科学基金

2+阅读 · 2017年12月31日

基于虚拟现实的认知负荷与情绪干扰交互性分析关键技术研究

国家自然科学基金

1+阅读 · 2017年12月31日

基于人脸表情、身体姿态和语音的多模态情感识别方法研究

国家自然科学基金

10+阅读 · 2015年12月31日

视觉质量感知的脑电时空特性研究

国家自然科学基金

0+阅读 · 2015年12月31日

移动社会网络中情境感知的多维个性化信任评价研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于环境异质信息的机器觉察与仿生知觉方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

深度学习框架下基于情境线索的视觉注意研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于认知心理学与虚拟现实的感官营销与跨通道联结研究

国家自然科学基金

0+阅读 · 2014年12月31日

泛在计算环境中社会化驱动的情境感知个性化信息服务研究

国家自然科学基金

2+阅读 · 2014年12月31日

基于深度学习的特征融合在移动机器人视觉中的场景理解及研究

国家自然科学基金

12+阅读 · 2014年12月31日

Human-like Affective Cognition in Foundation Models

Arxiv

0+阅读 · 2月16日

Knowledge-Centric Metacognitive Learning

Arxiv

0+阅读 · 2月8日

Situated Brushing and Linking in Virtual and Augmented Reality

Arxiv

0+阅读 · 2月2日

From Perception to Action: Spatial AI Agents and World Models

Arxiv

0+阅读 · 2月2日

Learning Context: A Unified Framework and Roadmap for Context-Aware AI in Education

Arxiv

0+阅读 · 1月30日

PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models

Arxiv

0+阅读 · 1月22日

Learning Latent Action World Models In The Wild

Arxiv

0+阅读 · 1月20日

Generation of Real-time Robotic Emotional Expressions Learning from Human Demonstration in Mixed Reality

Arxiv

0+阅读 · 1月17日

Collaborative Representation Learning for Alignment of Tactile, Language, and Vision Modalities

Arxiv

0+阅读 · 1月16日

egoEMOTION: Egocentric Vision and Physiological Signals for Emotion and Personality Recognition in Real-World Tasks

Arxiv

0+阅读 · 1月14日

VIP会员

文章信息

相关主题

相关VIP内容

【博士论文】弥合多模态基础模型与世界模型之间的鸿沟

【博士论文】弥合多模态基础模型与世界模型之间的鸿沟

专知会员服务

29+阅读 · 2025年10月9日

从感知到认知：多模态大语言模型中视觉-语言交互推理综述

从感知到认知：多模态大语言模型中视觉-语言交互推理综述

专知会员服务

27+阅读 · 2025年10月1日

面向具身智能的多传感器融合感知综述：背景、方法、挑战与前景

面向具身智能的多传感器融合感知综述：背景、方法、挑战与前景

专知会员服务

18+阅读 · 2025年6月29日

【博士论文】学习视觉-语言表示以实现多模态理解

【博士论文】学习视觉-语言表示以实现多模态理解

专知会员服务

28+阅读 · 2025年2月8日

【斯坦福博士论文】从互联网视频中学习感知物理世界

【斯坦福博士论文】从互联网视频中学习感知物理世界

专知会员服务

23+阅读 · 2024年12月30日

【MIT博士论文】从现实世界中学习并为现实世界服务的三维建模与仿真，251页pdf

【MIT博士论文】从现实世界中学习并为现实世界服务的三维建模与仿真，251页pdf

专知会员服务

32+阅读 · 2024年3月26日

《探索基于深度学习的机器人感知技术，用于在户外地形中导航》美空军研究实验室2022最新20页报告

《探索基于深度学习的机器人感知技术，用于在户外地形中导航》美空军研究实验室2022最新20页报告

专知会员服务

34+阅读 · 2022年12月12日

多模态认知计算

多模态认知计算

专知会员服务

182+阅读 · 2022年9月16日

【含源代码】《用机器学习提高超视距空战中的态势感知能力》最新论文，巴西空军高级研究学院、卡内基梅隆大学机器人研究所

【含源代码】《用机器学习提高超视距空战中的态势感知能力》最新论文，巴西空军高级研究学院、卡内基梅隆大学机器人研究所

专知会员服务

117+阅读 · 2022年6月20日

【ICCV 2019 Tutorial】Learning to enhance in the real world（在现实世界中学习增强），苏黎世联邦理工学院 Martin Danelljan副教授

【ICCV 2019 Tutorial】Learning to enhance in the real world（在现实世界中学习增强），苏黎世联邦理工学院 Martin Danelljan副教授

专知会员服务

19+阅读 · 2019年10月30日

热门VIP内容

开通专知VIP会员享更多权益服务

【CMU博士论文】基于自适应表征的高效视觉建模

《多域作战中融合网络、电子战与动能机动》

AI智能体时代大模型安全风险与攻防新挑战

迈向个性化大语言模型驱动的智能体：基础、评估与未来方向

相关资讯

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

专知

12+阅读 · 2023年4月4日

数据驱动的态势认知技术及发展思考

数据驱动的态势认知技术及发展思考

专知

18+阅读 · 2022年7月12日

浅谈主动学习（Active Learning）

浅谈主动学习（Active Learning）

凡人机器学习

32+阅读 · 2020年6月18日

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

专知

21+阅读 · 2019年11月14日

让人工智能有情感的秘诀！清华权威报告看透情感计算【附下载】

让人工智能有情感的秘诀！清华权威报告看透情感计算【附下载】

人工智能学家

21+阅读 · 2019年10月7日

基于虚拟现实环境的深度学习模型构建

基于虚拟现实环境的深度学习模型构建

MOOC

24+阅读 · 2019年9月28日

西北工业大学发布最新遥感图像目标检测综述论文和Benchmark，带你全面了解遥感图像检测方法

西北工业大学发布最新遥感图像目标检测综述论文和Benchmark，带你全面了解遥感图像检测方法

专知

23+阅读 · 2019年9月5日

论具身学习及其设计：基于具身认知的视角

论具身学习及其设计：基于具身认知的视角

MOOC

15+阅读 · 2019年2月18日

具身认知学习环境设计：特征、要素、应用及发展趋势

具身认知学习环境设计：特征、要素、应用及发展趋势

MOOC

10+阅读 · 2018年10月30日

交互设计理论：视觉感知、认知摩擦、认知负荷和情境认知

交互设计理论：视觉感知、认知摩擦、认知负荷和情境认知

人人都是产品经理

20+阅读 · 2018年5月10日

相关论文

Human-like Affective Cognition in Foundation Models

Arxiv

0+阅读 · 2月16日

Knowledge-Centric Metacognitive Learning

Arxiv

0+阅读 · 2月8日

Situated Brushing and Linking in Virtual and Augmented Reality

Arxiv

0+阅读 · 2月2日

From Perception to Action: Spatial AI Agents and World Models

Arxiv

0+阅读 · 2月2日

Learning Context: A Unified Framework and Roadmap for Context-Aware AI in Education

Arxiv

0+阅读 · 1月30日

PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models

Arxiv

0+阅读 · 1月22日

Learning Latent Action World Models In The Wild

Arxiv

0+阅读 · 1月20日

Generation of Real-time Robotic Emotional Expressions Learning from Human Demonstration in Mixed Reality

Arxiv

0+阅读 · 1月17日

Collaborative Representation Learning for Alignment of Tactile, Language, and Vision Modalities

Arxiv

0+阅读 · 1月16日

egoEMOTION: Egocentric Vision and Physiological Signals for Emotion and Personality Recognition in Real-World Tasks

Arxiv

0+阅读 · 1月14日

相关基金

基于时空模式的复杂行为识别方法研究

国家自然科学基金

2+阅读 · 2017年12月31日

基于虚拟现实的认知负荷与情绪干扰交互性分析关键技术研究

国家自然科学基金

1+阅读 · 2017年12月31日

基于人脸表情、身体姿态和语音的多模态情感识别方法研究

国家自然科学基金

10+阅读 · 2015年12月31日

视觉质量感知的脑电时空特性研究

国家自然科学基金

0+阅读 · 2015年12月31日

移动社会网络中情境感知的多维个性化信任评价研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于环境异质信息的机器觉察与仿生知觉方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

深度学习框架下基于情境线索的视觉注意研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于认知心理学与虚拟现实的感官营销与跨通道联结研究

国家自然科学基金

0+阅读 · 2014年12月31日

泛在计算环境中社会化驱动的情境感知个性化信息服务研究

国家自然科学基金

2+阅读 · 2014年12月31日

基于深度学习的特征融合在移动机器人视觉中的场景理解及研究

国家自然科学基金

12+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员