Where is the multimodal goal post? On the Ability of Foundation Models to Recognize Contextually Important Moments - 专知论文

会员服务 ·

0

模态 · 多模 · 事件 · 多模态 · 识别 ·

Where is the multimodal goal post? On the Ability of Foundation Models to Recognize Contextually Important Moments

翻译：多模态目标何在？论基础模型识别上下文关键时刻的能力

Aditya K Surikuchi,Raquel Fernández,Sandro Pezzelle

Foundation models are used for many real-world applications involving language generation from temporally-ordered multimodal events. In this work, we study the ability of models to identify the most important sub-events in a video, which is a fundamental prerequisite for narrating or summarizing multimodal events. Specifically, we focus on football games and evaluate models on their ability to distinguish between important and non-important sub-events in a game. To this end, we construct a new dataset by leveraging human preferences for importance implicit in football game highlight reels, without any additional annotation costs. Using our dataset, which we will publicly release to the community, we compare several state-of-the-art multimodal models and show that they are not far from chance level performance. Analyses of models beyond standard evaluation metrics reveal their tendency to rely on a single dominant modality and their ineffectiveness in synthesizing necessary information from multiple sources. Our findings underline the importance of modular architectures that can handle sample-level heterogeneity in multimodal data and the need for complementary training procedures that can maximize cross-modal synergy.

翻译：基础模型被广泛应用于涉及从时序排序的多模态事件生成语言的现实应用中。本研究探讨模型识别视频中最重要子事件的能力，这是叙述或总结多模态事件的基本前提。具体而言，我们聚焦足球比赛场景，评估模型区分比赛中重要与非重要子事件的能力。为此，我们通过利用足球比赛集锦中隐含的人类重要性偏好构建新数据集，无需额外标注成本。基于我们将公开给研究社区的数据集，我们比较了若干先进多模态模型，发现其性能与随机水平相差无几。超越标准评估指标的分析揭示了模型倾向于依赖单一主导模态，且在综合多源必要信息方面效果有限。我们的研究结果强调了处理多模态数据样本级异质性的模块化架构的重要性，以及需要能够最大化跨模态协同的互补训练方法。

0

相关内容

【博士论文】基于多模态基础模型的上下文学习

【博士论文】基于多模态基础模型的上下文学习

专知会员服务

23+阅读 · 2025年12月17日

【斯坦福博士论文】多模态基础模型：从科学理解到科学发现

【斯坦福博士论文】多模态基础模型：从科学理解到科学发现

专知会员服务

31+阅读 · 2025年11月9日

【博士论文】弥合多模态基础模型与世界模型之间的鸿沟

【博士论文】弥合多模态基础模型与世界模型之间的鸿沟

专知会员服务

31+阅读 · 2025年10月9日

【EPFL博士论文】在多模态基础模型中扩展模态能力，附185页slides

【EPFL博士论文】在多模态基础模型中扩展模态能力，附185页slides

专知会员服务

26+阅读 · 2025年5月14日

【博士论文】高效且有效的基础大型多模态模型学习

【博士论文】高效且有效的基础大型多模态模型学习

专知会员服务

40+阅读 · 2024年10月21日

多模态大规模语言模型基准的综述

多模态大规模语言模型基准的综述

专知会员服务

41+阅读 · 2024年8月25日

【CMU博士论文】迈向多任务多模态模型：视频生成视角，200页pdf

【CMU博士论文】迈向多任务多模态模型：视频生成视角，200页pdf

专知会员服务

29+阅读 · 2024年5月28日

大模型如何高效利用资源？北邮等最新《资源高效大型语言模型和多模态基础模型》综述

大模型如何高效利用资源？北邮等最新《资源高效大型语言模型和多模态基础模型》综述

专知会员服务

52+阅读 · 2024年1月17日

如何构建多模态大模型？微软最新119页《多模态基础模型：从专家到通用助手》论文

如何构建多模态大模型？微软最新119页《多模态基础模型：从专家到通用助手》论文

专知会员服务

163+阅读 · 2023年9月21日

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

专知会员服务

105+阅读 · 2023年6月27日

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

专知

10+阅读 · 2023年4月6日

【ACM Multimedia2020】跨模态注意力Transformer模型的深度视频理解

【ACM Multimedia2020】跨模态注意力Transformer模型的深度视频理解

专知

15+阅读 · 2020年8月30日

深度多模态表示学习综述论文，22页pdf

深度多模态表示学习综述论文，22页pdf

专知

33+阅读 · 2020年6月21日

【工大SCIR笔记】多模态信息抽取简述

【工大SCIR笔记】多模态信息抽取简述

深度学习自然语言处理

19+阅读 · 2020年4月3日

多模态深度学习综述，18页pdf

多模态深度学习综述，18页pdf

专知

51+阅读 · 2020年3月29日

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

专知

53+阅读 · 2019年12月1日

视频分析/多模态学习论文、代码、数据集大列表

视频分析/多模态学习论文、代码、数据集大列表

专知

57+阅读 · 2019年7月13日

多模态技术展望：如何跨过语义鸿沟、异构鸿沟、数据缺失三大难关？

多模态技术展望：如何跨过语义鸿沟、异构鸿沟、数据缺失三大难关？

雷锋网

12+阅读 · 2019年3月26日

语义鸿沟、异构鸿沟、数据缺失，多模态技术如何跨过这些坎？

语义鸿沟、异构鸿沟、数据缺失，多模态技术如何跨过这些坎？

AI前线

15+阅读 · 2019年3月21日

多模态多任务学习新论文

多模态多任务学习新论文

专知

46+阅读 · 2019年2月9日

多层动态网络的建模、群体动力学分析与控制

国家自然科学基金

3+阅读 · 2015年12月31日

基于多轴飞行器航拍数据的植物生长分析与建模

国家自然科学基金

0+阅读 · 2015年12月31日

基于反馈型级联连接模型的多模态语义SFM方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于高斯过程模型的多示例多标记学习算法研究

国家自然科学基金

14+阅读 · 2015年12月31日

基于人脸表情、身体姿态和语音的多模态情感识别方法研究

国家自然科学基金

10+阅读 · 2015年12月31日

基于改进型视觉注意模型的多模态极相似图像检索方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于多模态信息集成的组合预测模型及其应用研究

国家自然科学基金

6+阅读 · 2015年12月31日

通用时序逻辑表达下的视频时空行为理解研究与应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于Phase-type分布的多状态系统可靠性模型研究

国家自然科学基金

0+阅读 · 2015年12月31日

运动目标间语义关系的时空建模及可视化研究

国家自然科学基金

1+阅读 · 2014年12月31日

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

Arxiv

0+阅读 · 2月19日

Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs

Arxiv

0+阅读 · 2月19日

Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models

Arxiv

0+阅读 · 2月17日

ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models

ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models

Arxiv

0+阅读 · 2月17日

Efficient Table Retrieval and Understanding with Multimodal Large Language Models

Arxiv

0+阅读 · 2月7日

Reliable and Responsible Foundation Models: A Comprehensive Survey

Arxiv

0+阅读 · 2月4日

From Consistency to Complementarity: Aligned and Disentangled Multi-modal Learning for Time Series Understanding and Reasoning

Arxiv

0+阅读 · 2月4日

Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models

Arxiv

0+阅读 · 1月29日

Dissecting Multimodal In-Context Learning: Modality Asymmetries and Circuit Dynamics in modern Transformers

Arxiv

0+阅读 · 1月28日

Think Then Embed: Generative Context Improves Multimodal Embedding

Arxiv

0+阅读 · 1月19日

VIP会员

文章信息

相关主题

最新内容

《COOL模型（行动循环圈）：军事领导体系中的战役层级变革流程》

《COOL模型（行动循环圈）：军事领导体系中的战役层级变革流程》

专知会员服务

9+阅读 · 4月20日

《系统簇式多域作战规划范畴论框架》

《系统簇式多域作战规划范畴论框架》

专知会员服务

5+阅读 · 4月20日

《美国防部指令6130.03，第2卷服役医疗标准：保留》

《美国防部指令6130.03，第2卷服役医疗标准：保留》

专知会员服务

3+阅读 · 4月20日

《美国防部指令6130.03，第1卷服役医疗标准：任命、征募或征召》

《美国防部指令6130.03，第1卷服役医疗标准：任命、征募或征召》

专知会员服务

2+阅读 · 4月20日

美空军“战场机载通信节点（BACN）”：美以对伊空战行动中隐形却关键的一环

美空军“战场机载通信节点（BACN）”：美以对伊空战行动中隐形却关键的一环

专知会员服务

3+阅读 · 4月20日

【CMU博士论文】面向非结构化环境下医疗急救的具身人工智能

【CMU博士论文】面向非结构化环境下医疗急救的具身人工智能

专知会员服务

2+阅读 · 4月20日

高效视频扩散模型：进展与挑战

高效视频扩散模型：进展与挑战

专知会员服务

2+阅读 · 4月20日

乌克兰前线的五项创新

乌克兰前线的五项创新

专知会员服务

7+阅读 · 4月20日

军事通信系统与设备的技术演进综述

军事通信系统与设备的技术演进综述

专知会员服务

5+阅读 · 4月20日

《北约 AI手册：作战人员的实用考量》（2026最新64页）

《北约 AI手册：作战人员的实用考量》（2026最新64页）

专知会员服务

10+阅读 · 4月20日

《北约标准：医疗评估手册》174页

《北约标准：医疗评估手册》174页

专知会员服务

5+阅读 · 4月20日

《提升生成模型的安全性与保障》博士论文

《提升生成模型的安全性与保障》博士论文

专知会员服务

5+阅读 · 4月20日

美国当前高超音速导弹发展概述

美国当前高超音速导弹发展概述

专知会员服务

4+阅读 · 4月19日

《高超音速武器：一项再度兴起的技术》120页slides

《高超音速武器：一项再度兴起的技术》120页slides

专知会员服务

15+阅读 · 4月19日

无人机蜂群建模与仿真方法

无人机蜂群建模与仿真方法

专知会员服务

14+阅读 · 4月19日

相关VIP内容

【博士论文】基于多模态基础模型的上下文学习

【博士论文】基于多模态基础模型的上下文学习

专知会员服务

23+阅读 · 2025年12月17日

【斯坦福博士论文】多模态基础模型：从科学理解到科学发现

【斯坦福博士论文】多模态基础模型：从科学理解到科学发现

专知会员服务

31+阅读 · 2025年11月9日

【博士论文】弥合多模态基础模型与世界模型之间的鸿沟

【博士论文】弥合多模态基础模型与世界模型之间的鸿沟

专知会员服务

31+阅读 · 2025年10月9日

【EPFL博士论文】在多模态基础模型中扩展模态能力，附185页slides

【EPFL博士论文】在多模态基础模型中扩展模态能力，附185页slides

专知会员服务

26+阅读 · 2025年5月14日

【博士论文】高效且有效的基础大型多模态模型学习

【博士论文】高效且有效的基础大型多模态模型学习

专知会员服务

40+阅读 · 2024年10月21日

多模态大规模语言模型基准的综述

多模态大规模语言模型基准的综述

专知会员服务

41+阅读 · 2024年8月25日

【CMU博士论文】迈向多任务多模态模型：视频生成视角，200页pdf

【CMU博士论文】迈向多任务多模态模型：视频生成视角，200页pdf

专知会员服务

29+阅读 · 2024年5月28日

大模型如何高效利用资源？北邮等最新《资源高效大型语言模型和多模态基础模型》综述

大模型如何高效利用资源？北邮等最新《资源高效大型语言模型和多模态基础模型》综述

专知会员服务

52+阅读 · 2024年1月17日

如何构建多模态大模型？微软最新119页《多模态基础模型：从专家到通用助手》论文

如何构建多模态大模型？微软最新119页《多模态基础模型：从专家到通用助手》论文

专知会员服务

163+阅读 · 2023年9月21日

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

专知会员服务

105+阅读 · 2023年6月27日

热门VIP内容

开通专知VIP会员享更多权益服务

《系统簇式多域作战规划范畴论框架》

《美国防部指令6130.03，第1卷服役医疗标准：任命、征募或征召》

《COOL模型（行动循环圈）：军事领导体系中的战役层级变革流程》

《美国防部指令6130.03，第2卷服役医疗标准：保留》

相关资讯

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

专知

10+阅读 · 2023年4月6日

【ACM Multimedia2020】跨模态注意力Transformer模型的深度视频理解

【ACM Multimedia2020】跨模态注意力Transformer模型的深度视频理解

专知

15+阅读 · 2020年8月30日

深度多模态表示学习综述论文，22页pdf

深度多模态表示学习综述论文，22页pdf

专知

33+阅读 · 2020年6月21日

【工大SCIR笔记】多模态信息抽取简述

【工大SCIR笔记】多模态信息抽取简述

深度学习自然语言处理

19+阅读 · 2020年4月3日

多模态深度学习综述，18页pdf

多模态深度学习综述，18页pdf

专知

51+阅读 · 2020年3月29日

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

专知

53+阅读 · 2019年12月1日

视频分析/多模态学习论文、代码、数据集大列表

视频分析/多模态学习论文、代码、数据集大列表

专知

57+阅读 · 2019年7月13日

多模态技术展望：如何跨过语义鸿沟、异构鸿沟、数据缺失三大难关？

多模态技术展望：如何跨过语义鸿沟、异构鸿沟、数据缺失三大难关？

雷锋网

12+阅读 · 2019年3月26日

语义鸿沟、异构鸿沟、数据缺失，多模态技术如何跨过这些坎？

语义鸿沟、异构鸿沟、数据缺失，多模态技术如何跨过这些坎？

AI前线

15+阅读 · 2019年3月21日

多模态多任务学习新论文

多模态多任务学习新论文

专知

46+阅读 · 2019年2月9日

相关论文

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

Arxiv

0+阅读 · 2月19日

Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs

Arxiv

0+阅读 · 2月19日

Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models

Arxiv

0+阅读 · 2月17日

ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models

ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models

Arxiv

0+阅读 · 2月17日

Efficient Table Retrieval and Understanding with Multimodal Large Language Models

Arxiv

0+阅读 · 2月7日

Reliable and Responsible Foundation Models: A Comprehensive Survey

Arxiv

0+阅读 · 2月4日

From Consistency to Complementarity: Aligned and Disentangled Multi-modal Learning for Time Series Understanding and Reasoning

Arxiv

0+阅读 · 2月4日

Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models

Arxiv

0+阅读 · 1月29日

Dissecting Multimodal In-Context Learning: Modality Asymmetries and Circuit Dynamics in modern Transformers

Arxiv

0+阅读 · 1月28日

Think Then Embed: Generative Context Improves Multimodal Embedding

Arxiv

0+阅读 · 1月19日

相关基金

多层动态网络的建模、群体动力学分析与控制

国家自然科学基金

3+阅读 · 2015年12月31日

基于多轴飞行器航拍数据的植物生长分析与建模

国家自然科学基金

0+阅读 · 2015年12月31日

基于反馈型级联连接模型的多模态语义SFM方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于高斯过程模型的多示例多标记学习算法研究

国家自然科学基金

14+阅读 · 2015年12月31日

基于人脸表情、身体姿态和语音的多模态情感识别方法研究

国家自然科学基金

10+阅读 · 2015年12月31日

基于改进型视觉注意模型的多模态极相似图像检索方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于多模态信息集成的组合预测模型及其应用研究

国家自然科学基金

6+阅读 · 2015年12月31日

通用时序逻辑表达下的视频时空行为理解研究与应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于Phase-type分布的多状态系统可靠性模型研究

国家自然科学基金

0+阅读 · 2015年12月31日

运动目标间语义关系的时空建模及可视化研究

国家自然科学基金

1+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员