通过互补信息提取与对齐增强多模态检索 (Enhancing Multimodal Retrieval via Complementary Information Extraction and Alignment) - 专知论文

会员服务 ·

0

多模 · 模态 · 互补信息 · 多模态检索 · 多模态 ·

Enhancing Multimodal Retrieval via Complementary Information Extraction and Alignment

翻译：通过互补信息提取与对齐增强多模态检索

Delong Zeng,Yuexiang Xie,Yaliang Li,Ying Shen

from arxiv, Accepted by ACL'2025

Multimodal retrieval has emerged as a promising yet challenging research direction in recent years. Most existing studies in multimodal retrieval focus on capturing information in multimodal data that is similar to their paired texts, but often ignores the complementary information contained in multimodal data. In this study, we propose CIEA, a novel multimodal retrieval approach that employs Complementary Information Extraction and Alignment, which transforms both text and images in documents into a unified latent space and features a complementary information extractor designed to identify and preserve differences in the image representations. We optimize CIEA using two complementary contrastive losses to ensure semantic integrity and effectively capture the complementary information contained in images. Extensive experiments demonstrate the effectiveness of CIEA, which achieves significant improvements over both divide-and-conquer models and universal dense retrieval models. We provide an ablation study, further discussions, and case studies to highlight the advancements achieved by CIEA. To promote further research in the community, we have released the source code at https://github.com/zengdlong/CIEA.

翻译：近年来，多模态检索已成为一个前景广阔但充满挑战的研究方向。现有的大多数多模态检索研究侧重于捕获多模态数据中与其配对文本相似的信息，但往往忽略了多模态数据中包含的互补信息。在本研究中，我们提出了CIEA，一种新颖的多模态检索方法，它采用互补信息提取与对齐技术，将文档中的文本和图像都转换到一个统一的潜在空间，并配备了一个互补信息提取器，旨在识别并保留图像表征中的差异。我们使用两种互补的对比损失来优化CIEA，以确保语义完整性并有效捕获图像中包含的互补信息。大量实验证明了CIEA的有效性，相较于分治模型和通用稠密检索模型，它都取得了显著的性能提升。我们提供了消融研究、进一步讨论和案例研究，以凸显CIEA所取得的进展。为促进该领域的进一步研究，我们已在 https://github.com/zengdlong/CIEA 开源了源代码。

0

相关内容

多模态检索增强生成综述

多模态检索增强生成综述

专知会员服务

39+阅读 · 2025年4月15日

《多模态对齐与融合》综述

《多模态对齐与融合》综述

专知会员服务

99+阅读 · 2024年11月27日

多模态复合编辑与检索综述

多模态复合编辑与检索综述

专知会员服务

25+阅读 · 2024年9月14日

多模态深度学习

多模态深度学习

专知会员服务

136+阅读 · 2023年1月15日

【TPAMI2022】关联关系驱动的多模态分类，AF: An Association-based Fusion Method for Multi-Modal Classification

【TPAMI2022】关联关系驱动的多模态分类，AF: An Association-based Fusion Method for Multi-Modal Classification

专知会员服务

27+阅读 · 2022年3月22日

跨模态检索研究进展综述

专知会员服务

53+阅读 · 2021年8月13日

基于深度学习的跨模态检索综述

专知会员服务

62+阅读 · 2021年3月25日

多模态摘要简述

专知会员服务

149+阅读 · 2020年9月6日

【Google】多模态Transformer视频检索，Multi-modal Transformer

【Google】多模态Transformer视频检索，Multi-modal Transformer

专知会员服务

103+阅读 · 2020年7月22日

最新《深度多模态数据分析》综述论文，26页pdf

最新《深度多模态数据分析》综述论文，26页pdf

专知会员服务

302+阅读 · 2020年6月16日

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

专知

10+阅读 · 2023年4月6日

数据受限条件下的多模态处理技术综述

数据受限条件下的多模态处理技术综述

专知

22+阅读 · 2022年7月16日

多模态视觉语言表征学习研究综述

多模态视觉语言表征学习研究综述

专知

27+阅读 · 2020年12月3日

赛尔笔记 | 多模态信息抽取简述

赛尔笔记 | 多模态信息抽取简述

专知

29+阅读 · 2020年4月12日

【工大SCIR笔记】多模态信息抽取简述

【工大SCIR笔记】多模态信息抽取简述

深度学习自然语言处理

19+阅读 · 2020年4月3日

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

专知

53+阅读 · 2019年12月1日

专家报告|深度学习+图像多模态融合

专家报告|深度学习+图像多模态融合

中国图象图形学报

12+阅读 · 2019年10月23日

语义鸿沟、异构鸿沟、数据缺失，多模态技术如何跨过这些坎？

语义鸿沟、异构鸿沟、数据缺失，多模态技术如何跨过这些坎？

AI前线

15+阅读 · 2019年3月21日

【论文推荐】最新六篇图像检索相关论文—多模态反馈、二值约束深度哈希、绘制草图、对话交互式、多目标图像检索

【论文推荐】最新六篇图像检索相关论文—多模态反馈、二值约束深度哈希、绘制草图、对话交互式、多目标图像检索

专知

14+阅读 · 2018年6月11日

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

专知

12+阅读 · 2017年12月21日

大规模多视角高维图像特征提取

国家自然科学基金

3+阅读 · 2017年12月31日

3D平移不变剪切波域统计相关性驱动的多模态医学图像融合方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于深度学习的多尺度本质图像提取方法

国家自然科学基金

5+阅读 · 2015年12月31日

基于改进型视觉注意模型的多模态极相似图像检索方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于多模态信息集成的组合预测模型及其应用研究

国家自然科学基金

6+阅读 · 2015年12月31日

基于框架提升变换的多源图像融合研究

国家自然科学基金

1+阅读 · 2015年12月31日

稀疏性多维联合优化在线视觉跟踪方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于深度学习的三维模型检索技术

国家自然科学基金

13+阅读 · 2014年12月31日

基于多模态医学图像处理的多维可视化辅助诊疗关键技术研究

国家自然科学基金

3+阅读 · 2014年12月31日

超光谱、全偏振、立体形貌的多模态成像研究

国家自然科学基金

0+阅读 · 2014年12月31日

Towards Trustworthy Multimodal Recommendation

Arxiv

0+阅读 · 1月31日

Rethinking Multimodal Learning from the Perspective of Mitigating Classification Ability Disproportion

Arxiv

0+阅读 · 1月29日

Multimodal data integration and cross-modal querying via orchestrated approximate message passing

Arxiv

0+阅读 · 1月21日

Multimodal Rumor Detection Enhanced by External Evidence and Forgery Features

Arxiv

0+阅读 · 1月21日

Unified Multimodal and Multilingual Retrieval via Multi-Task Learning with NLU Integration

Arxiv

0+阅读 · 1月21日

MultiCaption: Detecting disinformation using multilingual visual claims

Arxiv

0+阅读 · 1月16日

ATATA: One Algorithm to Align Them All

Arxiv

0+阅读 · 1月16日

MultiCheck: Strengthening Web Trust with Unified Multimodal Fact Verification

Arxiv

0+阅读 · 1月13日

Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism

Arxiv

0+阅读 · 1月9日

InfMasking: Unleashing Synergistic Information by Contrastive Multimodal Interactions

Arxiv

0+阅读 · 1月4日

VIP会员

文章信息

相关主题

多模态检索

相关VIP内容

多模态检索增强生成综述

多模态检索增强生成综述

专知会员服务

39+阅读 · 2025年4月15日

《多模态对齐与融合》综述

《多模态对齐与融合》综述

专知会员服务

99+阅读 · 2024年11月27日

多模态复合编辑与检索综述

多模态复合编辑与检索综述

专知会员服务

25+阅读 · 2024年9月14日

多模态深度学习

多模态深度学习

专知会员服务

136+阅读 · 2023年1月15日

【TPAMI2022】关联关系驱动的多模态分类，AF: An Association-based Fusion Method for Multi-Modal Classification

【TPAMI2022】关联关系驱动的多模态分类，AF: An Association-based Fusion Method for Multi-Modal Classification

专知会员服务

27+阅读 · 2022年3月22日

跨模态检索研究进展综述

专知会员服务

53+阅读 · 2021年8月13日

基于深度学习的跨模态检索综述

专知会员服务

62+阅读 · 2021年3月25日

多模态摘要简述

专知会员服务

149+阅读 · 2020年9月6日

【Google】多模态Transformer视频检索，Multi-modal Transformer

【Google】多模态Transformer视频检索，Multi-modal Transformer

专知会员服务

103+阅读 · 2020年7月22日

最新《深度多模态数据分析》综述论文，26页pdf

最新《深度多模态数据分析》综述论文，26页pdf

专知会员服务

302+阅读 · 2020年6月16日

热门VIP内容

开通专知VIP会员享更多权益服务

【CMU博士论文】基于自适应表征的高效视觉建模

《多域作战中融合网络、电子战与动能机动》

AI智能体时代大模型安全风险与攻防新挑战

迈向个性化大语言模型驱动的智能体：基础、评估与未来方向

相关资讯

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

专知

10+阅读 · 2023年4月6日

数据受限条件下的多模态处理技术综述

数据受限条件下的多模态处理技术综述

专知

22+阅读 · 2022年7月16日

多模态视觉语言表征学习研究综述

多模态视觉语言表征学习研究综述

专知

27+阅读 · 2020年12月3日

赛尔笔记 | 多模态信息抽取简述

赛尔笔记 | 多模态信息抽取简述

专知

29+阅读 · 2020年4月12日

【工大SCIR笔记】多模态信息抽取简述

【工大SCIR笔记】多模态信息抽取简述

深度学习自然语言处理

19+阅读 · 2020年4月3日

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

专知

53+阅读 · 2019年12月1日

专家报告|深度学习+图像多模态融合

专家报告|深度学习+图像多模态融合

中国图象图形学报

12+阅读 · 2019年10月23日

语义鸿沟、异构鸿沟、数据缺失，多模态技术如何跨过这些坎？

语义鸿沟、异构鸿沟、数据缺失，多模态技术如何跨过这些坎？

AI前线

15+阅读 · 2019年3月21日

【论文推荐】最新六篇图像检索相关论文—多模态反馈、二值约束深度哈希、绘制草图、对话交互式、多目标图像检索

【论文推荐】最新六篇图像检索相关论文—多模态反馈、二值约束深度哈希、绘制草图、对话交互式、多目标图像检索

专知

14+阅读 · 2018年6月11日

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

专知

12+阅读 · 2017年12月21日

相关论文

Towards Trustworthy Multimodal Recommendation

Arxiv

0+阅读 · 1月31日

Rethinking Multimodal Learning from the Perspective of Mitigating Classification Ability Disproportion

Arxiv

0+阅读 · 1月29日

Multimodal data integration and cross-modal querying via orchestrated approximate message passing

Arxiv

0+阅读 · 1月21日

Multimodal Rumor Detection Enhanced by External Evidence and Forgery Features

Arxiv

0+阅读 · 1月21日

Unified Multimodal and Multilingual Retrieval via Multi-Task Learning with NLU Integration

Arxiv

0+阅读 · 1月21日

MultiCaption: Detecting disinformation using multilingual visual claims

Arxiv

0+阅读 · 1月16日

ATATA: One Algorithm to Align Them All

Arxiv

0+阅读 · 1月16日

MultiCheck: Strengthening Web Trust with Unified Multimodal Fact Verification

Arxiv

0+阅读 · 1月13日

Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism

Arxiv

0+阅读 · 1月9日

InfMasking: Unleashing Synergistic Information by Contrastive Multimodal Interactions

Arxiv

0+阅读 · 1月4日

相关基金

大规模多视角高维图像特征提取

国家自然科学基金

3+阅读 · 2017年12月31日

3D平移不变剪切波域统计相关性驱动的多模态医学图像融合方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于深度学习的多尺度本质图像提取方法

国家自然科学基金

5+阅读 · 2015年12月31日

基于改进型视觉注意模型的多模态极相似图像检索方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于多模态信息集成的组合预测模型及其应用研究

国家自然科学基金

6+阅读 · 2015年12月31日

基于框架提升变换的多源图像融合研究

国家自然科学基金

1+阅读 · 2015年12月31日

稀疏性多维联合优化在线视觉跟踪方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于深度学习的三维模型检索技术

国家自然科学基金

13+阅读 · 2014年12月31日

基于多模态医学图像处理的多维可视化辅助诊疗关键技术研究

国家自然科学基金

3+阅读 · 2014年12月31日

超光谱、全偏振、立体形貌的多模态成像研究

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员