ACM MM 2026 | DualG-MRAG:解耦宏观推理与微观匹配的多模态检索增强生成

导读

多模态检索增强生成正在成为缓解多模态大模型幻觉、提升知识密集型问答能力的重要方向。它的基本思路是:当模型需要回答复杂问题时,不只依赖模型参数,而是从包含文本、图片、表格等异构信息的外部语料中检索证据,再把证据交给多模态大模型生成答案。但当问题需要多跳推理时,传统多模态检索增强生成常常遇到两个矛盾:如果只做粗粒度文档匹配,会丢失图像局部区域、表格单元格和跨文档关系等关键证据;如果把所有细粒度视觉和结构信息都塞进统一图里,又会造成图规模膨胀、检索噪声增加和推理链路混乱。 ACM Multimedia 2026 论文《DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation》针对这个问题提出 DualG-MRAG。它的核心思想是把多模态图增强检索拆成两个层级:宏观推理图负责全局拓扑路由和跨文档多跳推理,微观匹配图负责局部细粒度证据验证。随后,论文用查询驱动的图神经网络在宏观图上传播相关性,并通过动态规划从前向传播中抽取显式推理路径,把原本碎片化的检索块转化为结构化证据链,提供给下游多模态大模型生成答案。 实验显示,DualG-MRAG 在 MMQA、WebQA 和 ScienceQA 等数据集上同时提升证据召回与问答准确率。在 MMQA 上,使用 Qwen3-VL-8B 时 EM 达到 46.00、F1 达到 51.19;在 ScienceQA 上平均准确率达到 90.99,并在多个科目、模态和年级划分上表现稳定。更关键的是,论文证明宏观图和微观图各自不可替代:去掉宏观图会显著损害跨模态多跳路由,去掉微观图则会削弱局部视觉证据过滤。

论文信息

论文题目:DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation 作者:Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li 机构:北京航空航天大学 会议:ACM Multimedia 2026 论文链接:https://arxiv.org/abs/2607.28580 关键词:多模态大语言模型、检索增强生成、图推理、图神经网络

研究背景:多模态增强检索的结构困境

多模态大语言模型在图文理解、视觉问答和跨模态推理上进展很快,但在知识密集型、长上下文和多跳问题上仍容易出现幻觉。多模态检索增强生成希望通过外部多模态语料增强模型:先检索相关文本、图片、表格或文档片段,再将证据提供给模型生成答案。 现有方法大致有两类。第一类是向量匹配式多模态 RAG,例如使用双编码器、多模态嵌入或大模型 embedding,将查询和候选文档映射到共享空间。这类方法适合一般检索,但通常把复杂证据压缩成静态向量,很难显式表达跨模态、跨文档的关系。例如,一个问题可能需要先从文本中定位实体,再从图像区域验证属性,最后结合表格数值得出答案,单纯相似度匹配很难表示这种路径。 第二类是图增强方法。它们尝试构建知识图或多模态图,通过结构化节点和边显式建模实体、关系和证据路径。但多模态场景比纯文本图更复杂。图像往往包含大量局部区域、对象和视觉细节,如果全部纳入全局图,图会快速膨胀,噪声也会急剧增加;如果只保留粗粒度图像或文档节点,关键局部证据又会被丢弃。论文将这一矛盾概括为宏观层面的多跳推理与微观层面的细粒度匹配之间的结构困境。

此外,现有图检索器通常依赖静态拓扑和固定信息传播规则,而真实查询的推理路径是动态的。不同问题需要激活不同关系、节点和证据路径。如果图传播与查询无关,就容易把无关节点一并扩散进检索结果,增加下游大模型的推理负担。即便检索到若干相关片段,如果没有显式路径组织,模型仍需自行从碎片证据中重建跨文档逻辑链。

方法概览:双层图、动态检索与路径解码

DualG-MRAG 的整体流程由三个查询驱动阶段组成:双层多模态图构建、查询驱动的图神经网络检索,以及显式路径解码。

第一阶段是双层多模态图。论文将多模态语料拆成宏观推理图和微观匹配图。宏观图面向全局实体与文档级关系,承担跨文档、跨模态、多跳拓扑路由;微观图面向细粒度证据,例如图像区域、表格单元和局部文本片段,承担局部验证和精确匹配。两者之间通过跨层对齐连接起来:宏观节点可以映射到相关微观子图,微观证据也可以反向支撑宏观推理路径。 这种设计的好处是解耦。宏观图不必承载所有视觉细节,因此避免图规模爆炸和噪声扩散;微观图也不必负责全局多跳推理,而专注于验证局部证据。最终,系统既保留了跨文档结构连接,又能对视觉和表格中的关键局部证据进行细粒度匹配。 第二阶段是查询驱动的图神经网络检索。给定查询后,系统先在微观图中进行图级和节点级匹配,识别补充性实体和候选细粒度证据;这些实体被用于初始化查询相关节点。随后,GNN 在宏观图上执行消息传播,使相关性沿着可能的推理路径动态扩散。不同于静态图检索器,DualG-MRAG 的传播过程由查询条件控制,边和节点的重要性随问题变化,从而更适合多跳问答。 第三阶段是显式路径解码。许多 RAG 系统将 top-k 文档或片段直接拼接给模型,但这会让下游多模态大模型承担隐式组织证据和重建推理链的任务。DualG-MRAG 从 GNN 前向传播中抽取结构化路径:通过动态规划逐层选择最优路径,把节点与关系序列化为显式 reasoning path。这样,模型输入不再是无组织证据块,而是带有拓扑连接的结构化证据图,能更直接指导答案生成。

技术细节:从文档检索到结构化证据链

论文的形式化设定是:给定多模态语料集合,包含文本、图片和表格等异构数据,系统需要为用户查询检索相关证据子集,并由多模态大模型生成答案。传统多模态 RAG 直接检索候选文档片段,而 DualG-MRAG 将检索问题转化为图上的查询条件消息传递。 在双层图中,宏观图关注全局实体、文档关系和跨源连接。它更接近“问题应该沿哪些语义节点和文档关系走”的层面。微观图关注局部证据匹配,例如某张图中的区域、某个表格中的行列、某段文本中的细节。论文将这两个层级用对齐索引连接起来,使宏观路径可以落到具体多模态证据上。 GNN 检索器的关键在于动态相关性传播。节点表示会根据查询和邻居信息更新,边消息也会被查询调制。这样,图传播不是盲目地沿静态拓扑扩散,而是根据当前问题选择更可能有用的路径。最终,系统得到候选文档的双分支相关性得分,并合并成最终排名。 显式路径解码则把检索结果变得更可用。论文将 GNN 每一层的传播看作推理路径展开,并用动态规划提取最高得分的节点序列。路径中的宏观实体会通过跨层对齐映射回原始多模态来源,相关文本段落、图像区域和表格数据被组织成逐步推理证据。对于下游 MLLM 来说,这种输入比简单拼接 top-k chunks 更有结构,也更容易减少幻觉。

实验设置:三类多模态问答数据集

论文在三个数据集上验证 DualG-MRAG 的检索与推理能力。 MMQA 是复杂跨模态多跳问答数据集,要求系统在异构表格、图像和文本之间捕获多跳拓扑依赖。WebQA 是大规模多模态开放域问答基准,关注系统从异构来源识别并整合视觉和文本证据生成自然语言答案的能力。ScienceQA 则用于评估跨学科科学问题上的综合推理表现,论文采用训练集构建知识库,并在 4241 个测试样本上评估。 基线分为三类。第一类是基础多模态大模型,包括 Qwen3-VL-4B 和 Qwen3-VL-8B。第二类是多模态 RAG 方法,包括 VisRAG、VLM2Vec-V2.0、CoRe-MMRAG 和 ViDoRAG。第三类是图增强 RAG 方法,包括 HM-RAG 和 MMGraphRAG。实现上,论文使用 Qwen3-VL-8B 进行开放信息抽取、宏观图构建和微观视觉特征解析;生成阶段统一使用相同 prompt,并以 Qwen3-VL-4B 与 Qwen3-VL-8B 作为下游 MLLM。

主结果:问答准确率显著提升

在 MMQA 和 WebQA 上,DualG-MRAG 在不同骨干模型下都取得最优或接近最优结果。以 Qwen3-VL-4B 为例,DualG-MRAG 在 MMQA 上达到 EM 44.20、F1 47.57,在 WebQA 上达到 ROUGE-L 50.10、BERTScore 70.58。以 Qwen3-VL-8B 为例,DualG-MRAG 在 MMQA 上达到 EM 46.00、F1 51.19,在 WebQA 上达到 ROUGE-L 48.92、BERTScore 69.74。

这些结果说明,DualG-MRAG 不只是提升了检索模块,而是能将结构化证据转化为最终问答收益。尤其在 MMQA 这类多跳跨模态任务上,方法相对最强基线有明显提升。论文指出,宏观图使模型能够捕捉全局语义依赖,微观图则避免将细粒度视觉证据直接混入全局图造成噪声,两者配合使模型能处理跨文档、跨模态的复杂问答。 值得注意的是,在 WebQA 的 Qwen3-VL-8B 设置下,部分指标上 ViDoRAG 或 VLM2Vec-V2.0 仍具竞争力,但 DualG-MRAG 在整体结构化推理和多跳证据召回方面表现更稳定。这也说明,图增强方法的优势主要出现在需要多步证据整合的复杂查询中,而不是所有检索问题都天然需要重图结构。

细粒度鲁棒性:跨科目、模态和年级稳定

ScienceQA 的细粒度实验进一步验证了方法鲁棒性。论文按照科目、上下文模态和年级层级评估准确率。DualG-MRAG 的平均准确率达到 90.99,高于 Qwen3-VL-8B zero-shot、VLM2Vec-V2.0 和 HM-RAG,并在自然科学、社会科学、图像上下文、无上下文、低年级和高年级等多个切分上获得最佳或接近最佳结果。

其中,IMG 子集上的 91.52% 体现了微观匹配图对视觉局部证据的帮助;自然科学和高年级问题往往需要更强逻辑推理,DualG-MRAG 在这些设置下也保持优势,说明宏观推理图能更好支持多跳结构化推理。该结果对多模态 RAG 很重要,因为真实任务往往不是单一题型,而是在题目难度、模态来源和知识领域上高度异质。

召回、效率与消融:宏观图和微观图都不可少

在检索召回上,DualG-MRAG 在 MMQA 和 WebQA 上的 Top-K recall 表现突出。MMQA 上,R@2 和 R@5 分别达到 49.4 和 61.9;WebQA 上,R@2 和 R@5 分别达到 37.0 和 58.2。相比 MMGraphRAG 等图增强基线,DualG-MRAG 能在更低噪声下找到关键证据,说明双层图设计确实改善了复杂检索。 效率方面,图 5 展示了召回率与查询延迟的权衡。传统图增强方法可能取得较高召回,但延迟显著;DualG-MRAG 将平均查询延迟控制在约 0.44 秒,同时保持高召回。论文认为,这是因为计算主要集中在微观匹配和宏观推理两个受控模块中,而不是在一个不断膨胀的统一细粒度图上做全局传播。

消融实验进一步说明各组件作用。去掉路径注入后,检索指标不变,但生成性能下降,表明显式路径主要提升的是下游推理组织能力。去掉微观图后,WebQA 的 R@5 从 58.2 降到 40.0,显示微观图对过滤局部视觉噪声和精确匹配很关键。去掉宏观图后,MMQA 的 R@5 从 61.9 降到 21.8,生成 EM 和 F1 也大幅下降,说明宏观拓扑连接是跨模态多跳路由的核心。 一个有意思的现象是,路径注入对不同规模模型影响不同。对于 Qwen3-VL-4B,去掉路径注入会造成较明显退化,说明小模型更依赖显式结构指导;对于 Qwen3-VL-8B,某些指标中路径注入的收益较小甚至可能略有限制,说明更强模型在一定程度上能自行整合证据,但结构化路径依然有助于提升整体可解释性和稳定性。

总结

DualG-MRAG 的核心贡献是把多模态 RAG 中的两个需求拆开处理:宏观层面需要结构化、多跳、跨文档推理;微观层面需要局部视觉和表格证据的精确匹配。通过宏观推理图、微观匹配图、查询驱动 GNN 检索和显式路径解码,论文在检索召回和问答准确率上都取得了较强结果。 这篇工作对多模态 RAG 的启发在于,未来检索增强系统不能只追求更大的 top-k 或更强的 embedding。复杂多模态问题需要“结构化证据组织”:哪些节点相关、哪些关系构成推理链、哪些局部视觉区域真正支撑答案,都应被显式建模。DualG-MRAG 给出了一种清晰方案,也提示图增强 RAG 的关键不是把所有细节塞进一张图,而是合理拆分推理层级,让全局路由和局部验证各司其职。

成为VIP会员查看完整内容
0
VIP会员
最新内容
综述 | Self-Evolving Coding Agents:自进化编程智能体
专知会员服务
0+阅读 · 今天13:16
美海军陆战队将三型无人机整合入统一战场网络
专知会员服务
2+阅读 · 今天9:39
《无人机蜂群:释放人类-蜂群编队的潜能》
专知会员服务
4+阅读 · 今天9:12
《战略战术化:一项综合性述评》
专知会员服务
2+阅读 · 今天9:08
美陆军-工业界协同推进反无人机系统技术发展
专知会员服务
1+阅读 · 今天8:46
《跨域指挥背景下的领导力发展》最新报告
专知会员服务
2+阅读 · 今天8:40
俄乌无人机战争的六大启示
专知会员服务
10+阅读 · 8月3日
《无人机空中监控:通信实验洞察》
专知会员服务
8+阅读 · 8月3日
微信扫码咨询专知VIP会员