论文题目:A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications
作者:Neel Mokaria、Rishie Raj、Dheeraj Baiju、Xiaoqian Shen、Shraman Pramanick、Kevin Qinghong Lin、Arda Senocak、Mike Zheng Shou、Philip Torr、Mohamed Elhoseiny、Yapeng Tian、Ruohan Gao、Salman Khan、Sayan Nag、Sanjoy Chowdhury、Dinesh Manocha
机构:马里兰大学、印度科学理工学院、阿卜杜拉国王科技大学、约翰斯·霍普金斯大学、牛津大学、蔚山科学技术院、新加坡国立大学、得克萨斯大学达拉斯分校、穆罕默德·本·扎耶德人工智能大学、多伦多大学等 论文链接:https://arxiv.org/pdf/2608.20379
大模型智能体的核心能力正在从“会调用工具”走向“能感知、能记忆、能规划、能行动”。过去许多智能体系统以文本为中心:模型接收任务描述,分解步骤,调用搜索、代码执行或网页工具,再用语言反馈驱动下一轮决策。多模态大模型出现后,智能体不再只能把世界压缩成文本,而可以直接接收图像、视频、音频、界面截图、传感器读数和动作反馈,在更接近真实环境的循环中完成任务。
这篇综述系统梳理多模态智能体框架的基础模块、技术谱系和应用前沿。作者把智能体框架抽象为三个相互连接的部分:感知模块负责把多模态输入转成可用于决策的表示;编排器承担推理、规划和记忆;动作模块通过工具调用、界面操作或具身控制影响外部环境。围绕这一结构,论文进一步分析三类多模态感知策略:委托式感知、后期融合感知和早期融合感知,并将其与推理规划、记忆架构、动作空间和评测方法联系起来。 与传统智能体综述不同,本文的重点不是泛泛讨论“智能体能做什么”,而是回答一个更细的问题:多模态究竟如何改变智能体的架构边界、能力来源、系统效率和应用形态。论文覆盖机器人与物理具身、图形界面与网页导航、多媒体生成编辑、长视频理解检索等场景,并从性能、效率、可扩展性、延迟、安全鲁棒、局限和未来方向给出系统分析。对于关注多模态大模型、具身智能、网页智能体和复杂任务自动化的读者,这是一篇很适合作为技术地图的综述。
大语言模型推动了智能体框架的发展:模型可以在自然语言中理解目标、分解任务、调用工具、管理中间状态,并根据反馈调整后续行为。但纯文本智能体有一个天然瓶颈:真实世界并不是文本流。用户界面、视频、音频、机器人传感、图像内容和物理环境都包含大量非文本信息,如果系统只能通过外部工具把这些信息转写成文字,就会损失空间关系、时间动态、细粒度视觉线索和跨模态对应关系。 多模态大模型使智能体架构发生变化。感知不再只是外围工具,而成为智能体闭环的一部分;记忆也不再只保存语言摘要,而需要保存图像、帧序列、音频片段、空间状态和跨模态事件;行动不再局限于输出文本或调用程序,而可以扩展到界面点击、内容编辑、机器人控制和多媒体生成。
论文的贡献主要体现在四个方面。第一,提出一个以感知、编排和行动为核心的多模态智能体分析框架。第二,按委托式、后期融合、早期融合三类策略梳理多模态感知架构,并进一步分析推理规划、记忆和动作空间。第三,按应用域整理代表性系统,覆盖机器人、界面导航、多媒体创作、长视频理解等方向。第四,从性能、效率、可扩展性、延迟、安全性和开放问题出发,总结当前多模态智能体走向真实部署时面临的关键约束。
编排器相当于智能体的执行中枢,通常围绕推理、规划和记忆展开。推理负责解释当前观察、理解任务约束、判断下一步需要什么信息;规划负责把目标拆成可执行步骤,并根据环境反馈动态改写计划;记忆负责保存短期上下文、历史经验和可复用知识,使智能体不必在每一轮都从零开始。 在多模态场景中,编排器面临更复杂的输入结构。一个机器人任务可能同时包含语言指令、相机画面、位姿信息和执行反馈;一个网页任务可能包含文本、布局、按钮图标和页面状态;一个视频理解任务需要处理跨时间的事件链。因此,多模态智能体的编排器不仅要会“想”,还要知道哪些模态证据可信、哪些信息需要进一步感知、哪些历史状态会影响当前动作。
感知模块把外部世界转化为智能体可操作的信息。早期系统常依赖专门工具,例如图像描述模型、目标检测器、语音识别器或网页解析器;较新的系统则更多依赖统一多模态模型,将图像、音频、视频和文本放入同一推理上下文。 行动模块决定智能体如何影响环境。语言驱动动作包括生成文本、编写代码、调用应用程序接口;视觉接地动作包括在界面上点击、拖拽、选择区域;具身动作则涉及机器人移动、抓取和与物理对象互动。感知和行动形成闭环:一次动作会改变环境,新的观察又会影响下一步规划。
论文讨论的模态包括文本、图像、音频、视频、图形界面、网页环境和物理传感信息。不同模态给智能体带来的挑战不同:图像强调空间定位,音频强调时间和声源,视频强调长程事件,界面强调布局和可操作元素,机器人环境则要求感知、控制和安全边界同时成立。
论文把多模态感知策略分为三类。委托式感知通过外部工具读取非文本模态,再把结果转为自然语言交给语言模型。这类方法容易接入现有模型和工具,工程成本低,但信息在“转写”过程中可能丢失,且依赖工具质量。 后期融合感知使用模态专用编码器,把图像、音频、视频等信息映射到语言模型可接收的表示空间。这类方法比委托式更紧密,能够保留更多模态特征,但通常需要适配训练和领域定制。早期融合感知则由统一多模态模型直接处理原始或近原始多模态输入,在统一嵌入空间中完成跨模态理解,是更端到端的路线,但计算成本、训练成本和上下文管理压力也更高。
多模态智能体的推理规划可分为语言推理、视觉接地推理和跨模态推理。语言推理适合任务分解、工具选择和长程计划,但当任务依赖空间关系或视觉证据时容易产生幻觉。视觉接地推理要求模型把计划绑定到图像区域、界面元素或物理对象。跨模态推理则进一步要求系统在文本、图像、声音、时间和行动反馈之间建立一致关系,例如根据视频事件回答问题,或根据视觉状态调整机器人计划。
多模态记忆有三种重要设计。模态特定记忆分别保存文本、图像、视频或传感信息,便于使用专门检索器,但跨模态整合成本较高。统一记忆把多模态内容投到共同表示空间,有利于跨模态检索和规划,但需要处理表示对齐与信息压缩。时间上下文管理则关注长视频、长期交互和多轮任务中的事件顺序,避免智能体只记得最近片段而丢失关键历史。 此外,带宽管理也是多模态智能体的现实问题。图像和视频会迅速占满上下文窗口,系统必须决定保存原始帧、区域特征、文本摘要还是检索索引。好的记忆机制不是“全都塞进去”,而是在保真度、检索速度和推理成本之间做取舍。
动作空间从语言输出扩展到界面操作、工具调用、程序控制和机器人动作。语言驱动动作可解释、易记录;视觉接地动作需要元素定位与状态追踪;具身动作还需要考虑连续控制、安全约束和执行误差。 评测方法也必须跟随动作空间变化。纯文本准确率无法衡量视觉定位是否正确、界面操作是否可复现、机器人动作是否安全、视频事件链是否完整。论文强调,多模态智能体评测应同时关注最终任务成功、过程轨迹、模态接地质量和真实环境鲁棒性。
文本智能体仍是多模态智能体的重要起点。早期系统通过浏览网页、调用搜索、执行代码或访问知识库来完成信息检索、问题求解和任务自动化。这些工作形成了后续多模态智能体的基本范式:目标分解、工具调用、环境反馈、记忆更新和自我修正。
机器人场景要求智能体把语言目标转化为物理动作,并持续感知环境变化。典型任务包括导航、抓取、桌面操作、移动机器人控制和人机协作。多模态模型可以把自然语言指令、相机画面和动作策略连接起来,但真实机器人系统还要处理动力学误差、传感噪声、实时约束和安全边界。 机器人智能体的关键难点在于闭环执行。一个计划在语言层面看似合理,落到物理空间可能会因为遮挡、抓取失败、物体移动或执行延迟而失效。因此,系统需要持续验证动作结果,并具备重新规划能力。
图形界面和网页导航是多模态智能体快速发展的应用域。智能体需要理解截图、按钮、表单、菜单、链接、文本区域和页面布局,并把用户目标转化为点击、输入、滚动、选择等操作。与传统网页解析相比,视觉界面智能体可以处理无法轻易结构化的页面和应用,但也更容易受到布局变化、弹窗、广告、动态渲染和视觉歧义影响。 这一方向的价值在于通用数字任务自动化:订票、购物、填表、信息查找、软件操作和跨应用流程都可以被统一建模为视觉接地的行动序列。
多媒体生成编辑智能体不只是生成一张图或一段音频,而是把创作过程拆成多步:理解用户意图,规划内容结构,调用生成模型,检查结果,局部修改,保持风格一致,并在多轮反馈中迭代。图像编辑、视频生成、音频合成和跨模态内容制作都属于这一方向。 这类系统的挑战在于审美评价和可控性。生成结果往往没有唯一标准,用户偏好也可能逐步变化。因此,智能体需要在自动规划与交互式修订之间取得平衡,既能主动提出编辑方案,也能根据用户反馈快速收敛。
长视频任务要求智能体在大量帧和长时间跨度中定位事件、理解因果、回答问题或检索片段。相比短图像输入,长视频带来更严重的上下文压力和时间推理难题。系统通常需要先抽取关键帧、建立时间索引、生成事件摘要,再在需要时回看局部片段。 这一方向展示了多模态记忆的重要性:没有好的时间管理和检索机制,模型容易遗漏早期事件、混淆人物和动作,或把局部片段误当成全局结论。
论文指出,不同应用域的性能瓶颈并不相同。机器人任务看重任务完成率、动作成功率和真实环境泛化;界面导航看重元素定位、操作序列和最终页面状态;长视频理解看重事件召回、时间定位和跨片段推理;多媒体生成编辑则更依赖人类偏好、内容一致性和编辑可控性。 因此,多模态智能体没有单一的“通用分数”。一个系统在图像问答上表现好,不代表它能可靠点击网页元素;一个视频理解模型能够回答事件问题,也不代表它能规划多步视频编辑流程。性能分析必须与任务环境、动作空间和评测协议绑定。
委托式感知通常在工程上更灵活,适合快速组合专用工具,但容易受到工具输出噪声影响。后期融合在特定模态和任务上往往更稳定,适合把视觉或音频特征接入语言规划。早期融合则具备更强的原生跨模态理解潜力,尤其适合需要细粒度视觉接地和复杂跨模态推理的任务。
多模态智能体的效率问题比文本智能体更突出。图像、音频和视频输入会增加编码成本,工具调用会带来等待时间,长程任务还会产生大量轨迹和中间状态。委托式系统把感知压力转移到外部工具,主模型负担较轻,但每次调用都会产生额外通信和解析成本。后期融合系统需要运行模态编码器,适合在特定任务中复用特征。早期融合系统表达力强,但对显存、上下文和推理吞吐提出更高要求。
效率优化不能只压缩模型。对于机器人,系统需要减少“停下来询问大模型”的频率,把高层规划和低层控制分离;对于界面导航,缓存页面结构和历史观察可以减少重复截图理解;对于多媒体生成,批量调用、局部编辑和结果筛选可以降低无效重试;对于长视频理解,关键帧选择、分层摘要和检索式回看是降低成本的关键。
可扩展性首先体现在任务长度和环境复杂度上。简单任务只需要一两轮感知和行动,复杂任务则要求智能体跨几十甚至上百步维持目标、状态和约束。多模态信息越多,系统越需要分层记忆、任务分解和检索机制,否则上下文会迅速膨胀。
论文强调,智能体从单一任务扩展到开放环境时会遇到三类问题。第一,模态分布变化,例如新网页布局、新机器人场景、新视频类型。第二,工具和动作接口变化,例如不同应用程序的交互规则不一致。第三,评测和安全边界变化,例如真实用户任务无法完全用离线指标覆盖。可扩展系统需要模块化感知、可替换工具、稳定记忆和可审计执行轨迹。
延迟直接决定多模态智能体能否进入真实使用。网页导航中,一次点击前如果需要长时间截图理解和推理,用户体验会明显下降;机器人控制中,延迟过高会破坏闭环稳定性;多媒体编辑中,生成等待会影响创作节奏;长视频检索中,全量处理会使问答无法实时响应。
主要延迟来自四个环节:模态编码、主模型推理、外部工具调用和环境执行反馈。委托式架构常受工具链调用影响;后期融合受编码器和适配模块影响;早期融合受大模型上下文和视觉令牌数量影响。有效系统通常采用分层处理:高层目标由大模型规划,低层动作由轻量策略或缓存模块执行,只有在不确定或关键决策时才调用重模型。
多模态智能体的风险不只是文本幻觉。视觉误识别可能导致点击错误按钮,视频事件遗漏可能导致错误结论,机器人误判可能造成物理风险,生成编辑系统可能产生不符合用户意图或违反安全规范的内容。跨模态不一致也很常见:文本提示、图像证据和动作反馈之间可能互相冲突。
安全设计需要贯穿感知、规划和行动。感知层要处理噪声、遮挡和对抗输入;规划层要识别不确定性并请求确认;动作层要限制高风险操作、保留回滚路径和审计记录。对于真实部署,权限边界、人工审批、沙箱环境、失败恢复和日志追踪应成为系统默认组成部分。
论文指出,当前多模态智能体研究仍处于快速演化阶段,许多系统只在特定任务或封闭环境中展示能力,跨论文比较并不容易。不同工作使用的模型、工具、数据、环境和评测协议差异很大,导致性能数字往往不能直接横向比较。
从实验系统走向真实部署仍有明显距离。首先,多模态输入成本高,尤其是视频和高分辨率界面。其次,真实环境状态不可控,界面变化、网络延迟、机器人误差都会放大失败。再次,很多智能体缺少可解释过程记录,失败后难以归因。最后,安全治理和隐私保护常被作为附加功能,而不是架构设计的核心。
未来研究需要更好的跨模态表征,使智能体既能保留细粒度视觉和时间信息,又能把这些信息转化为可规划、可验证的行动依据。感知模块还需要具备不确定性表达,知道何时需要放大图像、回看视频、调用专门工具或请求人类确认。
多模态智能体需要面向长任务和长期用户交互的记忆机制。理想记忆不只是保存对话摘要,还应保存关键视觉证据、操作轨迹、失败原因、用户偏好和环境状态,并能在后续任务中按需检索。持续学习则要求系统从成功和失败轨迹中改进,而不破坏既有安全边界。
评测应从静态问答走向可执行、可复查、可比较的过程评测。未来基准需要记录完整轨迹、环境状态、工具调用、错误恢复和人工干预,并覆盖更多真实场景。特别是机器人、网页操作和多媒体创作,最终成功率之外的过程质量同样关键。
多模态智能体越接近真实世界,越需要明确的治理结构。未来系统应把权限控制、风险分级、可撤销动作、审计日志和人类协同作为基础能力。安全不是阻碍智能体自主性的外部约束,而是让智能体可以被信任地放入真实任务的前提。
这篇综述把多模态智能体研究组织为一个清晰的技术地图:以感知、编排和行动为基础架构,以委托式、后期融合和早期融合为感知主线,以机器人、界面导航、多媒体创作和长视频理解为应用支点,再从性能、效率、可扩展性、延迟和安全鲁棒性审视系统走向真实部署的条件。 它传递出的核心判断是:多模态不是给智能体增加一个输入通道,而是在重塑智能体的闭环能力。真正可靠的多模态智能体必须同时解决感知接地、跨模态推理、长期记忆、可执行动作、过程评测和安全治理。未来竞争的重点也不会只是谁的模型更大,而是谁能把模型、工具、记忆、环境和治理机制组织成稳定可扩展的智能体系统。