Current evaluation frameworks and benchmarks for LLM powered agents focus on text chat driven agents, these frameworks do not expose the persona of user to the agent, thus operating in a user agnostic environment. Importantly, in customer experience management domain, the agent's behaviour evolves as the agent learns about user personality. With proliferation of real time TTS and multi-modal language models, LLM based agents are gradually going to become multi-modal. Towards this, we propose the MM-tau-p$^2$ benchmark with metrics for evaluating the robustness of multi-modal agents in dual control setting with and without persona adaption of user, while also taking user inputs in the planning process to resolve a user query. In particular, our work shows that even with state of-the-art frontier LLMs like GPT-5, GPT 4.1, there are additional considerations measured using metrics viz. multi-modal robustness, turn overhead while introducing multi-modality into LLM based agents. Overall, MM-tau-p$^2$ builds on our prior work FOCAL and provides a holistic way of evaluating multi-modal agents in an automated way by introducing 12 novel metrics. We also provide estimates of these metrics on the telecom and retail domains by using the LLM-as-judge approach using carefully crafted prompts with well defined rubrics for evaluating each conversation.


翻译:当前针对基于大语言模型(LLM)的智能体的评估框架与基准主要聚焦于文本对话驱动的智能体,这些框架未将用户角色信息暴露给智能体,因而在用户无关的环境中运行。值得注意的是,在客户体验管理领域,智能体的行为会随着其对用户个性的了解而动态演变。随着实时文本转语音(TTS)与多模态语言模型的普及,基于LLM的智能体正逐步向多模态方向发展。为此,我们提出了MM-tau-p$^2$基准及其配套度量指标,用于评估多模态智能体在双控制场景下的鲁棒性,涵盖有无用户角色自适应两种情况,同时在规划过程中纳入用户输入以解决用户查询。特别地,我们的研究表明,即使采用如GPT-5、GPT-4.1等最先进的尖端LLM,在将多模态能力引入基于LLM的智能体时,仍需通过度量指标(如多模态鲁棒性、交互轮次开销)考量额外因素。总体而言,MM-tau-p$^2$在我们先前工作FOCAL的基础上,通过引入12项新颖度量指标,提供了一种自动化评估多模态智能体的整体性方法。我们还基于LLM即评判者(LLM-as-judge)方法,通过精心设计的提示语与明确定义的评分准则,在电信与零售领域对这些度量指标进行了估算。

0
下载
关闭预览

相关内容

智能体评判者(Agent-as-a-Judge)研究综述
专知会员服务
37+阅读 · 1月9日
LLM/智能体作为数据分析师:综述
专知会员服务
38+阅读 · 2025年9月30日
大语言模型智能体的评估与基准:综述
专知会员服务
49+阅读 · 2025年7月31日
《大型多模态智能体》综述
专知会员服务
106+阅读 · 2024年2月26日
面向多智能体博弈对抗的对手建模框架
专知
18+阅读 · 2022年9月28日
Pytorch多模态框架MMF
专知
50+阅读 · 2020年6月20日
专访俞栋:多模态是迈向通用人工智能的重要方向
AI科技评论
26+阅读 · 2019年9月9日
用Rasa NLU构建自己的中文NLU系统
待字闺中
18+阅读 · 2017年9月18日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
8+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
10+阅读 · 2013年12月31日
国家自然科学基金
21+阅读 · 2013年12月31日
国家自然科学基金
18+阅读 · 2009年12月31日
国家自然科学基金
36+阅读 · 2008年12月31日
国家自然科学基金
17+阅读 · 2008年12月31日
Measuring Agents in Production
Arxiv
0+阅读 · 2月3日
VIP会员
最新内容
美国当前高超音速导弹发展概述
专知会员服务
0+阅读 · 58分钟前
《高超音速武器:一项再度兴起的技术》120页slides
无人机蜂群建模与仿真方法
专知会员服务
1+阅读 · 今天14:08
澳大利亚发布《国防战略(2026年)》
专知会员服务
0+阅读 · 今天13:42
【CMU博士论文】迈向基于基础先验的 4D 感知研究
专知会员服务
0+阅读 · 今天13:46
全球高超音速武器最新发展趋势
专知会员服务
1+阅读 · 今天13:17
相关VIP内容
智能体评判者(Agent-as-a-Judge)研究综述
专知会员服务
37+阅读 · 1月9日
LLM/智能体作为数据分析师:综述
专知会员服务
38+阅读 · 2025年9月30日
大语言模型智能体的评估与基准:综述
专知会员服务
49+阅读 · 2025年7月31日
《大型多模态智能体》综述
专知会员服务
106+阅读 · 2024年2月26日
相关基金
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
8+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
10+阅读 · 2013年12月31日
国家自然科学基金
21+阅读 · 2013年12月31日
国家自然科学基金
18+阅读 · 2009年12月31日
国家自然科学基金
36+阅读 · 2008年12月31日
国家自然科学基金
17+阅读 · 2008年12月31日
Top
微信扫码咨询专知VIP会员