Improving through Interaction: Searching Behavioral Representation Spaces with CMA-ES-IG - 专知论文

会员服务 ·

0

交互 · 排序 · 机器人 · 在行 · 行为表示 ·

Improving through Interaction: Searching Behavioral Representation Spaces with CMA-ES-IG

翻译：通过交互改进：利用CMA-ES-IG在行为表示空间中进行搜索

Nathaniel Dennler,Zhonghao Shi,Yiran Tao,Andreea Bobu,Stefanos Nikolaidis,Maja Matarić

from arxiv, Under submission to IJRR

Robots that interact with humans must adapt to individual users' preferences to operate effectively in human-centered environments. An intuitive and effective technique to learn non-expert users' preferences is through rankings of robot behaviors, e.g., trajectories, gestures, or voices. Existing techniques primarily focus on generating queries that optimize preference learning outcomes, such as sample efficiency or final preference estimation accuracy. However, the focus on outcome overlooks key user expectations in the process of providing these rankings, which can negatively impact users' adoption of robotic systems. This work proposes the Covariance Matrix Adaptation Evolution Strategies with Information Gain (CMA-ES-IG) algorithm. CMA-ES-IG explicitly incorporates user experience considerations into the preference learning process by suggesting perceptually distinct and informative trajectories for users to rank. We demonstrate these benefits through both simulated studies and real-robot experiments. CMA-ES-IG, compared to state-of-the-art alternatives, (1) scales more effectively to higher-dimensional preference spaces, (2) maintains computational tractability for high-dimensional problems, (3) is robust to noisy or inconsistent user feedback, and (4) is preferred by non-expert users in identifying their preferred robot behaviors. This project's code is available at github.com/interaction-lab/CMA-ES-IG

翻译：与人类交互的机器人必须适应个体用户的偏好，才能在以人为中心的环境中有效运行。学习非专业用户偏好的一种直观且有效的技术是通过对机器人行为（例如轨迹、手势或语音）进行排序。现有技术主要侧重于生成优化偏好学习结果的查询，例如样本效率或最终偏好估计准确性。然而，对结果的关注忽视了用户在提供这些排序过程中的关键期望，这可能对用户采用机器人系统产生负面影响。本研究提出了带有信息增益的协方差矩阵自适应进化策略（CMA-ES-IG）算法。CMA-ES-IG通过建议感知上不同且信息丰富的轨迹供用户排序，明确将用户体验考虑纳入偏好学习过程。我们通过模拟研究和真实机器人实验证明了这些优势。与最先进的替代方案相比，CMA-ES-IG（1）能更有效地扩展到更高维的偏好空间，（2）对高维问题保持计算可处理性，（3）对噪声或不一致的用户反馈具有鲁棒性，以及（4）在识别用户偏好的机器人行为方面更受非专业用户青睐。本项目的代码可在github.com/interaction-lab/CMA-ES-IG获取。

0

相关内容

【斯坦福博士论文】利用在线交互经验提升机器人学习稳健性的算法研究

【斯坦福博士论文】利用在线交互经验提升机器人学习稳健性的算法研究

专知会员服务

18+阅读 · 3月19日

空间智能如何？牛津大学博士论文《深度具身智能体的空间推理与规划》230页pdf

空间智能如何？牛津大学博士论文《深度具身智能体的空间推理与规划》230页pdf

专知会员服务

58+阅读 · 2024年10月23日

【牛津大学博士论文】深度具身智能体的空间推理与规划

【牛津大学博士论文】深度具身智能体的空间推理与规划

专知会员服务

45+阅读 · 2024年10月2日

【MIT博士论文】人工智能与人类对齐的构建模块：指定、检查、建模和修订，216页pdf

【MIT博士论文】人工智能与人类对齐的构建模块：指定、检查、建模和修订，216页pdf

专知会员服务

44+阅读 · 2024年4月2日

【阿姆斯特丹博士论文】从有偏见的用户互动中学习推荐系统，127页pdf

【阿姆斯特丹博士论文】从有偏见的用户互动中学习推荐系统，127页pdf

专知会员服务

24+阅读 · 2024年2月4日

面向虚实融合的人机交互

面向虚实融合的人机交互

专知会员服务

72+阅读 · 2023年6月25日

【CMU博士论文】非结构化环境中的多模态导航学习，177页pdf

【CMU博士论文】非结构化环境中的多模态导航学习，177页pdf

专知会员服务

49+阅读 · 2022年12月8日

心理学如何用于推荐系统？RecSys2022《心理学信息推荐系统》教程，附Slides与书籍

心理学如何用于推荐系统？RecSys2022《心理学信息推荐系统》教程，附Slides与书籍

专知会员服务

61+阅读 · 2022年10月2日

心理学如何用于推荐？格拉茨技术大学最新85页WWW2022《心理学嵌入推荐系统》教程

心理学如何用于推荐？格拉茨技术大学最新85页WWW2022《心理学嵌入推荐系统》教程

专知会员服务

27+阅读 · 2022年5月2日

【CoRL2020最佳论文】学习潜在表示以影响多智能体交互作用

【CoRL2020最佳论文】学习潜在表示以影响多智能体交互作用

专知会员服务

28+阅读 · 2020年11月20日

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

专知

12+阅读 · 2023年4月4日

探索(Exploration)还是利用(Exploitation)？强化学习如何tradeoff？

探索(Exploration)还是利用(Exploitation)？强化学习如何tradeoff？

深度强化学习实验室

13+阅读 · 2020年8月23日

如何构建行业知识图谱（以医疗行业为例）

如何构建行业知识图谱（以医疗行业为例）

专知

31+阅读 · 2019年11月7日

AMiner发布《人工智能之信息检索与推荐》报告，附72页PDF下载

AMiner发布《人工智能之信息检索与推荐》报告，附72页PDF下载

专知

23+阅读 · 2019年9月6日

PlaNet 简介：用于强化学习的深度规划网络

PlaNet 简介：用于强化学习的深度规划网络

谷歌开发者

13+阅读 · 2019年3月16日

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

专知

26+阅读 · 2019年2月12日

推荐系统

炼数成金订阅号

28+阅读 · 2019年1月17日

知识在检索式对话系统的应用

知识在检索式对话系统的应用

微信AI

32+阅读 · 2018年9月20日

干货｜基于双流递归神经网络的人体骨架行为识别！

干货｜基于双流递归神经网络的人体骨架行为识别！

全球人工智能

13+阅读 · 2017年12月15日

赛尔原创 | 聊天机器人中用户出行消费意图识别方法研究

赛尔原创 | 聊天机器人中用户出行消费意图识别方法研究

哈工大SCIR

19+阅读 · 2017年10月30日

基于时空模式的复杂行为识别方法研究

国家自然科学基金

2+阅读 · 2017年12月31日

基于人机交互的数据驱动式人群行为建模与仿真研究

国家自然科学基金

4+阅读 · 2015年12月31日

主被动视角联合的细粒度行为识别

国家自然科学基金

1+阅读 · 2015年12月31日

面向推荐系统中异构隐式反馈建模的迁移学习技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

非结构环境下基于三维肢体动作理解的工业机器人交互技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于多样化查询的多标记主动学习研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于多通道深度卷积神经网络的人体行为分析研究

国家自然科学基金

6+阅读 · 2015年12月31日

状态空间搜索的anytime模式及其高效算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于空间认知常识的定性地理信息检索研究

国家自然科学基金

2+阅读 · 2014年12月31日

基于深度信息和显著计算的手势交互技术研究及应用

国家自然科学基金

1+阅读 · 2014年12月31日

DIAURec: Dual-Intent Space Representation Optimization for Recommendation

Arxiv

0+阅读 · 4月13日

DIAURec: Dual-Intent Space Representation Optimization for Recommendation

Arxiv

0+阅读 · 4月10日

Cross-Modal Visuo-Tactile Object Perception

Arxiv

0+阅读 · 4月2日

Exploring the Interplay Between Voice, Personality, and Gender in Human-Agent Interactions

Arxiv

0+阅读 · 4月1日

Interactive Force-Impedance Control

Arxiv

0+阅读 · 3月31日

Exploring the Role of Interaction Data to Empower End-User Decision-Making In UI Personalization

Arxiv

0+阅读 · 3月19日

Interpreting Context-Aware Human Preferences for Multi-Objective Robot Navigation

Arxiv

0+阅读 · 3月18日

Navigation beyond Wayfinding: Robots Collaborating with Visually Impaired Users for Environmental Interactions

Arxiv

0+阅读 · 3月15日

CRED: Counterfactual Reasoning and Environment Design for Active Preference Learning

Arxiv

0+阅读 · 3月9日

Planning from Observation and Interaction

Arxiv

0+阅读 · 2月27日

VIP会员

文章信息

相关主题

最新内容

美国从乌克兰无人机战争中学习经验

美国从乌克兰无人机战争中学习经验

专知会员服务

1+阅读 · 今天15:03

ICML 2026 | 面向视觉语言模型的语义鲁棒性认证

ICML 2026 | 面向视觉语言模型的语义鲁棒性认证

专知会员服务

0+阅读 · 今天14:31

综述 | 智能体电子设计自动化：从“交接有效性”重新理解Agentic EDA

综述 | 智能体电子设计自动化：从“交接有效性”重新理解Agentic EDA

专知会员服务

0+阅读 · 今天14:29

深入解读 Palantir AIP：全球最具争议的人工智能平台究竟如何运作

深入解读 Palantir AIP：全球最具争议的人工智能平台究竟如何运作

专知会员服务

12+阅读 · 6月20日

ICML 2026 | 多任务贝叶斯上下文学习：让 Transformer 在测试时显式适应新先验

ICML 2026 | 多任务贝叶斯上下文学习：让 Transformer 在测试时显式适应新先验

专知会员服务

4+阅读 · 6月19日

ACL 2026综述 | 大规模手语数据集：资源、基准与标注标准

ACL 2026综述 | 大规模手语数据集：资源、基准与标注标准

专知会员服务

7+阅读 · 6月19日

ICML 2026 Spotlight | SmoothSMoE：解析稀疏 MoE 路由不连续

ICML 2026 Spotlight | SmoothSMoE：解析稀疏 MoE 路由不连续

专知会员服务

6+阅读 · 6月18日

综述 | 周期表视角下的大模型推理：范式、方法与失败模式

综述 | 周期表视角下的大模型推理：范式、方法与失败模式

专知会员服务

8+阅读 · 6月18日

《廉价自杀式无人机战争的军事战略影响：乌克兰和伊朗案例研究》

《廉价自杀式无人机战争的军事战略影响：乌克兰和伊朗案例研究》

专知会员服务

11+阅读 · 6月18日

《面向反无人机作战的联邦式可解释射频–光电/红外情报融合：边缘人工智能优化、电子战韧性及分布式监视验证》

《面向反无人机作战的联邦式可解释射频–光电/红外情报融合：边缘人工智能优化、电子战韧性及分布式监视验证》

专知会员服务

11+阅读 · 6月18日

ICML 2026 | FR3D：解耦自车运动的未来动态三维重建世界模型

ICML 2026 | FR3D：解耦自车运动的未来动态三维重建世界模型

专知会员服务

7+阅读 · 6月17日

【伯克利博士论文】迈向可扩展与自我演进的大语言模型智能体

【伯克利博士论文】迈向可扩展与自我演进的大语言模型智能体

专知会员服务

12+阅读 · 6月17日

学习数据的几何：形状空间分析数学综述

学习数据的几何：形状空间分析数学综述

专知会员服务

8+阅读 · 6月17日

《现代防空系统综述：架构、传感器、拦截器及新兴威胁环境对基础设施受限防御环境的影响》2026最新长综述

《现代防空系统综述：架构、传感器、拦截器及新兴威胁环境对基础设施受限防御环境的影响》2026最新长综述

专知会员服务

21+阅读 · 6月17日

定向能反无人机系统最新发展动态

定向能反无人机系统最新发展动态

专知会员服务

10+阅读 · 6月17日

相关VIP内容

【斯坦福博士论文】利用在线交互经验提升机器人学习稳健性的算法研究

【斯坦福博士论文】利用在线交互经验提升机器人学习稳健性的算法研究

专知会员服务

18+阅读 · 3月19日

空间智能如何？牛津大学博士论文《深度具身智能体的空间推理与规划》230页pdf

空间智能如何？牛津大学博士论文《深度具身智能体的空间推理与规划》230页pdf

专知会员服务

58+阅读 · 2024年10月23日

【牛津大学博士论文】深度具身智能体的空间推理与规划

【牛津大学博士论文】深度具身智能体的空间推理与规划

专知会员服务

45+阅读 · 2024年10月2日

【MIT博士论文】人工智能与人类对齐的构建模块：指定、检查、建模和修订，216页pdf

【MIT博士论文】人工智能与人类对齐的构建模块：指定、检查、建模和修订，216页pdf

专知会员服务

44+阅读 · 2024年4月2日

【阿姆斯特丹博士论文】从有偏见的用户互动中学习推荐系统，127页pdf

【阿姆斯特丹博士论文】从有偏见的用户互动中学习推荐系统，127页pdf

专知会员服务

24+阅读 · 2024年2月4日

面向虚实融合的人机交互

面向虚实融合的人机交互

专知会员服务

72+阅读 · 2023年6月25日

【CMU博士论文】非结构化环境中的多模态导航学习，177页pdf

【CMU博士论文】非结构化环境中的多模态导航学习，177页pdf

专知会员服务

49+阅读 · 2022年12月8日

心理学如何用于推荐系统？RecSys2022《心理学信息推荐系统》教程，附Slides与书籍

心理学如何用于推荐系统？RecSys2022《心理学信息推荐系统》教程，附Slides与书籍

专知会员服务

61+阅读 · 2022年10月2日

心理学如何用于推荐？格拉茨技术大学最新85页WWW2022《心理学嵌入推荐系统》教程

心理学如何用于推荐？格拉茨技术大学最新85页WWW2022《心理学嵌入推荐系统》教程

专知会员服务

27+阅读 · 2022年5月2日

【CoRL2020最佳论文】学习潜在表示以影响多智能体交互作用

【CoRL2020最佳论文】学习潜在表示以影响多智能体交互作用

专知会员服务

28+阅读 · 2020年11月20日

热门VIP内容

开通专知VIP会员享更多权益服务

ICML 2026 | 面向视觉语言模型的语义鲁棒性认证

深入解读 Palantir AIP：全球最具争议的人工智能平台究竟如何运作

美国从乌克兰无人机战争中学习经验

综述 | 智能体电子设计自动化：从“交接有效性”重新理解Agentic EDA

相关资讯

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

专知

12+阅读 · 2023年4月4日

探索(Exploration)还是利用(Exploitation)？强化学习如何tradeoff？

探索(Exploration)还是利用(Exploitation)？强化学习如何tradeoff？

深度强化学习实验室

13+阅读 · 2020年8月23日

如何构建行业知识图谱（以医疗行业为例）

如何构建行业知识图谱（以医疗行业为例）

专知

31+阅读 · 2019年11月7日

AMiner发布《人工智能之信息检索与推荐》报告，附72页PDF下载

AMiner发布《人工智能之信息检索与推荐》报告，附72页PDF下载

专知

23+阅读 · 2019年9月6日

PlaNet 简介：用于强化学习的深度规划网络

PlaNet 简介：用于强化学习的深度规划网络

谷歌开发者

13+阅读 · 2019年3月16日

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

专知

26+阅读 · 2019年2月12日

推荐系统

炼数成金订阅号

28+阅读 · 2019年1月17日

知识在检索式对话系统的应用

知识在检索式对话系统的应用

微信AI

32+阅读 · 2018年9月20日

干货｜基于双流递归神经网络的人体骨架行为识别！

干货｜基于双流递归神经网络的人体骨架行为识别！

全球人工智能

13+阅读 · 2017年12月15日

赛尔原创 | 聊天机器人中用户出行消费意图识别方法研究

赛尔原创 | 聊天机器人中用户出行消费意图识别方法研究

哈工大SCIR

19+阅读 · 2017年10月30日

相关论文

DIAURec: Dual-Intent Space Representation Optimization for Recommendation

Arxiv

0+阅读 · 4月13日

DIAURec: Dual-Intent Space Representation Optimization for Recommendation

Arxiv

0+阅读 · 4月10日

Cross-Modal Visuo-Tactile Object Perception

Arxiv

0+阅读 · 4月2日

Exploring the Interplay Between Voice, Personality, and Gender in Human-Agent Interactions

Arxiv

0+阅读 · 4月1日

Interactive Force-Impedance Control

Arxiv

0+阅读 · 3月31日

Exploring the Role of Interaction Data to Empower End-User Decision-Making In UI Personalization

Arxiv

0+阅读 · 3月19日

Interpreting Context-Aware Human Preferences for Multi-Objective Robot Navigation

Arxiv

0+阅读 · 3月18日

Navigation beyond Wayfinding: Robots Collaborating with Visually Impaired Users for Environmental Interactions

Arxiv

0+阅读 · 3月15日

CRED: Counterfactual Reasoning and Environment Design for Active Preference Learning

Arxiv

0+阅读 · 3月9日

Planning from Observation and Interaction

Arxiv

0+阅读 · 2月27日

相关基金

基于时空模式的复杂行为识别方法研究

国家自然科学基金

2+阅读 · 2017年12月31日

基于人机交互的数据驱动式人群行为建模与仿真研究

国家自然科学基金

4+阅读 · 2015年12月31日

主被动视角联合的细粒度行为识别

国家自然科学基金

1+阅读 · 2015年12月31日

面向推荐系统中异构隐式反馈建模的迁移学习技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

非结构环境下基于三维肢体动作理解的工业机器人交互技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于多样化查询的多标记主动学习研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于多通道深度卷积神经网络的人体行为分析研究

国家自然科学基金

6+阅读 · 2015年12月31日

状态空间搜索的anytime模式及其高效算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于空间认知常识的定性地理信息检索研究

国家自然科学基金

2+阅读 · 2014年12月31日

基于深度信息和显著计算的手势交互技术研究及应用

国家自然科学基金

1+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员