NestRL: A Nested Training Regime for Mutual Adaptation in Human-AI Teaming - 专知论文

会员服务 ·

0

协同 · 智能体 · 人机协同 · 同策略 · 交互 ·

NestRL: A Nested Training Regime for Mutual Adaptation in Human-AI Teaming

翻译：NestRL：人机协同中面向互适性的嵌套训练范式

Upasana Biswas,Durgesh Kalwar,Subbarao Kambhampati,Sarath Sreedharan

Mutual adaptation is a central challenge in human-AI teaming, as humans naturally adjust their strategies in response to an AI agent's behavior. Existing approaches attempt to approximate human behavior by diversifying training partners; however, these partners are typically static and fail to capture the adaptive nature of human teammates. When agents are trained jointly in standard multi-agent settings, they often converge to opaque coordination strategies that work only with their co-trained partners, leading to poor generalization. To model adaptive human behavior, we formulate human-AI teaming as an Interactive Partially Observable Markov Decision Process (I-POMDP). We propose NestRL, a nested training regime that learns the solution to a finite-level I-POMDP by training agents at each level against adaptive agents from the level below. This exposes agents to adaptive behavior while preventing emergence of opaque coordination strategies. We provide theoretical analysis showing that NestRL agents avoid convergence to partner-specific strategies, and validate this empirically in the Overcooked domain against state-of-the-art baselines. NestRL achieves higher task performance with both unseen adaptive agents and real human teammates, while exhibiting significantly greater adaptability over the course of interaction.

翻译：互适性是人机协同中的核心挑战，因为人类会基于AI智能体的行为自然调整自身策略。现有方法试图通过多样化的训练伙伴来近似人类行为，但这些伙伴通常是静态的，无法捕捉人类队友的适应特性。当智能体在标准多智能体环境中联合训练时，它们常会收敛于仅能与共训伙伴协作的隐性协同策略，导致泛化能力低下。为建模人类适应性行为，我们将人机协同形式化为交互式部分可观测马尔可夫决策过程（I-POMDP）。我们提出NestRL——一种嵌套式训练范式，通过训练每一层级的智能体与低一层级的自适应智能体对抗，从而学习有限层级I-POMDP的解决方案。该方法既使智能体暴露于适应行为下，又防止了隐性协同策略的产生。理论分析表明，NestRL智能体可避免收敛至伙伴特异性策略，我们在Overcooked环境中针对最先进基线模型进行了实证验证。无论是与未见过的自适应智能体还是真实人类队友合作，NestRL均能获得更高的任务性能，并在交互过程中展现出显著增强的适应性。

0

相关内容

【NeurIPS2025教程】人类–AI 对齐：基础、方法、实践与挑战

【NeurIPS2025教程】人类–AI 对齐：基础、方法、实践与挑战

专知会员服务

26+阅读 · 2025年12月7日

《军事行动中的人机AI编队本体模型》

《军事行动中的人机AI编队本体模型》

专知会员服务

37+阅读 · 2025年11月2日

《军事行动中的人机协同共同学习》2025最新文献

《军事行动中的人机协同共同学习》2025最新文献

专知会员服务

34+阅读 · 2025年10月10日

《AI作战：将人机协作集成至实时、虚拟与建构环境（LVC）的建模与仿真》

《AI作战：将人机协作集成至实时、虚拟与建构环境（LVC）的建模与仿真》

专知会员服务

42+阅读 · 2025年9月23日

协同智能体：多智能体人工智能系统如何变革军事训练及其他领域

协同智能体：多智能体人工智能系统如何变革军事训练及其他领域

专知会员服务

35+阅读 · 2025年9月20日

人机编队协作的共同认知改变了战争方式

人机编队协作的共同认知改变了战争方式

专知会员服务

27+阅读 · 2025年2月5日

《人类-人工智能握手框架：人与人工智能合作的双向方法》

《人类-人工智能握手框架：人与人工智能合作的双向方法》

专知会员服务

40+阅读 · 2025年2月5日

《用于个性化人机协作的可解释人工智能》269页

《用于个性化人机协作的可解释人工智能》269页

专知会员服务

48+阅读 · 2024年5月7日

【CoRL2020最佳论文】学习潜在表示以影响多智能体交互作用

【CoRL2020最佳论文】学习潜在表示以影响多智能体交互作用

专知会员服务

28+阅读 · 2020年11月20日

【DeepMind】人工智能、价值与对齐，Artificial Intelligence, Values, and Alignment

【DeepMind】人工智能、价值与对齐，Artificial Intelligence, Values, and Alignment

专知会员服务

40+阅读 · 2020年1月13日

【集群机器人】《考虑敌手的多智能体系统协同任务分配与运动规划》2022最新226页博士论文，密歇根大学

【集群机器人】《考虑敌手的多智能体系统协同任务分配与运动规划》2022最新226页博士论文，密歇根大学

专知

30+阅读 · 2022年11月23日

推荐！《可解释人工智能及其军事意义》【译文】印智库ORF2022最新报告

推荐！《可解释人工智能及其军事意义》【译文】印智库ORF2022最新报告

专知

40+阅读 · 2022年11月4日

《基于多智能体深度强化学习的空战模拟智能体协作》瑞典林雪平大学

《基于多智能体深度强化学习的空战模拟智能体协作》瑞典林雪平大学

专知

66+阅读 · 2022年8月25日

推荐！【中文版】《人工智能在指挥和控制系统中的决策支持》瑞典国防研究局

推荐！【中文版】《人工智能在指挥和控制系统中的决策支持》瑞典国防研究局

专知

36+阅读 · 2022年7月31日

《人工智能在空战指挥与控制中的应用》中文版，美国空军大学空军指挥参谋学院

《人工智能在空战指挥与控制中的应用》中文版，美国空军大学空军指挥参谋学院

专知

111+阅读 · 2022年4月28日

人工智能训练师的再定义

人工智能训练师的再定义

竹间智能Emotibot

10+阅读 · 2019年5月15日

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

专知

26+阅读 · 2019年2月12日

【协作机器人】人机协作机器人的核心是多传感器技术与智能控制算法、工业机器人协作应用挑战

【协作机器人】人机协作机器人的核心是多传感器技术与智能控制算法、工业机器人协作应用挑战

产业智能官

13+阅读 · 2019年1月17日

CCCF专栏文章：人机共融智能

CCCF专栏文章：人机共融智能

中国计算机学会

15+阅读 · 2017年12月21日

【强化学习】强化学习+深度学习=人工智能

【强化学习】强化学习+深度学习=人工智能

产业智能官

55+阅读 · 2017年8月11日

基于身心共融运动训练的肢体康复机器人多模态反馈方法研究

国家自然科学基金

0+阅读 · 2017年12月31日

融合人脑意图与力觉反馈的外骨骼机器人步态控制CPG模型及调节方法

国家自然科学基金

0+阅读 · 2015年12月31日

非结构环境下基于三维肢体动作理解的工业机器人交互技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

防肌肉疲劳双臂机器人人机协同基础研究

国家自然科学基金

1+阅读 · 2015年12月31日

仿人轻型机械臂人机协作模式关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于群体智能的多无人机编队自主协调控制及验证

国家自然科学基金

21+阅读 · 2013年12月31日

面向人与Agent混合的多团队协作仿真训练方法研究

国家自然科学基金

19+阅读 · 2012年12月31日

基于群体智能的多Agent协作模型与适应性研究

国家自然科学基金

18+阅读 · 2009年12月31日

基于多智能体强化学习的多机器人系统研究

国家自然科学基金

50+阅读 · 2009年12月31日

基于动态分层与自学习的多智能体自适应协作模型

国家自然科学基金

17+阅读 · 2008年12月31日

Moving Out: Physically-grounded Human-AI Collaboration

Arxiv

0+阅读 · 6月15日

Algorithmic Prompt Generation for Diverse Human-like Teaming and Communication with Large Language Models

Arxiv

0+阅读 · 6月15日

ADAPT: Analytical Disturbance-Aware Policy Training for Humanoid Locomotion

Arxiv

0+阅读 · 6月15日

Robots that Collaborate: Sequential Asymmetric Imitation for Learning Coupled Robot Policies

Arxiv

0+阅读 · 6月15日

AI as a Sparring Partner -- an HCAI Approach to Promote Human Capabilities

Arxiv

0+阅读 · 6月14日

Learning to Assist: Collaborative VLAs for Implicit Human-Robot Collaboration

Arxiv

0+阅读 · 6月10日

IMPACT: Learning Internal-Model Predictive Control for Forceful Robotic Manipulation

Arxiv

0+阅读 · 6月9日

TUX: Measuring Human--AI Tacit Understanding

Arxiv

0+阅读 · 5月29日

HAI-Eval: Measuring Human-AI Synergy in Collaborative Coding

Arxiv

0+阅读 · 5月15日

HECTOR: Human-centric Hierarchical Coordination and Supervision of Robotic Fleets under Continual Temporal Tasks

Arxiv

0+阅读 · 5月14日

VIP会员

文章信息

相关主题

最新内容

深入解读 Palantir AIP：全球最具争议的人工智能平台究竟如何运作

深入解读 Palantir AIP：全球最具争议的人工智能平台究竟如何运作

专知会员服务

7+阅读 · 6月20日

ICML 2026 | 多任务贝叶斯上下文学习：让 Transformer 在测试时显式适应新先验

ICML 2026 | 多任务贝叶斯上下文学习：让 Transformer 在测试时显式适应新先验

专知会员服务

4+阅读 · 6月19日

ACL 2026综述 | 大规模手语数据集：资源、基准与标注标准

ACL 2026综述 | 大规模手语数据集：资源、基准与标注标准

专知会员服务

6+阅读 · 6月19日

ICML 2026 Spotlight | SmoothSMoE：解析稀疏 MoE 路由不连续

ICML 2026 Spotlight | SmoothSMoE：解析稀疏 MoE 路由不连续

专知会员服务

6+阅读 · 6月18日

综述 | 周期表视角下的大模型推理：范式、方法与失败模式

综述 | 周期表视角下的大模型推理：范式、方法与失败模式

专知会员服务

7+阅读 · 6月18日

《廉价自杀式无人机战争的军事战略影响：乌克兰和伊朗案例研究》

《廉价自杀式无人机战争的军事战略影响：乌克兰和伊朗案例研究》

专知会员服务

11+阅读 · 6月18日

《面向反无人机作战的联邦式可解释射频–光电/红外情报融合：边缘人工智能优化、电子战韧性及分布式监视验证》

《面向反无人机作战的联邦式可解释射频–光电/红外情报融合：边缘人工智能优化、电子战韧性及分布式监视验证》

专知会员服务

11+阅读 · 6月18日

ICML 2026 | FR3D：解耦自车运动的未来动态三维重建世界模型

ICML 2026 | FR3D：解耦自车运动的未来动态三维重建世界模型

专知会员服务

7+阅读 · 6月17日

【伯克利博士论文】迈向可扩展与自我演进的大语言模型智能体

【伯克利博士论文】迈向可扩展与自我演进的大语言模型智能体

专知会员服务

11+阅读 · 6月17日

学习数据的几何：形状空间分析数学综述

学习数据的几何：形状空间分析数学综述

专知会员服务

8+阅读 · 6月17日

《现代防空系统综述：架构、传感器、拦截器及新兴威胁环境对基础设施受限防御环境的影响》2026最新长综述

《现代防空系统综述：架构、传感器、拦截器及新兴威胁环境对基础设施受限防御环境的影响》2026最新长综述

专知会员服务

18+阅读 · 6月17日

定向能反无人机系统最新发展动态

定向能反无人机系统最新发展动态

专知会员服务

9+阅读 · 6月17日

从燃煤战舰到算法战争：水面指挥的永恒要求

从燃煤战舰到算法战争：水面指挥的永恒要求

专知会员服务

6+阅读 · 6月17日

《短程弹道再入飞行器拦截时间中的一项异常现象》

《短程弹道再入飞行器拦截时间中的一项异常现象》

专知会员服务

8+阅读 · 6月17日

《基于回归方法与任务上下文的对抗环境动态战术网络报文优先级排序》

《基于回归方法与任务上下文的对抗环境动态战术网络报文优先级排序》

专知会员服务

8+阅读 · 6月17日

相关VIP内容

【NeurIPS2025教程】人类–AI 对齐：基础、方法、实践与挑战

【NeurIPS2025教程】人类–AI 对齐：基础、方法、实践与挑战

专知会员服务

26+阅读 · 2025年12月7日

《军事行动中的人机AI编队本体模型》

《军事行动中的人机AI编队本体模型》

专知会员服务

37+阅读 · 2025年11月2日

《军事行动中的人机协同共同学习》2025最新文献

《军事行动中的人机协同共同学习》2025最新文献

专知会员服务

34+阅读 · 2025年10月10日

《AI作战：将人机协作集成至实时、虚拟与建构环境（LVC）的建模与仿真》

《AI作战：将人机协作集成至实时、虚拟与建构环境（LVC）的建模与仿真》

专知会员服务

42+阅读 · 2025年9月23日

协同智能体：多智能体人工智能系统如何变革军事训练及其他领域

协同智能体：多智能体人工智能系统如何变革军事训练及其他领域

专知会员服务

35+阅读 · 2025年9月20日

人机编队协作的共同认知改变了战争方式

人机编队协作的共同认知改变了战争方式

专知会员服务

27+阅读 · 2025年2月5日

《人类-人工智能握手框架：人与人工智能合作的双向方法》

《人类-人工智能握手框架：人与人工智能合作的双向方法》

专知会员服务

40+阅读 · 2025年2月5日

《用于个性化人机协作的可解释人工智能》269页

《用于个性化人机协作的可解释人工智能》269页

专知会员服务

48+阅读 · 2024年5月7日

【CoRL2020最佳论文】学习潜在表示以影响多智能体交互作用

【CoRL2020最佳论文】学习潜在表示以影响多智能体交互作用

专知会员服务

28+阅读 · 2020年11月20日

【DeepMind】人工智能、价值与对齐，Artificial Intelligence, Values, and Alignment

【DeepMind】人工智能、价值与对齐，Artificial Intelligence, Values, and Alignment

专知会员服务

40+阅读 · 2020年1月13日

热门VIP内容

开通专知VIP会员享更多权益服务

深入解读 Palantir AIP：全球最具争议的人工智能平台究竟如何运作

ICML 2026 | 多任务贝叶斯上下文学习：让 Transformer 在测试时显式适应新先验

ACL 2026综述 | 大规模手语数据集：资源、基准与标注标准

相关资讯

【集群机器人】《考虑敌手的多智能体系统协同任务分配与运动规划》2022最新226页博士论文，密歇根大学

【集群机器人】《考虑敌手的多智能体系统协同任务分配与运动规划》2022最新226页博士论文，密歇根大学

专知

30+阅读 · 2022年11月23日

推荐！《可解释人工智能及其军事意义》【译文】印智库ORF2022最新报告

推荐！《可解释人工智能及其军事意义》【译文】印智库ORF2022最新报告

专知

40+阅读 · 2022年11月4日

《基于多智能体深度强化学习的空战模拟智能体协作》瑞典林雪平大学

《基于多智能体深度强化学习的空战模拟智能体协作》瑞典林雪平大学

专知

66+阅读 · 2022年8月25日

推荐！【中文版】《人工智能在指挥和控制系统中的决策支持》瑞典国防研究局

推荐！【中文版】《人工智能在指挥和控制系统中的决策支持》瑞典国防研究局

专知

36+阅读 · 2022年7月31日

《人工智能在空战指挥与控制中的应用》中文版，美国空军大学空军指挥参谋学院

《人工智能在空战指挥与控制中的应用》中文版，美国空军大学空军指挥参谋学院

专知

111+阅读 · 2022年4月28日

人工智能训练师的再定义

人工智能训练师的再定义

竹间智能Emotibot

10+阅读 · 2019年5月15日

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

专知

26+阅读 · 2019年2月12日

【协作机器人】人机协作机器人的核心是多传感器技术与智能控制算法、工业机器人协作应用挑战

【协作机器人】人机协作机器人的核心是多传感器技术与智能控制算法、工业机器人协作应用挑战

产业智能官

13+阅读 · 2019年1月17日

CCCF专栏文章：人机共融智能

CCCF专栏文章：人机共融智能

中国计算机学会

15+阅读 · 2017年12月21日

【强化学习】强化学习+深度学习=人工智能

【强化学习】强化学习+深度学习=人工智能

产业智能官

55+阅读 · 2017年8月11日

相关论文

Moving Out: Physically-grounded Human-AI Collaboration

Arxiv

0+阅读 · 6月15日

Algorithmic Prompt Generation for Diverse Human-like Teaming and Communication with Large Language Models

Arxiv

0+阅读 · 6月15日

ADAPT: Analytical Disturbance-Aware Policy Training for Humanoid Locomotion

Arxiv

0+阅读 · 6月15日

Robots that Collaborate: Sequential Asymmetric Imitation for Learning Coupled Robot Policies

Arxiv

0+阅读 · 6月15日

AI as a Sparring Partner -- an HCAI Approach to Promote Human Capabilities

Arxiv

0+阅读 · 6月14日

Learning to Assist: Collaborative VLAs for Implicit Human-Robot Collaboration

Arxiv

0+阅读 · 6月10日

IMPACT: Learning Internal-Model Predictive Control for Forceful Robotic Manipulation

Arxiv

0+阅读 · 6月9日

TUX: Measuring Human--AI Tacit Understanding

Arxiv

0+阅读 · 5月29日

HAI-Eval: Measuring Human-AI Synergy in Collaborative Coding

Arxiv

0+阅读 · 5月15日

HECTOR: Human-centric Hierarchical Coordination and Supervision of Robotic Fleets under Continual Temporal Tasks

Arxiv

0+阅读 · 5月14日

相关基金

基于身心共融运动训练的肢体康复机器人多模态反馈方法研究

国家自然科学基金

0+阅读 · 2017年12月31日

融合人脑意图与力觉反馈的外骨骼机器人步态控制CPG模型及调节方法

国家自然科学基金

0+阅读 · 2015年12月31日

非结构环境下基于三维肢体动作理解的工业机器人交互技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

防肌肉疲劳双臂机器人人机协同基础研究

国家自然科学基金

1+阅读 · 2015年12月31日

仿人轻型机械臂人机协作模式关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于群体智能的多无人机编队自主协调控制及验证

国家自然科学基金

21+阅读 · 2013年12月31日

面向人与Agent混合的多团队协作仿真训练方法研究

国家自然科学基金

19+阅读 · 2012年12月31日

基于群体智能的多Agent协作模型与适应性研究

国家自然科学基金

18+阅读 · 2009年12月31日

基于多智能体强化学习的多机器人系统研究

国家自然科学基金

50+阅读 · 2009年12月31日

基于动态分层与自学习的多智能体自适应协作模型

国家自然科学基金

17+阅读 · 2008年12月31日

微信扫码咨询专知VIP会员