Consistent Opponent Modeling in Imperfect-Information Games - 专知论文

会员服务 ·

0

博弈 · 对手建模 · 算法 · 不完全信息 · 不完全信息博弈 ·

Consistent Opponent Modeling in Imperfect-Information Games

翻译：不完全信息博弈中的一致性对手建模

The goal of agents in multi-agent environments is to maximize total reward against the opposing agents that are encountered. Following a game-theoretic solution concept, such as Nash equilibrium, may obtain a strong performance in some settings; however, such approaches fail to capitalize on historical and observed data from repeated interactions against our opponents. Opponent modeling algorithms integrate machine learning techniques to exploit suboptimal opponents utilizing available data; however, the effectiveness of such approaches in imperfect-information games to date is quite limited. We show that existing opponent modeling approaches fail to satisfy a simple desirable property even against static opponents drawn from a known prior distribution; namely, they do not guarantee that the model approaches the opponent's true strategy even in the limit as the number of game iterations approaches infinity. We develop a new algorithm that is able to achieve this property and runs efficiently by solving a convex minimization problem based on the sequence-form game representation using projected gradient descent. The algorithm is guaranteed to efficiently converge to the opponent's true strategy under standard Bayesian identifiability and visitation assumptions, given observations from gameplay and possibly additional historical data if it is available.

翻译：在多智能体环境中，智能体的目标是通过与所遭遇的对手智能体对抗来最大化总奖励。遵循博弈论解概念（如纳什均衡）在某些设定下可能获得较强的性能；然而，此类方法未能充分利用与对手重复交互中产生的历史和观测数据。对手建模算法整合机器学习技术，利用可用数据来利用次优对手；然而，迄今为止，此类方法在不完全信息博弈中的有效性相当有限。我们证明，即使面对从已知先验分布中抽取的静态对手，现有的对手建模方法也无法满足一个简单的理想属性；即，它们不能保证在博弈迭代次数趋于无穷大的极限情况下，模型能够逼近对手的真实策略。我们开发了一种新算法，该算法能够通过基于序列形式博弈表示、使用投影梯度下降法求解凸最小化问题，高效地实现这一属性。在标准的贝叶斯可识别性和访问假设下，给定来自游戏过程的观测数据以及可能获得的额外历史数据，该算法能够保证高效收敛到对手的真实策略。

0

相关内容

《基于图神经网络、深度强化学习与概率主题建模的战略对手建模》

《基于图神经网络、深度强化学习与概率主题建模的战略对手建模》

专知会员服务

31+阅读 · 2025年11月16日

智能博弈对抗算法及其在情报领域中的应用*

智能博弈对抗算法及其在情报领域中的应用*

专知会员服务

39+阅读 · 2024年12月1日

智能博弈决策大模型智能体技术综述

智能博弈决策大模型智能体技术综述

专知会员服务

116+阅读 · 2024年6月29日

博弈论应用《互补战场上的多场战斗对抗》

博弈论应用《互补战场上的多场战斗对抗》

专知会员服务

27+阅读 · 2024年1月30日

【CMU博士论文】不完全信息博弈中的博弈决策学习动力学、均衡计算和复杂性，358页pdf

【CMU博士论文】不完全信息博弈中的博弈决策学习动力学、均衡计算和复杂性，358页pdf

专知会员服务

64+阅读 · 2023年6月16日

基于深度强化学习的对手建模方法研究综述

基于深度强化学习的对手建模方法研究综述

专知会员服务

84+阅读 · 2023年4月17日

面向多智能体博弈对抗的对手建模框架

面向多智能体博弈对抗的对手建模框架

专知会员服务

165+阅读 · 2022年9月28日

2022最新《对抗领域中的对手建模综述》51页pdf，美国马萨诸塞大学，A Survey on Opponent Modeling in Adversarial Domains

2022最新《对抗领域中的对手建模综述》51页pdf，美国马萨诸塞大学，A Survey on Opponent Modeling in Adversarial Domains

专知会员服务

68+阅读 · 2022年4月15日

《人机对抗中的博弈学习方法》21页PDF，中科院自动化所最新发表

《人机对抗中的博弈学习方法》21页PDF，中科院自动化所最新发表

专知会员服务

117+阅读 · 2022年3月29日

【CMU大神Noam博士论文】大型对抗性不完全信息博弈的均衡发现，附230页pdf与slides

【CMU大神Noam博士论文】大型对抗性不完全信息博弈的均衡发现，附230页pdf与slides

专知会员服务

96+阅读 · 2020年9月23日

推荐！《用于兵棋推演和建模的人工智能》兰德、耶鲁大学2022最新16页论文

推荐！《用于兵棋推演和建模的人工智能》兰德、耶鲁大学2022最新16页论文

专知

53+阅读 · 2022年11月14日

【博士论文】《参数化战斗分析的方法框架》美国空军技术学院2022最新139页博士论文

【博士论文】《参数化战斗分析的方法框架》美国空军技术学院2022最新139页博士论文

专知

16+阅读 · 2022年10月22日

面向多智能体博弈对抗的对手建模框架

面向多智能体博弈对抗的对手建模框架

专知

18+阅读 · 2022年9月28日

【博士论文】《安全博弈中的分层规划：战略、战术和行动决策的博弈论方法》南加州大学

【博士论文】《安全博弈中的分层规划：战略、战术和行动决策的博弈论方法》南加州大学

专知

24+阅读 · 2022年9月25日

「智能博弈对抗方法」最新2022综述-博弈论与强化学习综合视角对比分析

「智能博弈对抗方法」最新2022综述-博弈论与强化学习综合视角对比分析

专知

23+阅读 · 2022年8月28日

《基于多智能体深度强化学习的空战模拟智能体协作》瑞典林雪平大学

《基于多智能体深度强化学习的空战模拟智能体协作》瑞典林雪平大学

专知

66+阅读 · 2022年8月25日

【AI与军事】美国陆军专著《博弈论在作战层面的应用》，47页pdf，中文版

【AI与军事】美国陆军专著《博弈论在作战层面的应用》，47页pdf，中文版

专知

131+阅读 · 2022年4月4日

CALDERA 一款对手自动模拟工具

CALDERA 一款对手自动模拟工具

黑白之道

20+阅读 · 2019年9月17日

用模型不确定性理解模型

用模型不确定性理解模型

论智

11+阅读 · 2018年9月5日

不对称多代理博弈中的博弈理论解读

不对称多代理博弈中的博弈理论解读

AI前线

14+阅读 · 2018年3月8日

不完全信息下的投资组合选择模型研究：一个时间一致性的视角

国家自然科学基金

5+阅读 · 2015年12月31日

基于非局域性的量子博弈研究

国家自然科学基金

1+阅读 · 2015年12月31日

复杂网络上数据传输博弈的合作性优化与控制研究

国家自然科学基金

3+阅读 · 2015年12月31日

随机环境下多个体系统集体行为分析、调控与优化

国家自然科学基金

0+阅读 · 2015年12月31日

带有通信量化和延时的多智能体系统一致性研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于深度信息和显著计算的手势交互技术研究及应用

国家自然科学基金

1+阅读 · 2014年12月31日

算法博弈论视角下的策略替代型网络博弈

国家自然科学基金

4+阅读 · 2014年12月31日

基于博弈论的信息安全理论与方法研究

国家自然科学基金

10+阅读 · 2012年12月31日

面向武器系统协同的态势感知一致性计算方法研究

国家自然科学基金

55+阅读 · 2011年12月31日

基于群体智能的多Agent协作模型与适应性研究

国家自然科学基金

18+阅读 · 2009年12月31日

A Data Driven Structural Decomposition of Dynamic Games via Best Response Maps

Arxiv

0+阅读 · 2月5日

Multi-Player, Multi-Strategy Quantum Game Model for Interaction-Aware Decision-Making in Autonomous Driving

Arxiv

0+阅读 · 2月3日

One Model, All Roles: Multi-Turn, Multi-Agent Self-Play Reinforcement Learning for Conversational Social Intelligence

Arxiv

0+阅读 · 2月3日

Equilibrium Refinements Improve Subgame Solving in Imperfect-Information Games

Arxiv

0+阅读 · 1月23日

Game-to-Real Gap: Quantifying the Effect of Model Misspecification in Network Games

Arxiv

0+阅读 · 1月22日

Graph Neural Networks, Deep Reinforcement Learning and Probabilistic Topic Modeling for Strategic Multiagent Settings

Arxiv

0+阅读 · 1月22日

Sequential Causal Normal Form Games: Theory, Computation, and Strategic Signaling

Arxiv

0+阅读 · 1月21日

Inverse Learning in $2\times2$ Games: From Synthetic Interactions to Traffic Simulation

Arxiv

0+阅读 · 1月15日

Algorithm and Strategy Construction for Sure-Almost-Sure Stochastic Parity Games

Arxiv

0+阅读 · 1月6日

Bayesian Inverse Games with High-Dimensional Multi-Modal Observations

Bayesian Inverse Games with High-Dimensional Multi-Modal Observations

Arxiv

0+阅读 · 1月2日

VIP会员

文章信息

相关主题

不完全信息

不完全信息博弈

最新内容

ECCV 2026 | MIMFlow：MIM与归一化流统一图像生成

ECCV 2026 | MIMFlow：MIM与归一化流统一图像生成

专知会员服务

1+阅读 · 今天11:43

超越自回归边界：扩散模型、世界模型与SSM如何重塑代码智能

超越自回归边界：扩散模型、世界模型与SSM如何重塑代码智能

专知会员服务

1+阅读 · 今天11:41

重塑决策优势：美军作战艺术与多域作战中联盟联合全域指挥控制（CJADC2）体系的融合

重塑决策优势：美军作战艺术与多域作战中联盟联合全域指挥控制（CJADC2）体系的融合

专知会员服务

4+阅读 · 今天6:30

网状网络及其在军事领域的运用

网状网络及其在军事领域的运用

专知会员服务

4+阅读 · 今天6:18

《意识即战场——全球安全体系中认知战的演进：乌克兰构建认知作战体系的展望》

《意识即战场——全球安全体系中认知战的演进：乌克兰构建认知作战体系的展望》

专知会员服务

5+阅读 · 今天6:08

无美国参与的欧洲战争方式（万字长文）

无美国参与的欧洲战争方式（万字长文）

专知会员服务

5+阅读 · 今天5:54

重构“下一场战争”的制胜理论：超越兰彻斯特方程与现代系统

重构“下一场战争”的制胜理论：超越兰彻斯特方程与现代系统

专知会员服务

5+阅读 · 今天5:22

《国防工业中基于模型定义的实施：产品定义数字化转型的战略路径》90页

《国防工业中基于模型定义的实施：产品定义数字化转型的战略路径》90页

专知会员服务

6+阅读 · 今天5:15

《国防领域敏感性分析白皮书》

《国防领域敏感性分析白皮书》

专知会员服务

6+阅读 · 今天3:42

综述 | 从问答到任务完成：Agent系统与Harness设计

综述 | 从问答到任务完成：Agent系统与Harness设计

专知会员服务

5+阅读 · 6月24日

Agentic RL：框架、实践与长程智能体训练

Agentic RL：框架、实践与长程智能体训练

专知会员服务

6+阅读 · 6月24日

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

专知会员服务

10+阅读 · 6月24日

重新思考无人机时代的生存能力

重新思考无人机时代的生存能力

专知会员服务

9+阅读 · 6月24日

装甲突击旅：现代战争思考、战斗与组织

装甲突击旅：现代战争思考、战斗与组织

专知会员服务

7+阅读 · 6月24日

在人工智能加速决策环境中拓展OODA循环

在人工智能加速决策环境中拓展OODA循环

专知会员服务

9+阅读 · 6月24日

相关VIP内容

《基于图神经网络、深度强化学习与概率主题建模的战略对手建模》

《基于图神经网络、深度强化学习与概率主题建模的战略对手建模》

专知会员服务

31+阅读 · 2025年11月16日

智能博弈对抗算法及其在情报领域中的应用*

智能博弈对抗算法及其在情报领域中的应用*

专知会员服务

39+阅读 · 2024年12月1日

智能博弈决策大模型智能体技术综述

智能博弈决策大模型智能体技术综述

专知会员服务

116+阅读 · 2024年6月29日

博弈论应用《互补战场上的多场战斗对抗》

博弈论应用《互补战场上的多场战斗对抗》

专知会员服务

27+阅读 · 2024年1月30日

【CMU博士论文】不完全信息博弈中的博弈决策学习动力学、均衡计算和复杂性，358页pdf

【CMU博士论文】不完全信息博弈中的博弈决策学习动力学、均衡计算和复杂性，358页pdf

专知会员服务

64+阅读 · 2023年6月16日

基于深度强化学习的对手建模方法研究综述

基于深度强化学习的对手建模方法研究综述

专知会员服务

84+阅读 · 2023年4月17日

面向多智能体博弈对抗的对手建模框架

面向多智能体博弈对抗的对手建模框架

专知会员服务

165+阅读 · 2022年9月28日

2022最新《对抗领域中的对手建模综述》51页pdf，美国马萨诸塞大学，A Survey on Opponent Modeling in Adversarial Domains

2022最新《对抗领域中的对手建模综述》51页pdf，美国马萨诸塞大学，A Survey on Opponent Modeling in Adversarial Domains

专知会员服务

68+阅读 · 2022年4月15日

《人机对抗中的博弈学习方法》21页PDF，中科院自动化所最新发表

《人机对抗中的博弈学习方法》21页PDF，中科院自动化所最新发表

专知会员服务

117+阅读 · 2022年3月29日

【CMU大神Noam博士论文】大型对抗性不完全信息博弈的均衡发现，附230页pdf与slides

【CMU大神Noam博士论文】大型对抗性不完全信息博弈的均衡发现，附230页pdf与slides

专知会员服务

96+阅读 · 2020年9月23日

热门VIP内容

开通专知VIP会员享更多权益服务

超越自回归边界：扩散模型、世界模型与SSM如何重塑代码智能

网状网络及其在军事领域的运用

ECCV 2026 | MIMFlow：MIM与归一化流统一图像生成

重塑决策优势：美军作战艺术与多域作战中联盟联合全域指挥控制（CJADC2）体系的融合

相关资讯

推荐！《用于兵棋推演和建模的人工智能》兰德、耶鲁大学2022最新16页论文

推荐！《用于兵棋推演和建模的人工智能》兰德、耶鲁大学2022最新16页论文

专知

53+阅读 · 2022年11月14日

【博士论文】《参数化战斗分析的方法框架》美国空军技术学院2022最新139页博士论文

【博士论文】《参数化战斗分析的方法框架》美国空军技术学院2022最新139页博士论文

专知

16+阅读 · 2022年10月22日

面向多智能体博弈对抗的对手建模框架

面向多智能体博弈对抗的对手建模框架

专知

18+阅读 · 2022年9月28日

【博士论文】《安全博弈中的分层规划：战略、战术和行动决策的博弈论方法》南加州大学

【博士论文】《安全博弈中的分层规划：战略、战术和行动决策的博弈论方法》南加州大学

专知

24+阅读 · 2022年9月25日

「智能博弈对抗方法」最新2022综述-博弈论与强化学习综合视角对比分析

「智能博弈对抗方法」最新2022综述-博弈论与强化学习综合视角对比分析

专知

23+阅读 · 2022年8月28日

《基于多智能体深度强化学习的空战模拟智能体协作》瑞典林雪平大学

《基于多智能体深度强化学习的空战模拟智能体协作》瑞典林雪平大学

专知

66+阅读 · 2022年8月25日

【AI与军事】美国陆军专著《博弈论在作战层面的应用》，47页pdf，中文版

【AI与军事】美国陆军专著《博弈论在作战层面的应用》，47页pdf，中文版

专知

131+阅读 · 2022年4月4日

CALDERA 一款对手自动模拟工具

CALDERA 一款对手自动模拟工具

黑白之道

20+阅读 · 2019年9月17日

用模型不确定性理解模型

用模型不确定性理解模型

论智

11+阅读 · 2018年9月5日

不对称多代理博弈中的博弈理论解读

不对称多代理博弈中的博弈理论解读

AI前线

14+阅读 · 2018年3月8日

相关论文

A Data Driven Structural Decomposition of Dynamic Games via Best Response Maps

Arxiv

0+阅读 · 2月5日

Multi-Player, Multi-Strategy Quantum Game Model for Interaction-Aware Decision-Making in Autonomous Driving

Arxiv

0+阅读 · 2月3日

One Model, All Roles: Multi-Turn, Multi-Agent Self-Play Reinforcement Learning for Conversational Social Intelligence

Arxiv

0+阅读 · 2月3日

Equilibrium Refinements Improve Subgame Solving in Imperfect-Information Games

Arxiv

0+阅读 · 1月23日

Game-to-Real Gap: Quantifying the Effect of Model Misspecification in Network Games

Arxiv

0+阅读 · 1月22日

Graph Neural Networks, Deep Reinforcement Learning and Probabilistic Topic Modeling for Strategic Multiagent Settings

Arxiv

0+阅读 · 1月22日

Sequential Causal Normal Form Games: Theory, Computation, and Strategic Signaling

Arxiv

0+阅读 · 1月21日

Inverse Learning in $2\times2$ Games: From Synthetic Interactions to Traffic Simulation

Arxiv

0+阅读 · 1月15日

Algorithm and Strategy Construction for Sure-Almost-Sure Stochastic Parity Games

Arxiv

0+阅读 · 1月6日

Bayesian Inverse Games with High-Dimensional Multi-Modal Observations

Bayesian Inverse Games with High-Dimensional Multi-Modal Observations

Arxiv

0+阅读 · 1月2日

相关基金

不完全信息下的投资组合选择模型研究：一个时间一致性的视角

国家自然科学基金

5+阅读 · 2015年12月31日

基于非局域性的量子博弈研究

国家自然科学基金

1+阅读 · 2015年12月31日

复杂网络上数据传输博弈的合作性优化与控制研究

国家自然科学基金

3+阅读 · 2015年12月31日

随机环境下多个体系统集体行为分析、调控与优化

国家自然科学基金

0+阅读 · 2015年12月31日

带有通信量化和延时的多智能体系统一致性研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于深度信息和显著计算的手势交互技术研究及应用

国家自然科学基金

1+阅读 · 2014年12月31日

算法博弈论视角下的策略替代型网络博弈

国家自然科学基金

4+阅读 · 2014年12月31日

基于博弈论的信息安全理论与方法研究

国家自然科学基金

10+阅读 · 2012年12月31日

面向武器系统协同的态势感知一致性计算方法研究

国家自然科学基金

55+阅读 · 2011年12月31日

基于群体智能的多Agent协作模型与适应性研究

国家自然科学基金

18+阅读 · 2009年12月31日

微信扫码咨询专知VIP会员