美国陆军工程研究与开发中心系统工程研究所2021财年的工作利用深度强化学习开发了智能系统(红方智能体),能够在军事行动方案兵棋推演海上框架基础设施中展现出可信行为。基于2021财年的研究,本项研究致力于探索改进兵棋推演框架基础设施的方案,并调查改善人工智能(AI)智能体行为的机会。兵棋推演框架基础设施的增强包括与支持智能体训练、利用高性能计算资源以及开发支持人工智能对人工智能智能体训练与游戏对抗的基础设施相关的更新。在评估了不同算法选项的智能体训练后,与采用优势行动者-评论者(A2C)或近端策略优化(PPO)算法训练的智能体相比,采用深度Q网络(DQN)训练的智能体表现更优。在不同场景中的实验表明,在原始基线场景中训练的智能体表现出了可接受的性能。通过针对先前训练的红方智能体训练蓝方智能体,研究人员成功展示了人工智能对人工智能的训练与游戏对抗能力。观察智能体游戏对抗的结果揭示了体现两条战争原则的行为的出现,即节约兵力与集中兵力。