摘要

现代军事行动要求指挥员在管理多样化战场信息流的同时,就有效分配多支友军部队以应对敌方威胁作出复杂的战术决策。本研究提出一种用于地面作战的智能反制力量分配(ICAGO)方法,该方法利用多智能体强化学习(MARL)来支持地面战争中的指挥层级决策。ICAGO专为旅级及以上部队优化而设计,能够在防御、进攻及攻防同时进行等作战样式中实现有效的反制力量部署。该方法将关键战术行动(如按接近路分配机动部队及炮兵目标分配)建模为MARL智能体的动作,并将基于条令的战术要素嵌入奖励函数。MARL智能体采用Soft Actor-Critic算法实现,并通过图注意力网络进行扩展,以管理超过40个异构智能体(步兵、坦克及炮兵)。与基于规则的方法相比,ICAGO表现出更低的性能方差,并在基于条令的指标上取得显著提升,包括在不确定性和多样化作战场景下,胜率提高30%,对关键友军区域的保护能力增强。这些结果凸显了MARL在人力资源受限条件下增强大规模智能兵力分配的潜力。

现代武器系统的日益多样化与复杂化,加之来自各种探测与情报资产的战场信息呈指数级增长,要求指挥员及参谋人员具备更广泛的专长与决策能力[1]–[3]。例如,在韩国战斗训练中心(KCTC)进行的旅级地面作战演习会产生海量数据——从目标位置、状态更新到交战记录——每次演习通过数亿条语音、视频和信号传输捕获,同时有数千名人员和装备在运作[4]、[5]。鉴于这种规模,数量有限的资深指挥员和参谋人员要实时处理和分析所有可用数据正变得愈发不可行。因此,指挥决策往往基于浓缩或经过筛选的信息在概念层面作出[6]、[7]。在现代战争快速演变且信息密集的环境中,对智能指挥决策支持技术的需求日益增长,这些技术能使少数指挥员和参谋人员快速分析大量数据并作出及时、准确的决策[3]、[8]、[9]。为应对多维一体化战场的复杂性,各国军队正越来越多地将人工智能(AI)和虚拟现实等先进技术整合到其指挥支持系统中[3]、[10]。

传统上,基于智能体的建模(ABM)已被广泛用于军事决策与指挥决策支持[3]、[11]。在ABM中,智能体被定义为具有独特属性和行为的自主实体,它们与环境和其它智能体交互。ABM旨在通过单独建模自主战场实体的行为特征,更准确地模拟战斗的复杂动态本质。为实现作战目标,诸如部队、士兵或武器系统之类的智能体以一定程度的独立性运作,执行寻路、探测和基于规则的接战等任务。这些智能体对外部环境(包括地形特征和敌方行动)作出随机响应,从而能够模拟出逼真的大规模战斗场景。这种复杂性难以用传统的线性建模方法捕捉,后者通常假定清晰的因果关系并依赖简化的输入—输出映射[11]、[12]。尽管ABM在模拟战斗复杂性方面已被证明有效,但其本质上缺乏智能决策能力。为解读战场态势并预判未来发展,ABM可与具备学习、适应和预测能力的高级人工智能(AI)技术相集成。随着ABM规模扩大且复杂性增加,手动定义交互规则变得不切实际,且必须修改更多参数以拟合经验数据。然而,集成AI可为智能体提供隐式学习规则的框架,并减少校准过程中常涉及的手动操作和主观偏见。

本研究提出将多智能体强化学习(MARL)算法与通过ABM建模的作战环境相集成,以实现智能指挥决策支持。诸如军事单位或武器系统等智能体在模拟作战环境中运作,并根据其当前状态感知采取行动。在此背景下,行动不仅限于移动、探测或射击等基本任务,还包括更高层次的战术行为,例如将部队分配到特定的敌方接近路,或指挥下属单位自主机动和攻击目标,这些均与传统智能体建模原则一致。在训练过程中,智能体从环境中接收奖励——可以是个体或集体的、正向或负向的——取决于其行动的结果。强化学习算法使智能体能够学习最大化长期累积奖励的最优行动策略。在军事背景下,这些奖励可以根据战术目标来定义,例如智能体生存、友军成功完成任务或对敌方部队造成的伤害。若有来自真实作战场景的充足作战和指挥决策数据,强化学习算法可以训练智能体在每个时间步作出符合情境的最优决策。然而,为军事作战规划和指挥决策支持实施AI,需要访问反映指挥员决策过程及关联结果(包括友军和敌军损失)的丰富数据集。此类涵盖战场条件、决策理由和交战结果的数据获取成本极高,且大量收集它们面临着重大的实际挑战[13]–[15]。

由于真实战场和指挥决策数据成本高昂且可用性有限,先前的研究依赖模拟作战环境(通常由基于策略的模拟游戏或定制兵棋模拟器生成)来训练用于指挥决策支持的AI模型[16]–[20]。值得注意的是,MARL已在模拟作战环境中展示了建模和执行军事条令的潜力。例如,Basak等人[16]探索了将条令约束集成到MARL框架中,使自主智能体能够在适应动态作战场景的同时,与既定战略指南保持一致。这种混合方法增强了AI驱动决策的真实感,并确保学习到的行为符合实际军事条令。Kim等人[17]通过《星际争霸》多智能体探索挑战,深入探讨了训练AI智能体学习复杂、多阶段军事行动所面临的挑战。他们的研究强调了AI系统必须在环境不确定性下运作,并在不依赖精心设计的奖励函数的情况下作出多步决策的必要性。此类能力的发展对于推进能够执行战术行为(例如在不可预测和动态的作战场景中,在有利条件下——包括高地或隐蔽地形——率先探测敌方部队或接战)的AI模型至关重要。最近,Dimitriu等人[18]证明,基于强化学习的方法可在高度逼真的模拟(如《指挥:现代作战》(CMO)所提供的模拟,该模拟对历史和现代战争环境进行建模)中为作战规划和战略决策提供有价值的见解。为解决CMO中的独特挑战,他们开发了一种近端策略优化(PPO)强化学习智能体,成功学习了监视、敌我识别、战斗和区域扫荡等任务的接战策略。在此工作基础上,Choi等人[19]探索了利用强化学习实现地面部队作战兵棋模型的自动化。他们的研究表明,基于强化学习的计算机生成兵力(CGF)能够自动适应战术变化,优于依赖既定条令的传统基于规则的CGF。这一进展有潜力提高包括作战、无人机侦察和弹药补给任务在内的各种军事行动的准确性和效率。除这些贡献外,Li等人[20]引入了一种基于深度确定性策略梯度(DDPG)的智能算法来解决最优武器—目标分配问题。该方法优化了军事资产的部署,能够高效打击敌方部队并提高决策效率。先前的研究已在小规模军事行动模拟中比较了各种强化学习算法,这些模拟通常设置在受限环境中,如游戏或网格地图[21]–[23]。这些模拟通常涉及与静态敌人的交战或集结、避障和侦察等基本任务。这些研究已证明强化学习优于传统的专家或基于规则的指挥决策系统。然而,将这些发现应用于更大规模的作战(如旅级及以上)时,会面临与计算资源需求、模型可靠性和可扩展性假设相关的挑战。因此,为积累更真实的战场交战数据并增强基于智能体的指挥决策支持,本研究开发了一个将强化学习框架与真实战场数据相结合的虚拟战场模拟环境。我们提出了一种在反制力量分析中优化作战力量分配以支持指挥决策的方法。作战力量分配涉及众多变量,包括部队类型、能力、位置、敌方实力、地形和任务目标。强化学习擅长处理高维状态和动作空间,使其能够管理战场场景固有的复杂性。

战场环境的构建基于真实地形,用于优化友军部队和战略接近路的分配,同时融入了传统兵棋模型的模拟逻辑。与先前侧重于在CGF层面优化单个友军行动[19]、[22]或为策略模拟游戏开发强化学习智能体[24]–[26]的研究不同,本研究的目标是为更大规模作战场景中的友军部队分配和决策优化提供方法。利用强化学习进行作战力量分配优化的研究不仅仅是渐进式改进;它代表着向更智能、更具适应性和更有效的地面作战的根本性转变。通过利用强化学习,我们可以超越静态规划和人类认知偏见的局限,实现增强任务成功、最小化伤亡并确保宝贵军事资源最优利用的实时、数据驱动决策。

本研究的目标是优化友军部队的分配以与特定敌军部队交战——这是一种将战术目标融合为更高层级行动的方法——同时通过基于既定战术条令的规则模拟逻辑实现较低层级的部队行动,如机动、探测和射击。这种方法缓解了AI生成的部队行动可能与传统军事条令相冲突的问题。此外,我们应对了将AI技术(如强化学习)应用于大规模部队(旅级及以上)的挑战,其中计算和学习时间随智能体、状态和动作数量呈指数增长。本文介绍了一种可扩展的MARL方法,旨在最大化AI集成到真实世界指挥与控制系统的效率,并通过实验结果证明其有效性。

成为VIP会员查看完整内容
2

相关内容

军事防务数据板块介绍:系统化采集、存储、管理、分析与军事国防安全相关信息的专用数据板块,其核心在于整合全球新兴国防技术(军事人工智能、无人系统等)、热点案例(俄乌战争、美以伊战争)等方面的最新时讯、研究报告/论文、条令法规、案例分析,为战略研判、情报分析、决策支持等提供知识支撑。
VIP会员
最新内容
综述 | 终端智能体:命令行环境中的 AI Agents
专知会员服务
3+阅读 · 8月24日
综述 | 多模态智能体框架基础与前沿
专知会员服务
2+阅读 · 8月24日
《自适应无人机集群网络开发》
专知会员服务
5+阅读 · 8月24日
无人机与作战飞机最佳精确目标定位技术
专知会员服务
4+阅读 · 8月24日
博士论文 | 大动作空间中的在线与离线策略学习
论文 | 全球负责任 AI 指数 2026 方法论
专知会员服务
7+阅读 · 8月23日
超致命战场空间中的战术通信生存能力
专知会员服务
5+阅读 · 8月23日
微信扫码咨询专知VIP会员