武器—目标分配问题是军事行动中的核心组合优化任务,其核心在于如何将有限的武器资源高效分配至敌对目标。现有方法涵盖精确算法、启发式及元启发式等多种路径,但普遍面临解的质量与计算效率之间的权衡困境,难以满足实时、大规模武器—目标分配场景的应用需求。本研究提出一种名为Joint-PointerPPO的新型强化学习框架,该框架将双Transformer编码器与指针网络式解码器相集成,并采用近端策略优化算法进行训练。模型借助注意力机制有效捕捉武器与目标之间的结构交互关系及拦截概率,具备卓越的表达能力与分配性能。大量实验表明,相较于商业求解器,本方法在保持竞争性解质量的同时,推理速度显著提升,尤其在可用武器数量少于目标数量的资源受限场景下优势明显。此外,该模型在大规模武器—目标分配问题中展现出强大的实时决策潜力与泛化能力,此类场景在未来现代化战争中将频繁出现。
关键词: 强化学习;Transformer;指针网络;近端策略优化;武器—目标分配
图1:所提Joint-PointerPPO架构概览。 双Transformer编码器分别处理无人机与目标特征;非线性pij嵌入模块整合拦截概率;成对多层感知机对嵌入向量进行融合,构建联合模块。基于LSTM的指针网络解码器结合动态注意力掩码机制,生成无人机—目标联合分配方案;价值网络复用联合模块以估算状态值。两网络均通过近端策略优化算法进行端到端训练。
武器—目标分配问题长期以来被视为军事行动中的基础性挑战,其研究起源于早期国防优化探索,并随着现代战争复杂性的提升而持续演进。传统上,武器—目标分配问题主要聚焦于将火炮、导弹等武器平台分配至特定目标。然而,随着无人机的广泛部署,该问题在现代战争中的重要性再度凸显。值得注意的是,俄乌冲突中双方投入了数以千计的小型无人机,这场冲突被誉为世界首场大规模无人机战争[1, 2]。这一发展态势迫切要求未来的武器—目标分配系统能够同时调度数千项武器资产,并确保分配机制的高效性。此外,真实战场环境具有天然的动态性:威胁态势瞬息万变,决策必须在极短的时间窗口内完成。因此,武器—目标分配系统不仅需提供高质量的解决方案,还必须保证足以支撑即时战术响应的推理速度。
在实践中,以有限拦截器应对大量分散目标的场景占据主导地位。因此,武器数量少于或等于目标数量的情境最具代表性。这种主导性源于多重结构性约束,包括:(一)弹药、维护与补给周期的限制(即弹药基数深度);(二)多轴向突防引发的同步交战激增;(三)指挥控制及“传感器—射手”链路的带宽吞吐瓶颈。基于上述作战现实,本研究聚焦于武器数量不超过目标数量的场景,重点考察大规模部署、实时适用性以及在资源受限条件下的泛化性能。
设计一个能同时满足上述功能需求的武器—目标分配系统极具挑战性。本质上,武器—目标分配问题属于组合优化任务,其一般形式已被证明为NP完全问题[3]。随着武器与目标数量的增加,解空间呈指数级膨胀,导致计算复杂度急剧上升。此外,为真实还原战场动态,问题还需纳入弹药限量、毁伤概率不确定性、时效性作战要求以及威胁等级的动态演化等附加约束。这些因素共同将武器—目标分配问题提升为不确定环境下的实时决策挑战,要求在有限资源下优先消除最具致命性的威胁,进一步加剧了其求解难度。
学界已提出多种方法以解决武器—目标分配问题。经典方法包括分支定界、动态规划等精确算法[4, 3],以及遗传算法、群智能方法等启发式与元启发式路径[5, 6, 7, 8]。这些方法在特定条件下虽具成效,但普遍存在随问题规模扩大计算成本激增、对动态环境适应性有限,以及难以捕捉复杂结构依赖关系的缺陷。相比之下,强化学习凭借其快速推理能力、对实时决策的适配性,以及直接从数据中学习结构模式的优势,成为一种颇具前景的替代方案[9]。特别是神经组合优化领域的进展,已使强化学习在旅行商问题、背包问题等经典组合优化问题上取得显著成果[10, 11, 12],近期相关方法亦逐步拓展至武器—目标分配领域[13, 14, 15, 16]。
然而,基于强化学习的方法并未在所有结构设置下均能稳定保证性能。训练所得策略可能过度拟合特定模式,或在复杂场景中无法有效探索庞大的状态空间。因此,设计能够明确考量武器—目标分配问题结构特征的政策架构与训练条件至关重要。
基于此,本研究提出Joint-PointerPPO——一种专为武器—目标分配问题量身定制的新型强化学习架构。该模型通过结合神经网络表征学习与强化学习,旨在捕捉武器与目标间的丰富交互关系。双Transformer编码器对输入特征进行上下文编码,指针网络解码器生成灵活的分配序列,从而实现不受问题规模限制的稳健策略学习。训练过程基于近端策略优化算法[17],确保了策略更新的稳定性与数据利用效率。最终,该模型能够提供适用于实战部署的高质量实时决策。
本研究的贡献主要体现在三个方面:首先,引入了一种基于Transformer—指针网络的强化学习架构,有效解决了资源约束下的武器—目标分配问题;其次,论证了其作为大规模武器—目标分配场景核心算法的潜力;第三,验证了该模型在组合优化任务中实现快速推理与泛化的能力,暗示了其在武器—目标分配领域之外的广泛应用前景。