摘要——本文提出了一种利用携网无人机集群拦截高机动无人机的解决方案。我们将该问题建模为竞争性多智能体强化学习(MARL)任务。针对非平稳性及智能体过度拟合当前对手策略导致的灾难性遗忘问题,采用带优先级虚拟自博弈(PFSP)的多智能体近端策略优化(MAPPO)算法对追捕者与逃逸者进行训练。在高保真仿真环境中,我们使用集总推力与机体角速率(CTBR)底层控制指令对智能体进行训练,以实现追捕者与逃逸者的高机动飞行。通过捕获率、捕获耗时及坠机率等指标,将训练所得策略与启发式基线进行对比,结果表明本方案性能更优。消融实验证明,PFSP能生成适应性更强的策略,有效应对不同对手战术;而底层控制指令对于学习追逃任务中的高性能策略至关重要。最后,对习得行为的定性分析揭示了追捕者之间涌现出的协同战术。
图1:采用多智能体竞争性强化学习方法,训练携网追捕无人机集群与逃逸无人机实现高机动追逃对抗。追捕者与逃逸者均习得底层控制策略,使其能够在高保真仿真环境中执行动态机动。
利用自主无人机拦截高机动空中目标,是机器人技术与安全防御领域的关键挑战。随着无人机非法侵入限制空域的事件日益频发,空域防护、关键基础设施安保及重大活动安全保障等应用场景,亟需能够以最小附带损伤制服未授权无人机的解决方案[1]。搭载捕获网的拦截无人机集群是一种极具前景的技术路径,但其成效取决于针对规避目标的先进控制与协同能力。
传统拦截方法依赖精确模型、预设策略或可预测的目标行为[2]。然而,现代四旋翼无人机可执行大过载动态机动,并能主动规避捕获,导致传统方法失效[3]。
深度强化学习(RL)的最新进展表明,无人机能够通过与环境的交互自主学习高机动飞行行为。RL训练的策略已在无人机竞速领域展现出超越人类的性能,智能体可在复杂赛道中以动态机动完成导航[4]。但无人机竞速通常面对静态或可预测的障碍门,而拦截任务要求智能体响应主动规避捕获的对抗性目标。与此同时,多智能体强化学习在竞争环境中取得了显著成功,尤其在复杂博弈领域[5][6]。
本研究将携网追捕无人机集群与高机动逃逸目标之间的对抗建模为竞争性MARL任务。相较于现有文献,本文的主要贡献如下:
论文后续章节安排如下:第二节综述无人机集群拦截的相关研究;第三节阐述强化学习与竞争性自博弈的理论基础;第四节详述训练方法;第五节展示实验结果并进行对比分析;第六节总结全文并展望未来研究方向。