本工作通过集成增强决策与可解释性的方法,推进了复杂空战中的多智能体强化学习(MARL)。利用基于OpenAI Gymnasium框架构建的逼真六自由度空中仿真,我们研究了动态场景中的竞争性智能体交互。我们应用可解释性技术来阐明智能体行为与交互模式。该多智能体强化学习框架进一步通过知识图谱、大语言模型以及使用LangChain框架的模块化编排得到增强。这将数据驱动学习与知识驱动推理相结合,以强化态势感知、协调与可解释性。实验结果表明,该集成在保持竞争性能的同时,提升了透明度与人类可解释性。
本研究的范围涵盖用于高保真六自由度空战仿真的可解释多智能体强化学习智能体的设计、训练与评估。重点在于将符号与神经方法(包括决策树、知识图谱、大语言模型与模块化编排)集成到一个有凝聚力的框架中,以在不牺牲智能体性能的前提下提升可解释性。该范围包括(1)用于生成训练数据的仿真环境,如JSBSim-Gymnasium和BVR Gym;(2)基于知识图谱的可扩展知识表示,以统一仿真输出与战术条令;(3)用于自然语言解释与查询翻译的大语言模型赋能推理。通过同时解决智能体级可解释性与系统级透明度,本研究为开发稳健、透明且可信赖的自主空战智能体作出了贡献。更广泛地,该范围从空战扩展到其他关键任务多智能体领域,如灾难响应与网络防御,在这些领域中可解释性、可扩展性与人机协作同样至关重要。