摘要

在自动化战场上,稳健且自适应的感知能力是确保军事态势感知系统效能与可靠性的关键。本文提出了一种多模态多智能体AI系统,旨在通过与单智能体方法的对比来增强军事态势感知。为了描述战场复杂且动态的特性,本文创新性地提出一种修正混淆矩阵,并基于此构建了三类案例场景,分别为信息冲突、军事诱饵与军事伪装。在案例研究部分,分别对单智能体与多智能体系统进行了建模,并利用多模态数据进行了测试。结果显示,复杂的对抗环境会影响AI智能体系统的性能。然而,即便使用相同的大语言模型,多智能体系统的成功率(在军事诱饵案例中为74.5%)也显著高于单智能体系统(2.7%)。其主要原因在于多智能体系统允许智能体间交互,且任务结构更为简化,这有助于实现更可靠、更稳健的决策。

关键词: 大语言模型;多智能体系统;军事态势感知;单智能体系统;自动化战场

1. 引言

在自动化战场上,海量异构数据几乎被实时采集与处理,以支持快速有效的指挥与控制¹。构建自动化战场的首要且最关键步骤,是精准感知作战环境。这要求整合来自传感器、无人机、作战人员及其他武器平台的多元数据,以构建连贯、实时的态势图²。准确的态势感知使系统能够区分敌我力量,识别潜在威胁,并捕捉战术契机。缺乏可靠的感知层,即便是最精密的算法也可能产出错误的决策,进而危及任务成败。因此,稳健且适应性强的感知能力,对于军事态势感知系统的效能与可靠性至关重要。

目前,增强军事态势感知主要有两大范式。第一种是数据融合,其作为整合不同层级数据的标准流程已被广泛研究与探讨。例如,联合实验室主任(JDL)数据融合模型长期以来一直是系统化整合各类数据源的典范³⁻⁴。JDL模型最初引入了结构化的数据融合研究方法,涵盖目标精化(一级融合)、态势评估(二级融合)、威胁评估(三级融合)及过程评估(四级融合)。

随着计算机视觉与机器学习的兴起,场景识别成为另一重要范式。其旨在使机器理解视觉世界⁵。场景识别不仅关注简单检测与定位目标,更着眼于不同背景下目标间的语义关联。传统场景识别主要侧重于单模态方法,但近期已有少量尝试将其能力拓展至音频、文本等其他场景相关信息。

在上述两大范式推动下,战场自动理解技术已取得长足进步。然而,既往研究多聚焦于基于局部信息的场景分类(如广泛采用目标检测算法)。鉴于OODA循环(观察、判断、决策、行动)作为主流军事决策周期的背景,本研究旨在将当前对“观察”的关注延伸至“判断”,并最终衔接至复杂战场环境下的“决策”。此外,敌方或对抗性活动可能导致收集到的数据存在偏差,从而引发错误的“判断”与“决策”。一种可能的解决方案是利用智能AI智能体。然而,单智能体系统在处理战场上纷繁复杂的数据源时往往力不从心。另一挑战在于如何表征复杂的对抗环境。若该环境过于复杂而难以掌控,则难以捕捉AI智能体的实际效能。

本研究提出并测试了一种多模态多智能体AI系统,旨在通过与单智能体AI系统的对比来提升军事态势感知能力。为描述战场复杂且动态的本质,本文创新性地提出一种修正混淆矩阵,并基于此构建了三类案例场景。这是首次尝试在军事领域利用多模态数据,对单智能体与多智能体AI系统进行比较研究。此外,案例研究将揭示复杂对抗环境对AI智能体系统性能的影响,并为智能体交互提供深刻见解。

本文结构安排如下:第二节回顾军事领域的态势感知及用于场景识别的AI智能体相关研究;第三节概述结合修正混淆矩阵框架;第四节利用多模态数据对单智能体与多智能体系统进行案例研究;最后为结论。

2. 相关工作

2.1 军事领域的态势感知

态势感知是指“对环境要素及事件在时间或空间上的感知,对其意义的理解,以及对未来状态的预测”⁶。鉴于战场是亟待精准感知的最复杂环境之一,军事态势感知对于建立通用作战图及支撑有效决策至关重要。近期,有学者指出俄乌战争推动了信息技术的积极发展与应用⁷。他们通过将AI与自动化作为影响因素,拓展了Endsley的三级态势感知模型。这三级模型包括要素感知(第一级)、综合理解(第二级)及未来状态预测(第三级)。

数据融合作为统摄性术语,用于处理多元数据源以提升军事态势感知,并能缩短OODA循环。JDL数据融合模型已被多国采纳,类似的数据融合模型亦相继问世,如英国数据融合模型⁸。Das⁹探讨了JDL模型的各类技术与应用。例如,针对不同层级提出了相应技术:用于一级融合的目标跟踪技术(卡尔曼滤波、联合概率数据关联等);用于一级半融合的分类与群组跟踪技术(朴素贝叶斯分类器、时空聚类等);用于二、三级融合的态势与威胁评估技术(贝叶斯信念网络、隐马尔可夫模型等)。

2.2 用于场景识别的AI智能体

随着自动驾驶汽车、移动机器人等现实应用的出现,场景自动识别变得至关重要。然而,由于场景类别间低类间差异(视觉不一致性)与高类内差异(标注模糊性)两大难题,该领域仍面临巨大挑战¹⁰。Xie⁵等人将场景识别算法归纳为六大类:全局属性描述符、块特征学习、空间布局模式学习、判别区域检测、目标关联分析及混合深度模型。这些算法涵盖了从捕捉场景低级属性到近期能利用多级卷积层提取局部与整体特征的混合深度模型。Matei¹⁰等人调研了用于场景识别的深度学习模型,得出类似结论:能够提取不同层次语义的集成技术效果显著。

尽管场景识别主要聚焦于场景分类,但AI智能体的提出旨在通过大语言模型(LLM)¹¹的力量提供更动态、更具交互性的结果。早期利用AI智能体与遥感数据的尝试主要解决特定任务,包括场景分类、视觉问答及图像字幕生成¹²。遥感智能体(RS-Agent)被提出作为一种单一的综合性模型,用于目标检测、超分辨率重建、分类及地理问答¹³。其对图像的查询输入经由gpt-3.5-turbo处理,并输出答案。类似地,RSGPT与Geochat分别探索了用于图像字幕生成与视觉问答¹⁴以及空间推理与目标检测¹⁵的生成式预训练模型。

传统场景识别的另一特征是单模态性。部分研究者采用多模态技术,以利用源自图像的所有相关信息,如文本、音频及地理数据。Xu¹⁶等人提出了一种建模视觉图像、上下文标签及多概念语义间关联的方法。Hammand¹⁷等人则利用基于互信息的特征选择方法进行多模态融合。

基于上述研究,本文采用多模态AI智能体以增强军事态势感知。其区别在于本文所面对的复杂对抗环境——即战场。在战场上,存在敌方的概念,且其可主动试图按自身意图操控我方态势感知。为系统应对这一复杂对抗环境,本文将提出一种修正混淆矩阵,并基于此矩阵构建的案例场景,探究多智能体系统(MAS)的效能。

3. 提出的框架

图1同时展示了结合AI智能体与人类参与的“判断-决策”阶段。该阶段基于“观察”阶段获取的信息评估环境,并决定行动方案,进而导向“行动”阶段。

本研究提出一种多模态多智能体AI系统以增强军事态势感知。图1展示了我们在战场上可能面临的抽象环境,以及OODA循环决策周期。为描述战场复杂且动态的本质,本文提出修正混淆矩阵;就OODA循环与态势感知而言,该矩阵代表了“观察”或“感知”阶段。

为利用AI智能体强化决策循环,本文提出如图2所示的多模态多智能体AI系统。当从战场收集到多模态数据时,多智能体系统利用一组AI智能体协同工作,而单智能体系统则由单个AI智能体承担所有必要任务。在本研究中,AI智能体基本通过大语言模型实现。

在“观察”阶段,修正混淆矩阵是本研究的核心。传统上,混淆矩阵通过比较地面真值与模型感知结果,用于测试已构建模型的准确率。矩阵的每一列代表实际类别或地面真值中的实例,每一行代表预测类别或感知结果中的实例。矩阵对角线代表被正确检测的实例。

修正混淆矩阵表征了存在对抗方与不确定性时的环境复杂性。本研究将其分为三类,这与原始混淆矩阵有所不同。第一类(图1(a))为信息不确定性。当信息源自多种渠道时,可能因天气、认知负荷、疲劳、设备故障等原因导致错误或冲突信息。第二类(图1(b))为假阳性强化,即代表负实例却被误导感知为正实例。例如,军事假目标与诱饵,它们是伪装的武器装备,旨在诱使敌方浪费弹药并过早暴露意图。第三类(图1(c))为假阴性强化,即代表正实例却被误导感知为负实例。例如,军事伪装通过涂覆颜色与使用特殊材料来保护装备与人员,这也为实施观察与突袭创造了条件。当这三类情况交织并存时,环境复杂度将急剧上升。

近期,关于多智能体系统优势的探讨日益增多。Guo¹²等人简要指出,多智能体系统可通过多个自主智能体的协作,应对更动态、更复杂的任务。与单智能体系统不同,多智能体系统允许智能体间交互,并采用多样化的智能体配置,从而实现集体决策过程。多智能体系统预期带来的效益包括更高的可靠性(减少幻觉现象)与更佳的效费比(无需庞大的内存与推理结构)¹⁸⁻¹⁹。尽管已有一些研究尝试验证多智能体系统相对于单智能体系统的优势²⁰,但在强化复杂决策方面仍需更多探索,尤其是在军事领域。

在图2中,多智能体系统可采用多种结构。借鉴Guo¹²等人提出的四种结构中的三种,本研究将多智能体系统结构划分为分层式、去中心化及集中式。分层式结构形成智能体的层级体系;去中心化结构允许点对点网络连接;集中式结构则设有一个中央智能体,负责与其他智能体交互。多智能体系统结构可以是这三种基本结构的混合体。

为构建具有特定结构的AI智能体团队,现有多种编程平台可供选择,如LangChain、CrewAI、AutoGen、AutoGPT等。这些大语言模型框架为构建基于大语言模型的应用提供了丰富的工具与抽象层。在完成图2中的“判断-决策(AI)”阶段后,无论是单智能体还是多智能体系统都将生成响应或建议,随后由人类操作员决策并执行(“判断-决策(人类)”)。

4. 案例研究

本节将在战场环境下对比所提出的多模态多智能体系统与单智能体系统,评估多智能体系统是否能有效增强军事态势感知。基于图1中的修正混淆矩阵构建战场场景,并对AI智能体进行建模以应对这些场景。

4.1 测试环境

图3展示了结合AI智能体的测试环境,该环境衍生自图2提出的框架。战场信息源主要有两类:前方观察员通过观察任务区域提供信息(音频信息假定已转化为文本报告);另一信息源来自无人机,提供视觉报告。基于这两类信息,要求AI智能体从“停止”或“前进”部队这两个选项中择一。各智能体的建模信息及更详细的场景说明将在后续章节中阐述。

单智能体系统(图3左侧)利用两份报告,并由一名精通军事信息分析的AI智能体进行决策。相比之下,多智能体系统(图3右侧)由四名不同的AI智能体组成:文本智能体、图像智能体、军事图像智能体及领导者智能体。文本与图像智能体分别独立分析文本与视觉报告。军事图像智能体在军事领域更为专精,负责校验图像智能体的分析结果。最后,领导者智能体综合其他智能体的分析结果并做出最终决策。

图3中的多智能体系统结构可视作简易分层结构与集中式结构的混合体。领导者智能体可与其他智能体通信,并在必要时索取进一步信息。为构建AI团队,本研究采用了流行的多智能体平台CrewAI。CrewAI是一个开源Python多智能体框架,能有效协作AI智能体完成各类任务。它提供了一系列工具,如网页浏览器搜索工具、检索增强生成(RAG)工具、图像生成工具等,并通过LiteLLM连接可用的大语言模型。

案例研究中使用了CrewAI 0.102.0版本及CrewAI工具0.36.0版本。为使AI智能体能执行网页搜索,采用了DuckDuckGoSearch库。尽管单智能体系统仅包含一个智能体,但仍使用CrewAI实现,以最小化测试环境差异带来的影响。在多智能体系统中,智能体按图3描述的方式连接,并采用顺序流程选项。仅领导者智能体可要求其他智能体进行进一步分析。

作为智能体的“大脑”,本研究采用了未经微调的Google Gemini。Gemini是2023年推出的多模态大语言模型系列,作为OpenAI ChatGPT系列的主要竞品之一而被广泛使用。为确保单、多智能体系统间对比的公平性,图3中的所有智能体均使用特定的Gemini模型,即通过其应用程序编程接口(API)调用的Gemini 1.5 Flash。

最后,采用Google Colaboratory(Colab)作为提供TPU、GPU等计算资源的云服务。该集成开发环境支持Python编程,便于整合CrewAI及所需库。需注意,使用CrewAI编程需定义智能体配置与任务,这些内容将在各案例中详细提供,以确保可复现性。

成为VIP会员查看完整内容
4

相关内容

军事防务数据板块介绍:系统化采集、存储、管理、分析与军事国防安全相关信息的专用数据板块,其核心在于整合全球新兴国防技术(军事人工智能、无人系统等)、热点案例(俄乌战争、美以伊战争)等方面的最新时讯、研究报告/论文、条令法规、案例分析,为战略研判、情报分析、决策支持等提供知识支撑。
《迈向军事智能网络态势感知》最新报告
专知会员服务
26+阅读 · 3月2日
基于大模型的态势认知智能体
专知会员服务
199+阅读 · 2024年4月7日
基于人机智能融合技术的态势感知应用研究
专知会员服务
97+阅读 · 2024年2月11日
面向多智能体博弈对抗的对手建模框架
专知
18+阅读 · 2022年9月28日
人工智能技术在军事领域的应用思考
专知
49+阅读 · 2022年6月11日
有关军事人机混合智能的再再思考
人工智能学家
22+阅读 · 2019年6月23日
国家自然科学基金
345+阅读 · 2017年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
10+阅读 · 2013年12月31日
国家自然科学基金
18+阅读 · 2012年12月31日
国家自然科学基金
55+阅读 · 2011年12月31日
国家自然科学基金
24+阅读 · 2011年12月31日
国家自然科学基金
50+阅读 · 2009年12月31日
国家自然科学基金
17+阅读 · 2008年12月31日
VIP会员
最新内容
《边缘计算关键技术分析及美军作战实践应用》
专知会员服务
0+阅读 · 今天14:08
边缘计算的军事应用
专知会员服务
1+阅读 · 今天13:50
一种考虑资源机动性的武器目标分配混合算法
专知会员服务
4+阅读 · 8月8日
《多域冲突比较支持模型》60页
专知会员服务
10+阅读 · 8月7日
相关基金
国家自然科学基金
345+阅读 · 2017年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
10+阅读 · 2013年12月31日
国家自然科学基金
18+阅读 · 2012年12月31日
国家自然科学基金
55+阅读 · 2011年12月31日
国家自然科学基金
24+阅读 · 2011年12月31日
国家自然科学基金
50+阅读 · 2009年12月31日
国家自然科学基金
17+阅读 · 2008年12月31日
微信扫码咨询专知VIP会员