摘要:智能体人工智能是人工智能领域新兴的范式,指旨在以最少的人为干预追求复杂目标的自主系统。传统人工智能依赖结构化指令和严密监督,而智能体人工智能展现出适应性、高级决策能力和自给自足性,使其能够在不断变化的环境中动态运行。本综述深入探讨了推动智能体人工智能发展的基础概念、独特特征和核心方法。我们审视了其在医疗、金融和自适应软件系统等各个领域的当前和潜在应用,强调了在现实场景中部署智能体系统的优势。本文还探讨了智能体人工智能带来的伦理挑战,提出了针对目标对齐、资源限制和环境适应性的解决方案。概述了将智能体人工智能安全有效融入社会的框架,强调需要进一步研究伦理考量,以确保对社会产生有益影响。本综述作为对智能体人工智能的全面介绍,指导研究人员、开发人员和政策制定者以负责任和创造性的方式参与其变革潜力的发掘。
索引术语:智能体人工智能,自主系统,人与人工智能协作,适应性,治理框架,伦理人工智能。
A. 动机与背景
智能体人工智能构成了人工智能发展进程中的一次质的飞跃,其定义为能够在变化且不受控的环境中设定复杂目标,并通过自主管理资源来追求这些目标。然而,大多数人工智能系统都是作为受监督的工具构建和运行的,附带了限制和定义。这些系统擅长在特定边界内执行定义明确的任务,但当所尝试的任务没有终止状态或特定参数可供操作时,往往会显著失效。而智能体人工智能可以作为底层操作实体,即,目标导向的,即使在发生剧烈变化且需要在多个此类目标之间切换的情况下亦是如此。
推动智能体人工智能设计的因素之一,是迫切需要能够在更优且复杂的现实条件下运行、并具有显著灵活性空间的工具。例如,在灾害救援、医疗保健和网络安全领域,既需要做出正确决策,又存在相当大的混乱,独立控制局面的能力至关重要。智能体人工智能不仅辅助人类行动;它们还在承担需要高度参与和多任务处理且无需持续人工干预的任务时,增强了人类行动的能力。这种范式转变有望将人工智能的目标领域从被动和反应式扩展到专注于战略规划、信息处理和问题解决,从而在条件成熟时开启一个新时代。
智能体人工智能[1],[2],[3]对社会的影响可能相当可观。随着人工智能日益嵌入更多核心系统和行业,智能体人工智能系统将能够与人类并肩工作,承担可重新分配人力、提高生产力以及参与人类不宜或危险出现的任务。这种变革可能改变各行业的就业结构,实现协同工作,即人工智能执行操作性任务,而人类处理更复杂和更具战略性的角色。
B. 定义与范围
在此意义上,智能体人工智能包含了一类自主人工智能系统[4],这些系统承诺在无人监督的情况下完成一组跨越较长时间的复杂任务。它学习上下文并做出决策。此类系统被设计为以一定程度的自主性运行,使其能够穿越变化的环境、应对意外情况,并随时间优化性能。将自主性和适应性特征结合在一起,以应对面向任务的过程。与基于规则且需要执行指令的经典人工智能[5]以及模式化并生成图像的生成式人工智能不同,智能体人工智能兼具两者之长。
将智能体人工智能与当前人工智能范式并列,有助于明确其边界。例如,经典人工智能从未专注于图像识别或语言翻译[6],[7],而是旨在实现非常狭窄的目标。
首先是生成式人工智能[8]的工作原理。在逆向操作中,它组合通过数字学习到的信息片段,并创建内容,如文字或图像。另一方面,智能体人工智能超越了前两种方法,具有目标导向、输入驱动和适应性特征,使其能够在一段时间内完成复杂和多层次的任务,而无需每次都提供一套指令。
在本综述的此部分,重点在于为何应对智能体人工智能产生兴趣。从其结构和操作特征出发,为何它基于目标,以及这种先进的人工智能类型如何应用于其应用具有独特性的各个领域?此外,本文还探讨了使用基于此类人工智能的系统所产生的各种实际和道德问题,并讨论了应对安全性、透明度和问责制的方法。所提供的智能体人工智能定义使本综述的作者能够准确讨论此类人工智能系统的哪些特征使其区别于其他系统,并有助于对其开展有效和综合的分析。
C. 目标与贡献
本综述论文旨在全面汇集智能体人工智能知识,并界定其边界,以便更广泛的研究人员、开发人员和政策制定者更容易理解。本综述的主要贡献包括:
● 系统梳理构成智能体人工智能系统的核心要素,重点阐述这些系统与其他常识性和生成式人工智能系统的区别。
● 全面研究用于构建和评估智能体人工智能的技术和概念,包括架构、学习方法和训练方法。
● 在不同领域的当前和潜在用途,包括智能体人工智能实际应用有效性的实践案例。
● 突出工程问题,但不限于此:目标设计与收敛、上下文适应和资源限制。
● 本文考量了采用智能体人工智能所涉及的伦理、社会和监管问题,包括责任、公平和透明度等相关关切。
● 对未来研究提出建议,推进关于如何最好地将规模、上下文和伦理问题整合到智能体人工智能实施中的建议。
本文的预期贡献不仅仅是一次文献综述;相反,它们应提供一个有用且组织良好的背景,以阐述智能体人工智能的问题和细节。本文旨在为管理运营实践和技术解决方案提供重要见解,以促进和维持合乎伦理的智能体人工智能系统的发展。
D. 论文结构
本文的其余部分组织如下:
● 第二节介绍了基本概念和定义,有助于将智能体人工智能理解为人工智能大背景下的特定实体。
● 第三节探讨了智能体人工智能的典型结构,包括独立性、灵活性以及选择行动的能力。
● 第四节识别并描述了智能体人工智能构建的方法——结构设计、学习类型以及评估和效率度量形式。
● 第五节讨论了智能体人工智能已找到应用的不同领域,重点关注工业应用以及与人类协同工作的案例。
● 第六节展示了各种体现智能体人工智能系统的比较分析,侧重于评估这些系统时所采用的不同性能度量和指标。
● 第七节解释了智能体人工智能在目标设定和与环境交互方面的技术细节和困难。
● 第八节提出了社会、伦理和治理问题,涉及责任、公平和法律合规。
● 第九节审视了促进智能体人工智能建设性和负责任实施的现有系统,包括监督和监管组件。
● 第十节描述了知识差距和预期的研究与开发工作,同时考量了更新智能体人工智能理念。
● 第十一节提出了本文的最终评述,包括研究结论,以及需要跨学科联系以负责任地推动该领域前进的评论。
本综合综述将为智能体人工智能的当前状态、未来潜力以及为确保其安全有效部署必须应对的挑战提供宝贵见解。
摘要:本文审视了比德尔的现代兵力运用系统,并将其与多域作战概念的核心要义及原则相关联。文章引入了一种替代性作战概念——涌现、动态、全球与演进(EDGE)作战,其中某些任务必然需要运用人员要素,而其他任务则须由非人类智能实体在社会技术体系内自主执行。EDGE作战概念进而由一种替代性指挥方法作为支撑,该方法被定义为“人-自主指挥”(Human-Autonomy Command),旨在提升认知优势以及作战可用性、通用性与效率。复杂性与涌现研究有助于在两个真实案例中识别自学习、涌现与演进的特征,展示了人类与人工智能执行功能的异质性与适应性行为。研究结果支持构建一种技术无关、适应性强且分布式的“人-自主指挥”方法,尽管任务动态可能有所不同,但该方法能够安全高效地达成任务目标。本文得出结论:现代系统需要演进或让位于替代性方法,以成功支持未来的指挥官、操作人员、自主人工智能体及其相互关联的作战维度。某一领域(即虚拟领域)的行动必须被允许在另一领域(即物理或认知领域)产生涌现的协同作战效应。
关键词:现代战争;多域作战;认知优势;人-自主系统;人-自主指挥
图. 人-自主指挥(HAC)的功能架构。箭头表示信号、标志、符号及行动的流向,这些流向是观察、控制、合作以及对任务环境施加直接影响和在作战环境可控子空间内施加间接影响的手段。人-自主指挥(左)、认知控制(中)以及作战环境中的效应(右)分别对应前文所形式化的“人-自主指挥”、“人-自主系统”与“认知系统性行动协调”建构。
当代及未来的国防与安全作战日益呈现出时间紧迫性、资源紧迫性与安全紧迫性。能力要素之间表现出强烈的功能耦合与相互依存关系。比德尔(Biddle,2004)的现代兵力运用系统需要演进,以成功支持未来的指挥官、操作人员、自主人工智能体,以及它们之间相互关联的作战维度:物理域、虚拟/信息域和认知/社会域。某一领域(即虚拟域)的行动必须被允许在另一领域(即物理域或认知域)产生涌现的协同作战效应。
现代系统代表了一项严谨的学术努力,旨在厘清军事组织将潜在能力转化为作战力量的具体机制。因此,对其有效性进行初步分析是探究军事效能决定因素与特征的重要起点。
格拉维尔(Grauer)与霍罗威茨(Horowitz,2012)报告的研究结果表明,比德尔的现代框架系统并不能独立解释胜负。任务成功毋宁说是物质力量、政权类型以及其他通过特定兵力运用概念得以关联和转化的因素共同作用的结果。即便进一步研究表明现代系统对作战力量的生成并无独立影响,现代系统仍是一项重大的理论成就,因为它描述了一种战场关键因果关系的模型。探究这一框架对于推进关于复杂人类系统如何通过构建主体层面交互来产生有效绩效的通用理论至关重要。
设计与论述结构
本文所述工作旨在探究现代系统是否在当前及未来的多域作战(MDO)中充当军事行为的稳健吸引子,以及它是否仍有资格作为军事组织在其竞争环境中适应并取胜的主要机制之一。
多域作战的一个特例尤为值得关注——涌现、动态、全球与演进(EDGE)作战(Norlander 2025a),其中某些任务必然需要运用人员要素,而其他任务则须由非人类智能实体在社会技术体系内自主执行。EDGE作战要求相关技术能够自主地与其他实体交互,并在无需持续人工监督的情况下应对作战环境(OE)中的变化。除社会技术层面外,还必须关注人-自主系统(HAS)的认知与系统性层面,该系统涵盖自主智能体、人类操作员与指挥官的完整谱系(Norlander 2024a, 2024b, 2024c)。
为了更好地理解HAS的能力与局限,包括其在各类任务与使命中的表现,必须厘清指挥与控制的认知层面。本文定义了一种“人-自主指挥”(HAC)方法,旨在增强认知优势,以管理和维持作战可用性、通用性与效率。复杂适应系统(CAS)研究体系(Holland 1995, 2006)为识别复杂系统中各实体的自学习、涌现与演进特征作出了贡献,展示了异质性与适应性行为。CAS具有自学习、涌现与演进的特征。唯有应用适应性控制策略,方能实现安全高效的控制。将自主适应智能体(AAA)研究体系纳入此项研究工作,使得将智能体视为团队成员、补充人类认知执行功能的视角成为可能,进而形成一种技术无关、适应性强且分布式的系统,尽管任务动态可能有所不同,但该系统能够安全高效地达成任务目标。
本文由美国战争部(DOW)下属非常规战争中心(IWC)资助的一项新研究项目所成。该项目旨在回答这一问题:“何为认知战(CogWar),其与信息作战(IO)、政治战、宣传及其他非动能战争形式有何区别?”[1]回答这一问题至关重要,因为认知战(CogWar)是21世纪非常规战争(IW)领域及空、陆、海、天等其他战争域中信息作战(IO)的根基所在,更是取得胜利——尤其是避免常规战争而实现胜利——的关键。[2]认知战(CogWar)的“域”以人类感知与信念建构的认知功能为作战空间。该作战空间内的斗争旨在争夺敌方与己方民众的感知。例如,其与信息作战(IO)的区别在于,信息作战(IO)争夺的是数据(及信息)本身,而认知战(CogWar)争夺的是赋予信息与数据以意义的语境与感知。[3]认知战优先考量的并非数据,而是数据的意义。认知战的核心问题不再是“人们注意到了哪些数据?”,而是“无论人们是否意识到这些数据,数据如何引导其形成特定的意义建构?”[4]学者、安全联盟及同盟的初步研究表明,尽管认知战(CogWar)的根基与战争本身一样古老,但就实现战略目标而言,其已成为一种新颖且可能更为有效的战争形式。[5]它利用恐惧、焦虑与猜疑等心理武器削弱对手的战斗意志,同时坚定己方民众继续冲突的决心。
现代国防系统日益复杂,对工程工作流的速度和适应性提出了越来越高的要求。虽然基于模型的系统工程(MBSE)与新兴的系统建模语言版本2(SysML v2)标准为捕获系统行为提供了框架,但其实际使用常常受到手动建模所需的专业知识和时间的限制。本研究探讨了大语言模型(LLMs)是否能够通过从制导、导航与控制(GNC)文本输入自动生成系统建模语言版本2(SysML v2)状态机来帮助克服这一障碍。开发并评估了三种基于Flowise的大语言模型:结构化转换模型(STM),其使用结构化提取和JSON编码过程;示例引导结构化模型(EGSM),其将结构化提取与示例驱动生成配对;以及示例引导上下文模型(EGCM),其应用灵活的参数提取和带有系统建模语言版本2(SysML v2)定义的示例驱动生成。每种模型均使用三个GNC子系统的技术文档进行测试:光电导引头、惯性恒星罗盘和混合导航系统。输出根据评估语法正确性、语义保真度和行为一致性的十个指标进行评价。优先选择70亿至140亿参数的本地大语言模型,因其定制化性能、隐私性和模型自主性,并与更大的模型GPT-4o和Claude 3.7进行了比较。结果表明,所有方法均成功生成了有效的、可重用的系统建模语言版本2(SysML v2)模型,达到了不同的保真度水平。本地模型,尤其是那些使用示例引导策略的模型,在大多数指标上取得了稳健性能,且需要最少的修正。这些发现表明,大语言模型能够支持自动化的系统建模语言版本2(SysML v2)模型生成,并显著降低与基于模型的系统工程相关的技术负担,有可能在国防相关系统开发中实现更广泛的采用。
关键词:大语言模型,系统建模语言版本2,制导、导航与控制
现代国防系统日益复杂,随之而来的是对关键系统的设计、分析和沟通需要更快、更适应性的方法。大语言模型(LLMs)的快速涌现标志着在国防应用中设计、理解和沟通复杂系统方式的一个变革性时刻。随着国防部(DoD)面临加速开发周期和适应不断变化的任务需求的压力,传统的基于文本的文档已被证明是不够的,因其缺乏灵活性、可重用性和可维护性。这些限制与数字孪生的实施不相容,在数字孪生中,动态的、基于模型的表示作为活系统随时间演变。
基于模型的系统工程(MBSE)与即将推出的系统建模语言版本2(SysML v2)标准提供了一种结构化方式,可将系统模型创建为单一事实来源,以可互操作格式捕获行为、结构和数据流。然而,构建MBSE模型所需的专业知识和投入常常限制其实际使用。本研究旨在证明,大语言模型能够通过从制导、导航与控制(GNC)用例的特定领域文本输入自动生成行为模型,从而大幅降低MBSE的门槛。大语言模型具有巨大潜力,可开辟一条更快、更便捷的路径,用于创建准确捕获系统行为并实现跨国防领域可扩展设计的代表性模型。
当前对国防部感兴趣系统的分析和开发状态证明,这些系统的复杂性和快节奏采办需要新颖的解决方案来快速设计、沟通和利用信息。基于模型的系统工程工具提供了通过状态机捕获复杂系统行为来创建描述性、视觉直观模型的方法。这种模型格式允许用户快速发现、共享和跨其他平台复制这些系统。然而,这一过程需要大量的组织投入和MBSE专业知识才能被正确使用。大语言模型可以通过从相关来源材料逻辑地自动生成特定任务的MBSE代码来弥合这一知识差距;从而加快时间表、减少组织负担并促进项目参与。
本研究假设,利用本地和基于服务器的大语言模型结合大语言模型工具将能够实现行为模型的自动生成,这些行为模型表示为基于MBSE的系统建模语言版本2(SysML v2)状态,从而加速系统模型的设计和开发。大语言模型可以通过自动生成准确捕获系统行为的描述性模型,弥合MBSE中广泛的专业知识和组织投入差距。这种方法有潜力增强模型重用性和灵活性,促进模型快速适应不同系统和应用。此外,小型本地大语言模型在可达的必要硬件、定制化性能、隐私性、操作安全性和自主性方面为国防部应用提供优势。更大的基于服务器的大语言模型可以指导关于在安全网络上部署或开发针对任务需求定制的更大的本地托管模型的战略投资决策。
本研究的主要目标是评估使用本地和基于服务器的大语言模型结合开源、低代码用户界面(UI)工具以支持GNC用例行为模型自动生成的可行性和有效性。具体而言,本研究旨在确定与系统建模语言版本2(SysML v2)建模语法和语义对齐的结构化提示工程是否能够使大语言模型将描述性技术文档转换为准确的、基于状态的系统模型。通过以GNC子系统的详细文本描述启动该过程,本研究试图展示如何使用系统建模语言版本2(SysML v2)捕获每个行为状态及其相关组件、功能和数据交互。最终,这项工作旨在表明,大语言模型辅助的模型生成不仅是可实现的,而且能够增强MBSE框架内系统模型开发的速度、可访问性和整体质量。
本研究探讨了使用大语言模型支持GNC子系统用例行为模型的创建和自动生成。所采用的建模框架是系统建模语言版本2(SysML v2),这是一种基于MBSE的语言,预计将于2025年获得正式批准和发布。使用开源、低代码UI Flowise开发了三种小型本地大语言模型,该UI能够构建具有定制提示和可调参数的自定义大语言模型链,并结合Ollama框架用于下载和管理所选模型。为建立性能基线,应用了相同的提示结构并使用更大的基于服务器的大语言模型(特别是GPT-4o和Claude 3.7)进行了验证。所有Flowise模型的输出根据十个定义的指标进行评估,评估语法正确性、语义保真度和输入-响应对齐,以确定基于大语言模型的提取、推理和系统建模语言版本2(SysML v2)代码生成的有效性。
本研究的预期贡献是生产定制的基于大语言模型的工具和定制提示,用于为GNC用例自动生成系统建模语言版本2(SysML v2)状态。这一结果不仅提供了代表性的打包模型,还提供了关于利用本地和基于服务器的大语言模型自动生成描述性模型的实用性的背景和见解。
论文题目:Unsupervised Post-Training of Foundation Models: A Survey 作者:Yijie Xu、Qianyi Cai、Huizai Yao、Yili Wang、Tianfu Wang、Cehao Yang、Xingbo Yao、Zhiyu Guo、Aiwei Liu、Xuming Hu、Weiyu Guo、Hui Xiong 机构:香港科技大学(广州)、香港科技大学、小红书、腾讯微信、香港中文大学、AI2 Robotics 论文链接:https://arxiv.org/pdf/2608.24982
基础模型后训练通常依赖外部监督:人工标注、偏好数据、更强教师模型,或数学验证器、单元测试、可执行环境等外部反馈。本文关注的是另一条正在快速增长的路线:无监督后训练。它只使用未标注输入,并从同一模型谱系自身产生的样本、分布、判断、目标或课程中提取学习信号,进而对参数、适配器、记忆或持久状态进行更新。 这篇综述的价值在于给“无监督后训练”划出严格边界。作者收录 2023 年 1 月至 2026 年 5 月的相关工作,冻结出 94 条方法记录,其中 80 条属于严格无监督后训练。严格定义需要同时满足四个条件:真实发生更新;输入没有标签;更新信号只来自同一模型谱系的样本或判断;任何评判器、打分器或奖励模型都必须来自同一谱系。也就是说,只在推理时搜索、不更新模型,不算;用了外部验证器、工具判定、人工标签或更强教师,也不算。 论文提出一个非常清晰的分类主轴:到底是什么“模型内部对象”提供了更新信号。由此得到四大家族:预测统计优化、样本关系监督、自生成目标自举、内部评估器自举。作者进一步给出一个正交视角:输入何时可见,更新能持续多久。两条视角合在一起,构成了选择和评估无监督后训练方法的技术地图。
基础模型后训练经历了两波外部监督。第一波是人工标签与偏好学习,例如监督微调和基于偏好的强化学习。第二波是外部验证器,例如数学检查器、单元测试和可执行环境,这类信号推动了可验证奖励强化学习。 第三波正在形成:模型只面对未标注提示、文本或目标输入,通过自身生成的样本、分布、判断和课程产生更新信号。它适合标签难以获得、验证器难以迁移或开放式生成难以精确打分的场景,例如领域语料适配、对话、摘要、长上下文和多模态推理。
论文的贡献包括三点。第一,提出严格的边界协议,把信号来源和任务结构分开讨论,避免把外部验证器或教师信号混入无监督后训练。第二,以“更新对象”为核心建立四大家族分类,并用输入可见性和更新持久性给出部署时机图。第三,从跨家族角度讨论适用场景、递归错误传播和部署检查,为未来评测提供统一语言。
论文覆盖文本和多模态基础模型,从 2023 年 1 月到 2026 年 5 月,聚焦在预训练之后使用未标注输入进行更新的方法。检索覆盖继续预训练、测试时适配、内部一致性、自训练、自奖励和多模态无监督后训练等关键词,最终整理出 80 个严格方法、8 个相邻方法以及若干边界或前驱记录。
无监督后训练被定义为:从已微调基础模型出发,使用未标注提示、文本或目标输入,修改模型参数、适配器、记忆或持久局部状态,并且更新信号不来自外部监督。外部监督包括标准答案、验证器反馈、工具执行判定、人工标签和更强教师标签。 作者提出四个边界检查。第一,必须有显式更新。第二,更新信号只能来自未标注输入和同一谱系模型产物。第三,不得引入外部监督。第四,任何评判器、打分器或奖励模型都必须由同一模型谱系产生。这个边界让许多看似相近的方法被归入“相邻轨道”,例如无更新的推理时搜索、工具辅助自训练、人工或种子监督自举、跨模型蒸馏和外部奖励方法。
论文把“内部更新对象”定义为产生更新信号的模型派生产物。它可以是预测分布、多个 rollouts 之间的关系、自生成目标、偏好对、候选答案、评判结果或奖励信号。分类不看方法名称,而看梯度实际消费的对象。多数投票如果直接作为奖励,是样本关系监督;如果用来筛选伪标签再做监督训练,则是自生成目标自举。
第一类方法最直接:从模型在单个观测上的预测统计量提取更新信号,例如负对数似然、熵、置信度或几何规则统计。它不生成伪标签,不构造偏好对,也不训练内部评判器,而是直接优化模型自身分布的某个量。 最典型的形式是继续预训练,即在未标注领域语料上最小化语言模型损失。当瓶颈是领域分布迁移时,这条路线简单有效。相关工作还将预测似然扩展到长上下文扩展、测试时学习和样本局部状态更新。
这类方法路径最短,成本和概念复杂度相对低,适合领域语料适配、长上下文语料扩展和分布漂移下的快速调整。但它的风险也很明确:优化低熵或高置信度不一定等于模型更正确。若内部统计与下游行为不一致,模型可能只是更自信地犯错。因此评测不能只看被优化统计量,还要看独立下游任务、校准和 held-out 质量。
第二类方法不读取单个样本的标量,而是读取多个模型样本之间的关系。内部更新对象可以是聚类质量、一致性得分、多数投票、语义簇、候选答案频率、样本间对比一致等。核心假设是:如果多个独立生成路径聚到同一答案,这个关系本身就包含有用信号。 单提示内部一致性是最简单的版本:对同一提示采样多个回答,按语义聚类、路径一致性或不确定性构造奖励。更常见的路线是测试时强化学习,例如对每个目标问题采样多个 rollouts,用多数答案构造伪奖励,再进行策略优化。
样本关系监督也迁移到多模态模型。视觉语言模型可以对图像问题生成多个答案,用频率、熵或一致性构造奖励;也可以通过自生成视觉问题、候选回答和多轮一致性形成训练信号。这些方法不依赖图像文本标签、外部 captioner 或外部验证器,而是从模型自身的多模态 rollouts 中提取监督。
一致性并不等于正确性。多数投票只有在错误足够分散、答案等价关系稳定时才可靠。如果多个样本共同落入同一个错误模式,训练会把“流行错误”放大。因此论文建议报告样本多样性、错误多数频率、不同答案规范化器下的稳定性,以及开放式改写后的收益是否保持。
第三类方法先从模型分布中构造可训练目标,再用监督微调或偏好优化训练。目标可以是指令、回答、知识问答、推理链、计划、课程、辩论轨迹或偏好对。与样本关系监督不同,这里的梯度不是直接消费“多数关系”,而是消费被筛选出来的目标数据。 例如,自教式知识获取可以从原始文档生成问答和反思任务;推理自训练可以生成多条思维链,用自一致性筛选后继续微调;课程自举可以让一个模型提出接近另一个模型能力边界的问题,再用内部伪标签训练求解器。
推理目标是这一家族最大的分支。方法通常生成多条推理轨迹,再按自一致性、置信度、前瞻质量或辩论共识筛选。另一条分支生成偏好对,再用类似偏好优化的目标训练,例如按自一致性、短长上下文表现或内部答案置信度对回答排序。
自生成目标的优势是数据对象可检查、可缓存、可复用,也更容易与离线训练流水线结合。风险是选择错误一旦进入目标集,会在后续轮次中持续存在,形成确认偏差。因此需要跟踪目标多样性、重复率、难度分布、轮次间漂移和 held-out 质量。
第四类方法把模型自身提升为评估器。内部更新对象不再只是目标,而是同一谱系模型产生的评判器、奖励模型、打分器或元评审。它可以输出成对偏好,也可以输出标量奖励;训练则通过偏好优化或策略梯度消费这些 verdict。 典型路线是自奖励语言模型:同一个模型交替扮演生成者和评判者,把选择与拒绝样本喂给偏好优化。后续方法通过跨轮一致性、元评审、时间锚定等方式缓解偏差放大、评判饱和和梯度消失。
内部评估器适合开放式任务,因为开放式输出很难用答案相等或多数投票来定义正确性。对话、创作、摘要、长文本和多模态生成往往需要语义标准,而不是硬答案。内部评估器能够提供更灵活的语义反馈,但反馈链也更长:评判器本身会漂移,演员和评判器可能共同偏向,错误更难被外部观察。
四大家族本质上把不同内部代理信号变成更新。预测统计优化利用分布形状;样本关系监督利用多样本聚合;自生成目标自举把选择结果物化为训练数据;内部评估器自举为开放式输出提供语义标准。语义灵活性越强,反馈路径越长,越需要独立评估、一致性约束和多样性保护。
如果数据是原始领域语料,问题主要是分布迁移,预测统计优化是直接基线。如果能够负担多样本采样,而且任务存在可靠的答案等价关系,样本关系监督可以利用共识。如果生成目标能被离线检查,自生成目标自举提供清晰的数据接口。如果输出开放且难以定义相等,内部评估器自举更合适,但必须监控评判漂移。
每个家族的防护点不同。第一类要检查校准和下游质量,而不是只看熵或似然。第二类要检查样本多样性、错误多数和答案规范化敏感性。第三类要检查目标集多样性和轮次更新。第四类要检查演员与评判器相关性、偏好边际、跨轮一致性和评判饱和。通用要求是保留冻结基线、回滚检查点和独立评测集。
更新对象回答“什么信号驱动更新”,适配时机回答“什么时候看见目标输入、更新能持续多久”。论文用输入可见性和更新持久性构成正交视角。相同更新对象可以被部署到不同时间制度中,因此家族决定监督形态,时机决定部署成本和风险。
离线语料适配发生在部署前,目标分布不可见,典型形式包括继续预训练、自奖励和离线自训练。全队列转导适配在目标推理前看到整个目标集合,常见于测试时强化学习。少样本目标适配只看到少量目标样本,再泛化到剩余目标,要求更强泛化。流式持续适配按时间推进,只能使用过去样本。测试实例适配为当前样本临时更新并在边界处重置。序列内适配则在一个长序列的 token 或 chunk 之间更新局部状态。
更新越靠近目标输入,潜在收益越针对当前分布,但也越容易引入不稳定性、计算开销和评测污染。更新越持久,越可能积累长期收益,也越可能积累错误。因此无监督后训练不应只报告“有没有提升”,还要报告输入可见性、更新预算、持续时间、是否重置、是否使用 held-out 目标评测。
递归错误传播是核心开放问题。内部代理信号不完美时,更新会强化被错误选择或错误奖励的输出,下一轮模型又在更偏的分布上产生新的代理信号。不同家族错误链起点不同:第一类从统计错配开始,第二类从错误多数开始,第三类从目标集污染开始,第四类从评判器漂移开始。
论文强调要把信号质量和任务结构分开。boxed answer、有限选项和代码签名可以帮助判断答案等价,但它们并不提供正确答案;单元测试和可执行验证器则提供正确性判定,越过严格无监督边界。未来评测应报告这些结构先验,并测试方法在不同规范化器和开放式改写下是否仍有效。
未来跨家族基准需要固定骨干模型、起始检查点、目标划分、采样预算、更新预算、任务结构和 held-out 评测,以区分信号家族、初始化和适配时机的作用。特别是内部反馈训练会强烈依赖起始模型和更新时长,如果协议不统一,很难判断方法本身是否有效。
这篇综述围绕一个问题组织 80 个严格方法:哪个模型派生对象提供了更新信号?答案形成四类方法:预测统计、样本关系、自生成目标和内部评估器。再加上输入可见性与更新持久性,论文给出了无监督后训练从方法选择到部署评估的完整坐标系。 最重要的权衡是:越语义化的内部信号越能处理开放式输出,但也会产生更长反馈路径,让代理错误被递归放大。无监督后训练的关键不是简单“不给标签也能变强”,而是把更新对象、任务结构和部署时机对齐,并在代理信号进入更新的位置设置防护。
论文的清单冻结在 2026 年 5 月,之后的新工作没有纳入。代表性结果保留各原论文的骨干、预算、指标和适配协议,因此适合机制级综合,不适合直接做合并效应估计。混合方法按梯度主要消费的更新对象归类。最后,严格边界限制的是更新规则,而不是部署栈;即使训练中没有外部 oracle,实际部署仍需要独立评测、监控和红队测试,防止奖励黑客和静默退化长期积累。
设计自主无人机蜂群受到广阔设计空间的阻碍,该空间涵盖平台、算法和数量规模的选择。我们在三种典型场景下执行了大规模基于智能体的仿真:蜂群对蜂群战斗、带损耗的协同区域搜索,以及分散目标的追击。展示了如何利用量纲分析和数据缩放将性能数据压缩到缩放函数上,这些函数在数学上简单,却反直觉,因此难以先验预测。这些缩放定律揭示了成功-失败边界,包括急剧的断点,展示了这些断点可被构建为“有效蜂群规模”。此外,展示了该技术如何用于量化智能体数量与平台参数(如速度、感知或武器射程以及损耗率)之间的权衡。此外,展示了在此框架内嵌入最优路径规划循环的好处,这能从定性上改善支配结果的缩放定律。展示的方法具有高度灵活性,能够支持针对大型自主蜂群的快速、预算感知的规模确定与算法选择。
无人机蜂群是为实现目标而协同运作的自主载具群组[15]。计算机处理、无人机间通信以及储能密度方面的技术改进[14],使更大规模的蜂群变得更加可行。然而,设计和部署大型蜂群需要解答诸多设计问题,例如哪些无人机最为合适、使用的最佳协同算法,以及所需的最小无人机数量。财务考量也可能发挥一定作用。
因此,无人机蜂群设计自然涉及关于扩展与权衡行为的问题,以确定最优算法或平台规格——如速度、武器射程或通信距离——或应对与不同平台规格相关的财务或技术限制。例如,固定预算可能允许建造许多缓慢、廉价的无人机,或者少量快速、昂贵的无人机。可能发现算法A在由慢速无人机组成的大型蜂群中表现最佳,而算法B在由快速无人机组成的小型蜂群中效果最好,且使用算法B的小型快速无人机蜂群总体表现更优。因此,设计和部署最优无人机蜂群需要描绘出某些性能指标如何依赖于潜在的大量参数以及离散的算法选择。
此外,性能指标对任何单个参数的依赖性可能十分复杂且不易猜测[13, 21, 9]。例如,性能可能包含一个“缩放断点”,即蜂群中无人机数量的变化导致性能饱和甚至下降[13]。例如,在觅食问题中,拥挤可能抑制性能[20]。另一个例子是最小资源分配,例如在对抗交战中成功所需的最小无人机数量[8]。正如我们所展示的,预测这些缩放断点出现的位置,通常无法借助直觉或简单计算实现。这些缩放断点可能会随其他参数值(如无人机速度或感知距离)而变化。
本文展示了如何利用量纲分析和数据缩放——这些技术在物理学、流体力学及其他复杂系统科学中已十分成熟[6, 2, 12, 34]——来获得将蜂群性能与所有底层参数值关联起来的函数。这些函数在数学上通常很简单,但它们涉及涌现的函数形式(如具有非平凡指数的幂律函数),因此难以或无法猜测。我们还展示了该方法如何自然地回答上述关于扩展与权衡行为的问题,包括缩放断点的位置以及它们如何依赖于其他参数值。这种从局部交互规则到宏观行为的缩放在活性物质与集体运动中十分常见[31, 22, 26, 3]。尽管这些领域的经典模型主要表征自发有序,但在此我们将类似方法应用于对抗性蜂群交战。
尽管展示的技术可用于真实世界数据,但我们使用计算机仿真来生成大型数据集,这些数据集涉及不同算法以及输入参数的广泛变化。我们研究了三种不同场景:其一,红蓝蜂群均试图利用简单蜂群规则相互消灭;其二,智能体蜂群在存在损耗(通过随机故障或某种主动威胁)的情况下搜索区域;其三,蜂群必须访问一定数量的分散目标。我们强调,源自这些仿真的缩放定律是模型本身的数学属性;通过硬件实验验证底层动力学是一个重要但独立的研究问题。
最后请注意,本文部分作者先前的研究曾从优化问题的视角探讨蜂群交战[29, 32, 24, 33, 30]。这些研究假设了动力学和武器的特定模型,并表明可以利用最优控制的直接方法来构建最优轨迹。这通过构建一个性能指标(例如己方无人机的生存概率或达成目标所需的总时间),然后使用标准方法来寻找使该性能指标最大化的最优轨迹。在这些研究中,无人机并未对不断演变的场景做出实时响应,而是按照优化算法确定的预先规划轨迹飞行。我们将优化应用于三个案例研究之一,表明(1)缩放分析仍可应用于分析最优路径的性能,且(2)优化能从总体上改善蜂群的性能。
美国陆军野战手册3-52《空域》为指挥官、参谋人员及空域分队人员提供了实施空域管制与空域管理所必需的战术。本手册以陆军空地系统(AAGS)、战区空地系统(TAGS)的陆军组成部分以及作战流程为背景,按梯队阐述了陆军及其他军种组成部分的空地系统的角色与职责。
野战手册3-52更新了2016年10月20日版本的野战手册3-52,以反映联合出版物3-52、野战手册3-0、陆军技术出版物3-52.1和陆军技术出版物3-52.2的更新发布。本手册体现了美国空军(USAF)人员与现役陆军师司令部的整合,以实现分散式执行,从而在师属空域内提高联合火力及其他活动的响应能力与灵活性。本出版物的核心思想反映了陆军在联合指挥与控制流程中的作用,即在多域作战期间整合空域需求。
陆军部队作为统一行动这一更大规模国家工作的组成部分而行动。陆军指挥官明白,他们并非独立行动,而是作为更大规模的联合部队或多国部队的一部分,在所有域参与联合作战。他们在此更大框架内整合与同步自身行动与作战,并与超出其直接控制范围的实体展开协作。正如指挥官在整个作战区域内管理地形一样,他们持续与统一行动伙伴协作,以整合空域中的空域用户。(有关统一行动的更多信息,请参见JP 3-0。)
陆军空地系统(AAGS)用于协调与整合陆军空域需求。作为战区空地系统(TAGS)的组成部分,陆军空地系统(AAGS)为陆军与战区空地系统(TAGS)内其他实体之间提供接口。陆军部队运用五项陆军空域原则来整合所有空域用户,这些原则是对空域管制基本原则的补充。所有航空器(包括有人驾驶与无人驾驶)、火力及电子战效应均为空域用户。
空域规划侧重于在任务执行期间为空域管制与空域管理创造条件,从而在降低风险的同时为指挥官提供灵活性。空域分队在规划过程中提供空域领域的专业知识。陆军主要依赖程序管制,这需要预先规划的协调措施,以支持必须整合到联合空中任务分配周期中的空域用户。一体化的联合空中任务分配周期为与联合部队的受影响的组成部分共同执行集中式空域规划提供了场所,以生成战区空域管制命令(ACO)。在当前作战期间,空域管制与管理涉及处理必要数据或信息的及时性,以便在不出现重大延误或影响任务完成的情况下做出明智决策。
与规划中一样,空域分队人员在部队从规划向执行过渡时所执行的准备活动中发挥着不可或缺的作用。这在涉及提升态势理解以及就计划达成共享共识方面尤为相关。
空域分队在整个作战流程中协助指挥官识别与协调空域需求。然而,所有作战职能的参与者在规划中均发挥作用,以正确识别特定空域用户的需求,并在执行期间管制空域用户的活动。空域分队持续评估空域程序,以改进关键空域规划文件,从而更好地支持军事行动。
在执行期间,空域管制与空域管理要求空域分队与用户持续监视与评估所有空域用户的行动,这些行动既支持地面作战,也涉及在地面指挥官作战区域上空空域内行动的空域用户。这种持续评估为指挥所(CP)提供了态势理解,并使部队能够适应需要立即使用空域的情况。
本出版物中的四章及其相关的九个附录构成了陆军在联合部队指挥官战区空地系统(TAGS)内使用空域的条令框架。该框架充分利用了详细空域规划的所有特性。它还侧重于在执行期间对所有空域用户进行动态整合。该框架确保用户遵循联合部队指挥官及兵种合成指挥官(从营到战区陆军梯队)的意图、优先事项及风险指导。该框架描述了陆军能力如何代表联合部队指挥官为师级空域管制机构(ACA)扩展空域管制选项,以及所有陆军梯队如何参与空域管理活动。
野战手册3-52包含四章及九个辅助附录:第1章讨论联合作战环境中的空域、战区空地系统(TAGS)框架以及管制方法。它定义了空域管制与空域管理,以及通过任务指挥和作战流程对空域的使用。第2章描述陆军对空域管制与空域管理的方法。该章论述空域管制的行使、实现有效空域管制的规划原则,并按梯队划定了陆军空地系统(AAGS)的关键角色与职责。第3章讨论作战流程规划与准备期间的空域需求,包括规划与准备活动所需的相关文件。第4章概述执行期间所执行的空域活动。附录A讨论与空域作战相关的风险管理,并包含一种风险评估方法。附录B概述协调措施的制定与使用,以及空域协调措施的类型与用途。附录C讨论空域管制系统(ACS)的连接性以及用于通信系统的设备。附录D讨论空域报文、请求及信息显示,包括空域协调措施的系统特性。附录E总体讨论陆军集体任务,然后识别具体的空域分队集体任务。附录F为作战计划的C附件(作战)的附录10(空域)提供大纲。附录G补充了对陆军如何实施对民事当局的国防支援(DSCA)的全面描述,并提供对民事当局的国防支援概述。然后它讨论对民事当局的国防支援期间的空域协调及联合空域管制机构。最后,它论述无人驾驶飞机系统的使用考虑。附录H描述指挥官与参谋在分队空域计划(UAP)中的角色,以整合每日空域需求的收集,从而支持军事行动。附录I讨论无人驾驶飞机及在美国境外国家空域内及跨越竞争连续体的空域中的作战使用考虑。一些空域术语已发生变化。野战手册3-52的读者应注意,防空空域管理不再使用,因为野战手册3-01中已不再使用该术语。野战手册3-01引入了一个新术语,即防空支援分队,该术语在野战手册3-52中使用。同样,野战手册3-04不再使用旅空域分队;现使用空地一体化分队,野战手册3-52亦采用此用法。此外,野战手册3-52引入了两个定义术语,并修改了一个术语。这些术语列于引言表中。
无人机系统(UAS)蜂群构成了一种低成本、高机动性的威胁,传统防空系统极不适合应对。与廉价商用无人机相比,制导动能拦截器成本高昂,可能无法可靠交战小型低可观测目标,且在远征环境中不属于机动部队的组成部分。高能激光(HEL)辅以炮塔式动能武器,为地面机动编队提供了一种经济高效、高容量的替代方案。本论文利用海军研究生学院建模虚拟环境与仿真研究所开发的“蜂群指挥官战术”模型,探索针对无人机系统蜂群的高能激光运用权衡空间。数千次模拟交战评估了部队结构、功率、充电速率、射程、传感以及能量弹药库限制如何影响地基防空(GBAD)性能。能量充电速率成为决定防御结果的主导因素。当充电阈值高于每秒0.94单位时,双高能激光的歼灭概率达到0.98,而单高能激光为0.62。低于该阈值时,高能激光与炮塔式动能武器的组合优于两种仅高能激光配置。最具挑战性的场景是宽间距线式队形,其最大化了方位角覆盖需求,并减少了每个目标的有效驻留时间。这些发现为分层地基防空架构确立了上限,并为高能激光运用指南提供了基础。
摘要:本篇特别评论认为,军事人工智能集成必须从模型可靠性转向人机团队内的“认知适配”,以确保在不确定性下的决策优势。它通过关注动态作战适应与系统韧性,超越了传统的人工智能指标。本研究采用生态认知框架,将约翰·博伊德的进化理论与现代认知科学及风险管理原则相融合。本分析为政策制定者与军事从业者设计保留人类判断并降低风险的指挥结构提供了关键蓝图。
关键词:人工智能(AI),认知适配,决策优势,分布式认知,人机集成,任务式指挥
军队将人工智能(AI)集成到其规划过程中的工作,例如美军下一代指挥与控制(NGC2),通常——且合理地——旨在获得相对于敌人的决策优势。此类系统通过创建先前各自孤立的系统的生态系统,并利用人工智能快速分析数据,从而提供持续、集成的作战图景,原则上,这应能使参谋流程更高效,进而实现更好的决策制定[1]。随着此类系统的演进,它们可能越来越有能力支持决策制定,通过更好的态势感知并利用该态势感知来制定——或至少提出——决策本身[2]。
当前许多军事人工智能方法都聚焦于人工智能系统是否足够可靠以值得信任。当人工智能对物体进行分类、描述当前状况或总结信息时,这种关注相当有效。当人工智能生成计划、预测敌人行为或在不确定性下推荐行动时,其效果则较差。在这些情况下,关键问题不在于人工智能模型本身是否可靠,而在于更大的人机系统能否有效理解并适应不断变化的环境[3]。这种适应是人际系统如何分配认知以及该分配如何与作战环境相适配以实现通过反馈进行表征、推理和适应的函数。因此,理解和管理认知适配对于实现决策优势至关重要。
在此背景下,决策优势不仅仅是比敌人决策更快的函数,也是决策更优的函数。然而,更快与更优通常是相互竞争的因素,需要平衡机器速度与人类控制[4]。更快易于衡量;然而,更优则不然。目前,信任(此过程中至关重要的因素)在很大程度上是根据计算可靠性来理解的——即系统是否经过验证,并证明能在预期使用条件下产生准确、稳健且可重复的结果[5]。这一信任标准对于设计用于识别敌方车辆等用途的分类器模型而言是可行的。虽然操作员在当下可能无法确定机器的识别是否准确,但他们原则上至少可以验证它,如果发现错误,可以重新训练模型以使其更可靠。
对于从事情报分析和军事行动规划的生成式人工智能和大型语言模型系统,挑战则有所不同。例如,在描述诸如瞄准、维护或后勤等领域当前状况的决策支持系统中,信任可以基于数据来源、质量、整理、模型验证、确认、稳健性、校准、跨情境表现以及专家监督等因素[6]。然而,当人工智能输出面向未来时——当系统生成计划、预测或关于敌人意图的评估,其真实性无法预先知晓,甚至事后仍可能存在争议时——这些指标最无帮助。例如,一个失败的计划在特定情况下仍可能是最佳可用方案,而一个成功的计划可能基于虚假关联或不透明的推理。在此,挑战是认知层面的:指挥官如何知道按照面向未来的人工智能模型输出行动是否审慎?
采用这种可靠主义方法的问题有二。首先,正如约翰·泽里利(John Zerilli)等人所指出的,随着人工智能的改进,控制问题可能会恶化。当人类使用人工智能工具时,人类在能力、注意力、时效性和态度方面的局限性会带来风险。因为人工智能系统过快且过于复杂,人类操作员可能无法有效控制它们[7]。此外,如果人工智能赋能的行动将人类互动简化为监控显示器,注意力可能会减弱,增加错误风险。对人工智能的依赖还可能侵蚀人类技能,尤其是认知技能,这些技能可能随时间衰退,并在需要时难以恢复。最后,大量自动化偏差的例子表明,人类经常信任来自通常可靠模型的人工智能输出,即使已知这些模型偶尔会失败[9]。因此,泽里利等人认为,人工智能在最可靠时往往最危险。反直觉的是,更容易发生故障的系统通常更安全,因为它们能促使人类投入更多注意力和监督[10]。这一点暗示了一个悖论:人工智能(AI)集成通过卸载人类认知负担来创造价值,但在此过程中,它也使人类认知能力下降,可能降低系统的整体效能。
最后一点表明,有效的人工智能集成需要从系统视角理解认知,该系统包括人类、人工智能模型以及其他提供“认知脚手架”的工具,即实现认知卸载和负担共享的外部结构。第二个担忧是,可靠主义方法忽视了更大的分布式认知系统,原始数据通过该系
统转化为信息,信息转化为知识,知识转化为理解。在分布式系统(如作战单位)中,认知并非位于个体头脑中,而是分布在人员、工具以及系统运行的环境中[12]。
认知是系统属性而不仅是个体知识之和,这一事实至关重要。人工智能赋能的任务式指挥系统(如NGC2)不仅加速现有的军事决策过程;它们从根本上重新分配了人机网络中的认知。在人工智能赋能的系统中,机器承担了与排序数据、检测异常、关联信号和生成候选解释相关的更大份额的认知劳动。结果,人类在构建环境图景中的作用减弱,转而专注于解释其意义、评估风险和决定如何行动。这种跨越人员、工具、数据和过程的认知负荷转移意味着,设计挑战不仅在于优化模型性能,更在于优化整个人机系统对作战环境的适配。
从适配的角度思考将迫使士兵重新思考如何作战。传统的军事决策方法强调行动而非适应,因为它们旨在将信息导向决策并协调其执行。在此背景下,理解主要作为行动的前提条件发挥作用,参谋寻求建立稳定的图景,将其转化为计划或命令,同步资源并执行决策[13]。层级角色、顺序参谋流程和规范性规则使系统在产生行动方面高效,但在持续修正其感知和构建变化环境的方式上效率较低。这一点并不意味着当前系统无法适应,而是适应以行动为中心,并可能根据先前尝试的成功或失败改变实现目标的方式。相比之下,以适应为中心的系统将着眼于改变其理解环境的心理模型,并可能质疑其最初是否拥有正确的目标。
这种传统的适应模式适用于存在正确答案的情况。正如约翰·凯(John Kay)和默文·金(Mervyn King)所观察到的,此类“谜题”有正确答案,通常可以通过更多数据和更强的处理能力来改进。他们将谜题与“谜团”进行对比,后者没有客观正确的解决方案。在这些情况下,不确定性永远无法消除,因此需要其他指标来评估任何拟议响应的质量[14]。因此,在机器输出即使原则上也无法针对特定目标进行验证的情况下,核心设计问题从人工智能能否快速产生准确输出,转向整个人机分布式系统(包括人员、工具、数据和流程)能否产生足够可信的知识和理解,以支持特定作战环境中的决策优势。
约翰·博伊德(John Boyd)在其文章《毁灭与创造》中,将军事系统的设计问题视为固有的认知问题,尽管他并未使用该词。相反,他类比认为,军队非常类似于生物体,即渴望在资源稀缺的环境中生存和发展的目标导向有机体。在此类环境中,生存与发展取决于通过不断拆除旧心理模型并创建新模型来适应的能力,心理模型是个体理解环境的方式。成功的适应取决于新心理模型是否比旧模型更契合环境。评估这种适配要求有机体具备足够的认知能力,以产生和掌握关于环境的知识。至少对人类而言,这种能力源于一种进化过程,其中心智通过将其内部框架与外部经验反复匹配来适应现实[15]。诸如提出该概念的洛伦佐·马尼亚尼(Lorenzo Magnani)等学者,可能将博伊德的认知论描述为“生态认知”,即知识源于内部认知过程与外部环境因素,并受到人类用于与世界互动的工具或技术的影响[16]。
有趣的是,博伊德以破坏性和创造性的术语描述建立新心理模型的过程,其中演绎逻辑分解旧系统,而归纳综合先前的概念与关于世界的新信息则产生新模型[17]。然而,演绎和归纳逻辑往往是保真且规范性的。它们是保真的,因为它们确立事项的真实性;是规范性的,因为它们规定保证真理的推理过程[18]。在可能无真理可保、因而无描述对象的情况下,人们需要找到另一条通往知识与理解的路径。
这一关切与人工智能赋能系统尤为相关。人工智能生成的世界表征是统计估计或推断,取决于用于训练人工智能模型的数据的质量、覆盖范围、多样性和代表性[19]。博伊德关于组织适应的生态解释表明,焦点应从可靠性转向适配。该框架不问系统是否可靠准确,而是问系统是否足够契合作战环境,以帮助指挥官生成有用的理解并有效适应。在此观点下,决策优势源于整个系统比敌人更快适应的能力,而不仅仅是更快决策。因为成功依赖于迭代假设,一个系统是否契合作战环境取决于三大广泛功能——表征、推理与适应。
表征适配评估系统是否能以准确、可理解的方式检测、组织和呈现相关信息,且不施加过度的认知或作战成本。推理适配评估人机系统是否能生成合理、连贯、情境敏感且能指导行动的解释,而非依赖静态或虚假的关联。输出与适应适配评估这些解释是否支持适当、及时的决策,以及反馈是否能使系统修正其表征、重新考虑备选方案,并在重复的决策周期中改进。因此,适配是迭代评估的:指挥官和参谋在每次周期中评估这些维度,检查它们如何随时间变化,并利用结果识别分布式认知系统的理解、推理或行为何时开始偏离作战环境。在此过程中,他们经常必须进行溯因推理——即推理至最佳解释——其中成功的假设是最合理的假设。与演绎和归纳逻辑不同,溯因推理不保真,因此适用于如上所述的、无真理可保的问题。在此背景下,不确定性并非系统故障,而是对适应的需求信号。
现在应该清楚,“利用数据作战”与更传统的战争方式有多么不同。士兵将不再“发现、锁定和终结”,而是将更多时间用于解释、质疑和适应机器生成的输出。机器最终将处理大部分(如果不是全部)关于敌人位置和相对作战能力的谜题,士兵则不再解决这些谜题,而是专注于对敌人意图和己方行动方案生成假设,同时进一步评估不断变化的作战环境如何影响这些假设的质量。为优化该过程,指挥官和参谋必须管理人机网络中认知的分布方式,决定委派哪些功能、保留哪些判断,以及如何维持反馈循环,使机器输出与任务意图和多变的战场条件保持一致。在此背景下,信任表现为对感官的信任的涌现——通过与环境的持续互动实现足够成功的、目标导向的行为——而非对模型可靠性的被动信心。捕食者不必抓住所有追逐的猎物,只需抓住足够生存的数量。
尽管存在这一变化,生态认知方法在许多方面更为直观,因为它评估人工智能赋能系统的方式与士兵评估作战组织的方式非常相似——不仅通过评估特定组件的功能,还通过评估作战、作战支援和作战勤务支援系统的整体安排是否在其设计环境中发挥作用。指挥官已经知道,有效表现取决于人员、条令和作战职能的互动。此方法将这种理解扩展到人工智能赋能系统。它不将人工智能模型视为参谋军官(关注其判断是否准确),而是问更大的人机系统是否能感知相关条件、使环境可理解,并生成关于环境的假设,以支持与任务意图一致的及时行动。
此方法也更直观,因为它符合士兵在战场不确定性下的推理方式。当前的人工智能方法暗示,信任应取决于数据卫生、验证分数、过往可靠性或与人类经验的一致性等因素。这些标准对于分类敌方车辆等谜题相当有效,但对于预测敌人意图或未来行动方案等谜团则无效。适配的度量并不消除不确定性,而是通过让指挥官知道特定系统对于特定任务、在特定环境、特定时间是否足够好来管理不确定性。在某种程度上,此模型将不确定性视为资产——当被正确感知时,它激发更有效的适应。
最后,此方法将适应视为常态,而非失败的证据。“计划经不起与敌人接触”这一常用来解释缺陷的表述,反映了士兵已知的事实。即使计划基于完美信息和原则的无瑕应用,与敌人的首次接触也会改变环境,从而改变计划所基于的信息。此方法更好地解释了系统中人类一侧已经在发生的事情——持续的感知、判断、行动、评估和重构——而不是将使用人工智能赋能系统所需的技术知识构建为替代人类参谋的技术复杂方案。
人工智能赋能任务式指挥的成功,与其说取决于计算速度,不如说取决于系统设计能否保留人类判断、使不确定性可见、维持反馈循环,并保持人类用户与机器输出之间的认知共鸣。简而言之,战争的未来在于构建能够利用数据进行学习、适应和有效作战的人机认知生态,而非用机器取代指挥官。
本文记述无人机系统(UAS)的历史发展,以及其自1910年代萌芽与初期试验、第二次世界大战期间军事应用、冷战时期侦察能力,直至现代亦即“9·11”事件后时代的演进过程[1]。文中进一步深入探讨现代时期大量运用无人驾驶飞机系统的两场主要冲突。将就上述冲突及投入作战的无人驾驶飞机系统平台提供背景说明。首场讨论为“9·11”袭击后随即展开的“反恐战争”,其间使用了携载武器的无人驾驶飞机系统以及先进成像技术[2];该冲突的特征是对非国家行为体实施精确打击[3]。第二场讨论自2022年爆发的俄罗斯—乌克兰战争;与之不同,该战争为主权国家间的全面作战,截至2026年仍在持续[4][5]。受财力限制,该冲突所用无人驾驶飞机系统多为较小型平台。两场冲突均证明,无人驾驶飞机系统可提升战场态势感知与侦察能力,重塑现代战争形态[5]。此外,无人驾驶飞机系统在战争中的广泛使用,亦引发有关目标选择及国际人道法下责任归属的伦理关切[3]。
本文首先考察无人机系统技术之历史发展,继而分析“反恐战争”与俄罗斯—乌克兰战争两场冲突,以阐明其作战与伦理影响。无人驾驶飞机系统之研发与部署,凭借强化战术侦察与载荷投送方式而深刻变革现代战争,同时也因操作者脱离战场而引发重大伦理关切。
随着战斗机日益复杂,并引入自主性等技术,必须预见飞行员使用这些新系统完成任务所需的关键任务和信息。战斗机飞行员在要求极高的情境中操作,失败的后果很严重,要求其系统为任务提供正确的信息。传统上,这些设计通过现有系统的关键任务分析来指导。本研究产生了一种使用基于模型的系统工程对关键任务分析和信息需求进行建模的方法。场景为一架战斗机在视距内一对一交战中进行基础战斗机机动。该分析利用现有任务分析报告中的数据完成。使用层级和关键任务分析方法,以识别和建模任务不同阶段中飞行员任务的序列。本研究提出一种系统建模语言扩展和方法,用于对飞行员任务序列进行建模,并量化每项任务的关键性。为辅助用户界面设计人员,完成每项任务所需的信息也包含在模型中,并附有识别信息优先级的方法。创建了多种工具来展示这些信息,以增强利益相关者的理解。未来研究可基于这些方法的仿真,对飞行员工作量、动态信息需求和其他设计相关信息等若干变量进行基于时间的分析。
这篇 CMU 机器学习系博士论文《AI Methods for Science: Neural Modeling and Language Model Agents》来自 Shanda Li,完成于 2026 年 7 月。论文的核心问题非常清晰:AI for Science 不只是把一个深度模型套到科学数据上,也不只是让大模型写几段代码;真正有价值的科学智能系统,需要同时理解科学对象的结构、数值计算的约束、实验预算的限制,以及科研流程本身的反馈机制。 作者将整篇论文组织为两条互补路线。第一条路线是“科学神经建模”:围绕长上下文 Transformer、相对位置编码、傅里叶神经算子、分子生成流等问题,设计更适合科学数据和科学规律的神经模型。第二条路线是“语言模型智能体”:围绕推理计算分配、偏微分方程求解器生成、扩展律实验设计、科研代码仓库复现审计等任务,研究大语言模型如何进入真实科研工作流。 这篇论文的价值不在于提出单一模型,而在于给出了一条较完整的 AI for Science 技术路径:底层模型需要能表示函数、序列、物理场和分子结构;上层智能体需要能做推理、写程序、调用反馈、规划实验并审计结果。换句话说,AI for Science 的下一阶段,很可能不是“一个更大的模型解决一切”,而是由科学建模模块、推理模块、代码执行模块和实验反馈模块组成的复合系统。
论文开篇指出,现代科学研究正在面对一种双重压力:一方面,科学数据的规模和复杂度不断提高,从长序列、生物分子、物理场到科研代码仓库,都包含高维、非欧式、跨模态和强约束结构;另一方面,科研流程本身也越来越依赖计算,包括模拟、推理、实验设计、代码复现和结果审计。 传统机器学习方法通常将科学任务视为普通预测问题:给定输入,输出标签或数值。但在许多科学场景中,真正困难的部分并不是拟合一个函数,而是如何尊重科学对象的结构。例如,长上下文建模需要跨越远距离依赖;偏微分方程求解需要考虑数值稳定性和边界条件;分子设计需要同时满足结构、属性和生成可行性;科研复现则需要理解代码、环境、数据依赖与报错反馈之间的关系。 作者因此把 AI for Science 拆成两个层级。第一个层级是神经建模方法,关注如何让模型更好地编码科学数据中的结构。第二个层级是语言模型智能体,关注如何让模型参与科学工作流,完成推理、编程、实验选择和复现审计等更开放的任务。这两个层级并不是割裂的:前者解决“表示什么、如何表示”,后者解决“如何在动态环境中使用这些表示完成科学问题”。
论文的主线可以概括为三个关键词:结构、计算和反馈。 “结构”指科学问题中的先验形式,例如相对位置、频域表示、算子映射、分子流形和代码仓库依赖关系。好的 AI for Science 模型不能只依赖数据量,还需要把这些结构纳入模型设计。 “计算”指训练和推理预算。论文多次强调,科学智能系统往往受到显著的算力、实验成本和数据采样成本约束,因此需要研究长度外推、超参数迁移、推理计算分配和主动实验选择。 “反馈”则是第二部分的关键。语言模型智能体不能停留在一次性生成文本,而要接收数值误差、执行结果、实验观测和 GitHub issue 等外部反馈,在循环中改进解决方案。
第一部分聚焦神经网络本身的建模能力。作者选择了四类具有代表性的科学与序列建模问题:长上下文语言模型、线性相对位置编码、傅里叶神经算子和多模态分子生成。这些问题看似分散,但共同指向一个核心目标:让模型在有限训练条件下获得更强的结构泛化能力。 在科学应用中,模型常常需要面对训练分布之外的输入长度、分辨率、物理参数或目标条件。如果模型只能在训练设置附近工作,科学价值会明显受限。因此,这一部分特别强调外推、迁移和免训练适配。
长上下文建模是大模型和科学序列建模中的共同瓶颈。Transformer 的注意力机制虽然可以显式连接任意位置,但位置编码往往决定了模型能否在训练长度之外稳定外推。很多常见相对位置方法在训练窗口内表现良好,一旦上下文变长,就会出现位置分布偏移、注意力退化或困惑度上升。 本章提出 FIRE,即 Functional Interpolation for Relative Positions。其关键思想是把相对位置偏置从离散表格或固定函数,转化为可插值的连续函数表示。这样,模型在训练时学习到的相对位置结构,可以通过函数插值方式推广到更长上下文,而不是简单依赖未见过的位置索引。
FIRE 的设计关注两个层面。第一,它让相对位置偏置具备连续可推广性,使模型在更长上下文中仍能获得有意义的位置关系。第二,它避免为每个距离单独学习不可外推的参数,从而提升长度泛化和参数效率。 这种方法对于科学文本、代码、时间序列和长文档建模都有直接意义。很多科学任务的有效证据并不集中在局部窗口内,而是分散在长篇论文、实验记录、日志、轨迹或历史观测中。位置编码如果不能外推,长上下文模型就会在工程上“看得见”,但在表示上“用不好”。
第三章继续研究位置编码,但重点从长上下文外推转向相对位置编码的频域解释。许多线性相对位置编码在实践中有效,却缺少统一理解:它们为什么能表示相对距离?它们如何影响注意力谱结构?是否可以学习一种更适合任务的变换,而不是固定使用人工设计的形式? 作者提出 FLT,即 Learning a Fourier Transform for Linear Relative Positional Encodings。该方法把相对位置编码与傅里叶变换联系起来,尝试学习一种任务适配的频域映射,使 Transformer 能更灵活地表示相对位置信息。
本章的重要贡献在于把位置编码问题从“选哪种偏置形式”提升到“学习哪种函数空间表示”。傅里叶视角天然适合处理周期性、平滑性和多尺度结构,这些结构在科学数据中非常常见,例如波动、振荡、时间序列、空间场和频域信号。 从系统角度看,FLT 与 FIRE 构成互补:FIRE 强调在长度维度上的函数插值和外推;FLT 强调用可学习频域变换增强线性相对位置编码的表达能力。二者都服务于同一个目标,即让 Transformer 不只是记住训练位置,而是学习可迁移的位置关系。
傅里叶神经算子是科学机器学习中的重要模型,常用于学习函数到函数的映射,例如从初始条件到未来物理场,从边界条件到解函数。与普通神经网络不同,神经算子面对的是连续函数空间,因此它们对分辨率、网格大小、频域截断和训练超参数非常敏感。 本章关注一个非常实际的问题:在不同模型规模、不同分辨率或不同任务设置之间,能否实现超参数的零样本迁移?如果每次训练傅里叶神经算子都需要重新搜索学习率、初始化尺度和优化设置,那么科学建模的成本会显著提高。 作者将最大更新参数化思想引入傅里叶神经算子,提出 µTransfer-FNO。其目标是让小规模模型上调好的超参数,可以直接迁移到更大规模或更高分辨率的模型上,而不需要重新进行昂贵搜索。
从图示结果可以看到,标准参数化下不同学习率的训练稳定性差异明显,而 µTransfer-FNO 试图让训练动态在尺度变化时保持一致。这对科学计算尤其重要,因为真实模拟任务往往需要在低分辨率上快速试验,再迁移到高分辨率或更复杂条件下运行。 这章的贡献不只是一个训练技巧,更体现出 AI for Science 中“计算预算敏感”的核心逻辑:如果模型方法不能降低调参和重训成本,就很难进入实际科学工作流。
第五章转向分子设计。分子生成是 AI for Science 中最具代表性的应用之一,因为它同时涉及离散结构、连续几何、多目标属性和可合成性约束。很多生成模型可以产生分子样本,但当研究者希望按照特定属性或多模态条件引导生成时,通常需要额外训练、微调或设计复杂奖励函数。 TFG-Flow 的目标是实现免训练引导:在不重新训练生成模型的情况下,通过引导机制把模型推向更符合目标条件的区域。这样可以降低分子设计中的适配成本,并使已有生成流模型更容易被用于不同属性目标。
该方法可以理解为在生成流过程中加入外部目标信息,使采样轨迹朝着期望属性移动。与重新训练模型相比,免训练引导更适合快速探索,因为科研人员可以在不同目标之间切换,而不必为每个目标重新构建训练管线。 对于药物发现和材料设计,这种思想尤其有价值。真实应用通常不是追求单一指标,而是同时考虑活性、稳定性、毒性、结构多样性和合成约束。多模态生成流如果能在保持生成质量的同时接受灵活引导,就更接近实用的科学设计工具。
第二部分从“模型如何表示科学对象”转向“模型如何参与科学流程”。这也是整篇论文最具时代感的部分:大语言模型已经不只是文本生成器,而是可以读题、写代码、运行程序、解释错误、选择实验、审计仓库的工作流组件。 作者没有把语言模型智能体描述成全自动科学家,而是更谨慎地研究其可测量能力边界:推理时多花多少计算是值得的?模型生成的 PDE 求解器如何用数值误差反馈改进?有限实验预算下如何拟合扩展律?真实 GitHub issue 能否成为可复现性审计的监督信号?这些问题都比“让模型做科研”更具体,也更接近落地。
第六章研究推理阶段的扩展律。传统扩展律多关注训练阶段:模型更大、数据更多、训练计算更多时,性能如何变化。但对语言模型智能体来说,推理阶段同样消耗大量计算。一次任务可以采样多个答案、执行多轮自洽、进行搜索或调用验证器,因此“推理时该花多少计算”成为关键问题。 作者通过经验分析研究计算最优推理策略,考察不同推理预算下问题求解性能的变化。其核心问题是:在给定模型和任务下,继续增加推理样本或推理步骤是否仍然值得?什么时候应当换更强模型,什么时候应当让现有模型多思考?
科学任务通常具有高成本验证过程,例如数值模拟、定理检查、实验设计和代码运行。推理扩展律可以帮助系统决定如何分配计算:是生成更多候选方案,还是把预算用于更强的模型、更长的上下文或更精细的执行反馈。 这章为后续章节提供了方法论基础。CodePDE、SL² 和 ReproRepo 都不是单次问答任务,而是需要多步推理、执行和评估的工作流。理解推理计算的边际收益,是构建可靠语言模型智能体的前提。
第七章提出 CodePDE,用于让语言模型生成偏微分方程求解器。PDE 求解是科学计算的核心任务之一,但它对数学形式、离散化方案、边界条件、稳定性和误差控制都有严格要求。让语言模型直接给出答案并不可靠,更合理的方式是让模型生成可执行求解器,再通过数值反馈不断修正。 CodePDE 将问题形式化为一个推理框架:语言模型读取 PDE 问题描述,生成求解代码,执行后获得误差或失败信息,再基于反馈修改方案。这里的关键不只是代码生成,而是把执行环境和误差信号纳入推理闭环。
这一章体现了语言模型智能体与普通文本模型的区别。普通模型的输出一旦生成就结束,而智能体可以通过外部工具检验自己的输出。对 PDE 来说,这种检验非常必要,因为看似合理的解析说明或代码片段,可能在网格、边界或时间步长上完全错误。 CodePDE 的意义在于把科学计算问题转化为“可执行、可评估、可迭代”的任务。它也说明,未来科学智能系统的可靠性很大程度上来自外部反馈机制,而不是单纯依赖语言模型的内部知识。
第八章研究扩展律拟合中的实验预算问题。扩展律对机器学习系统设计非常重要,可以帮助研究者预测更大模型、更长训练或更多数据下的性能。但拟合扩展律本身需要大量实验点,而每个实验点都可能意味着训练一个模型或运行一组昂贵实验。 作者提出 SL²,通过主动实验选择在有限预算下更高效地拟合扩展律。核心思想是,系统不应平均地、被动地采样实验配置,而应根据已有观测选择最有信息量的下一组实验,从而用更少成本获得更可靠的趋势估计。
这章把 AI for Science 中常见的“实验设计”思想带入模型扩展研究。很多研究者关心最终的大规模结果,但真正可用的预算往往只允许做少量小规模实验。主动选择机制可以决定哪些模型规模、数据规模或训练预算最值得尝试。 与第六章的推理扩展律相比,第八章关注训练或实验层面的扩展律拟合;二者共同构成一套预算意识:推理计算要优化,训练实验也要优化。科学智能系统如果能主动规划实验,就能从被动执行工具变成更接近研究助理的系统。
第九章讨论科研复现,这是整篇论文中最贴近现实科研痛点的部分。大量机器学习论文公开了代码仓库,但复现仍然困难:依赖版本不一致、数据下载失效、训练脚本缺少说明、硬件假设不清、报错信息无人处理。传统复现审计依赖人工阅读和运行,规模很难扩大。 ReproRepo 试图利用 GitHub repository issues 扩展可复现性审计。其基本判断是:真实用户在仓库中提交的问题,往往包含了复现失败、环境配置、缺失文件、结果不一致等信号。语言模型可以读取这些 issue,并推断仓库的复现风险和问题类型。
该框架把开放源代码生态中的自然反馈转化为可分析数据。相比仅阅读 README 或论文,issue 反映的是代码在真实用户环境中的运行状况,因此更接近可复现性的实际难点。 这一路线也提示我们,科学智能体不一定要从零做实验。它可以先利用已有社区反馈,帮助研究者发现哪些仓库可复现性较弱、哪些错误最常见、哪些项目需要补充依赖说明或脚本修复。对大规模论文与代码审计而言,这是一种很实用的切入点。
论文还比较了不同模型在 ReproRepo 任务上的表现。结果表明,复现审计不是简单分类任务,它需要模型理解科研代码语境、错误描述、用户反馈和仓库维护状态。模型越强,通常越能处理跨文件、跨语境和含糊问题,但仍然需要结构化任务定义和可靠评测。 这一章与前面的 CodePDE 形成呼应:CodePDE 关注模型如何写出可运行科学代码,ReproRepo 关注模型如何审计已有科研代码能否复现。一个面向科学的语言模型智能体,最终应当同时具备生成、执行、调试和审计能力。
论文最后总结了 AI for Science 的两条发展线索。第一,科学神经建模需要更深地吸收科学对象的结构,包括位置、频域、算子、分子空间和物理约束。第二,语言模型智能体需要从文本生成走向科研工作流参与者,通过推理计算、代码执行、实验选择和社区反馈来提升可靠性。 从这篇博士论文可以看到,AI for Science 正在从“模型驱动的预测工具”转向“工作流驱动的科学系统”。前者强调单点性能,后者强调模型、工具、反馈和预算之间的协同。未来真正可用的科学智能系统,很可能由多个层次组成:底层模型负责表达科学结构,中层算法负责优化训练和推理计算,上层智能体负责规划、执行、验证和审计。
第一,科学任务中的结构先验仍然重要。即使在大模型时代,位置编码、频域表示、算子参数化和生成流引导等设计,依然决定模型能否跨长度、跨尺度、跨条件泛化。 第二,科学智能系统必须考虑预算。无论是长上下文推理、傅里叶神经算子的超参迁移,还是扩展律拟合中的主动实验选择,本质上都在回答同一个问题:如何用有限计算获得最大科学收益。 第三,反馈闭环是语言模型进入科研的关键。PDE 求解、代码复现和实验规划都表明,可靠性不能只靠一次性生成,而要靠执行、观测、纠错和再规划。 第四,AI for Science 的未来不是单一模型范式的胜利,而是神经建模、语言模型智能体、数值计算和科研软件工程之间的系统整合。这也是这篇论文最值得关注的地方:它把底层模型方法和上层科研流程放在同一幅图景中,呈现出一条从表示学习到科学智能体的连续路径。
当代无人机战争显示了小型平台的战术价值,但数量本身并不能构成蜂群。基于贝茨和奎克的“无人机尚未形成蜂群——但它们可以”,本文测试了自组织——这一在自然界中观察到并在蜂群机器人技术中形式化的原理,其集体行为源于局部感知、通信和分散规则。它探究异构无人机能否在通信中断、损耗、情报不完善和防空压力下,搜索、确认并打击高优先级目标,同时保持对分析人员的可理解性。在三维仿真环境“蜂群指挥官战术”(SCT)中,五个自组织层实现了通信、编队形成、任务分配、信念维护和协调压制与打击。该战役评估了18种条件,每种条件重复5次。所有90次运行均完成了任务,并生成了事件、消息和快照日志。最强主动干扰条件以6.8%的链路传输率完成,表明在没有全球连通性的情况下任务成功。较大的初始情报误差仍得到纠正,但迫使在防空系统附近采取更多路线安全反应。本工作开发的透明度评分标准对247个决策事件的评分为8分中的6.77分。本文贡献了一个可执行的概念证明,表明自组织军事蜂群行为可以在作战使用前实施、压力测试和重建。
本文的其余部分组织如下。第2章考察自组织的理论基础、蜂群工程原理、协调的架构方法,以及部分可观测性、通信拒止、透明度和验证所面临的挑战。本章最后指出了为系统设计提供依据的六个研究空白。第3章介绍了实现分散式协调的五个自组织层(SO-0至SO-4),以及透明度日志架构和实战化评估指标。第4章描述了“蜂群指挥官战术”仿真平台、用于评估的实战化场景要素、一次一因子实验设计,以及混合方法分析方法论。第5章呈现实验结果,通过分析基线行为、单因素压力响应以及针对每个研究问题的最终混合压力条件,并借助支持的量化指标、透明度评分标准打分和选定决策链的重建。第6章综合研究结果,重述贡献,承认局限性,并关联未来研究的思路。
摘要
现代军事行动要求指挥员在管理多样化战场信息流的同时,就有效分配多支友军部队以应对敌方威胁作出复杂的战术决策。本研究提出一种用于地面作战的智能反制力量分配(ICAGO)方法,该方法利用多智能体强化学习(MARL)来支持地面战争中的指挥层级决策。ICAGO专为旅级及以上部队优化而设计,能够在防御、进攻及攻防同时进行等作战样式中实现有效的反制力量部署。该方法将关键战术行动(如按接近路分配机动部队及炮兵目标分配)建模为MARL智能体的动作,并将基于条令的战术要素嵌入奖励函数。MARL智能体采用Soft Actor-Critic算法实现,并通过图注意力网络进行扩展,以管理超过40个异构智能体(步兵、坦克及炮兵)。与基于规则的方法相比,ICAGO表现出更低的性能方差,并在基于条令的指标上取得显著提升,包括在不确定性和多样化作战场景下,胜率提高30%,对关键友军区域的保护能力增强。这些结果凸显了MARL在人力资源受限条件下增强大规模智能兵力分配的潜力。
现代武器系统的日益多样化与复杂化,加之来自各种探测与情报资产的战场信息呈指数级增长,要求指挥员及参谋人员具备更广泛的专长与决策能力[1]–[3]。例如,在韩国战斗训练中心(KCTC)进行的旅级地面作战演习会产生海量数据——从目标位置、状态更新到交战记录——每次演习通过数亿条语音、视频和信号传输捕获,同时有数千名人员和装备在运作[4]、[5]。鉴于这种规模,数量有限的资深指挥员和参谋人员要实时处理和分析所有可用数据正变得愈发不可行。因此,指挥决策往往基于浓缩或经过筛选的信息在概念层面作出[6]、[7]。在现代战争快速演变且信息密集的环境中,对智能指挥决策支持技术的需求日益增长,这些技术能使少数指挥员和参谋人员快速分析大量数据并作出及时、准确的决策[3]、[8]、[9]。为应对多维一体化战场的复杂性,各国军队正越来越多地将人工智能(AI)和虚拟现实等先进技术整合到其指挥支持系统中[3]、[10]。
传统上,基于智能体的建模(ABM)已被广泛用于军事决策与指挥决策支持[3]、[11]。在ABM中,智能体被定义为具有独特属性和行为的自主实体,它们与环境和其它智能体交互。ABM旨在通过单独建模自主战场实体的行为特征,更准确地模拟战斗的复杂动态本质。为实现作战目标,诸如部队、士兵或武器系统之类的智能体以一定程度的独立性运作,执行寻路、探测和基于规则的接战等任务。这些智能体对外部环境(包括地形特征和敌方行动)作出随机响应,从而能够模拟出逼真的大规模战斗场景。这种复杂性难以用传统的线性建模方法捕捉,后者通常假定清晰的因果关系并依赖简化的输入—输出映射[11]、[12]。尽管ABM在模拟战斗复杂性方面已被证明有效,但其本质上缺乏智能决策能力。为解读战场态势并预判未来发展,ABM可与具备学习、适应和预测能力的高级人工智能(AI)技术相集成。随着ABM规模扩大且复杂性增加,手动定义交互规则变得不切实际,且必须修改更多参数以拟合经验数据。然而,集成AI可为智能体提供隐式学习规则的框架,并减少校准过程中常涉及的手动操作和主观偏见。
本研究提出将多智能体强化学习(MARL)算法与通过ABM建模的作战环境相集成,以实现智能指挥决策支持。诸如军事单位或武器系统等智能体在模拟作战环境中运作,并根据其当前状态感知采取行动。在此背景下,行动不仅限于移动、探测或射击等基本任务,还包括更高层次的战术行为,例如将部队分配到特定的敌方接近路,或指挥下属单位自主机动和攻击目标,这些均与传统智能体建模原则一致。在训练过程中,智能体从环境中接收奖励——可以是个体或集体的、正向或负向的——取决于其行动的结果。强化学习算法使智能体能够学习最大化长期累积奖励的最优行动策略。在军事背景下,这些奖励可以根据战术目标来定义,例如智能体生存、友军成功完成任务或对敌方部队造成的伤害。若有来自真实作战场景的充足作战和指挥决策数据,强化学习算法可以训练智能体在每个时间步作出符合情境的最优决策。然而,为军事作战规划和指挥决策支持实施AI,需要访问反映指挥员决策过程及关联结果(包括友军和敌军损失)的丰富数据集。此类涵盖战场条件、决策理由和交战结果的数据获取成本极高,且大量收集它们面临着重大的实际挑战[13]–[15]。
由于真实战场和指挥决策数据成本高昂且可用性有限,先前的研究依赖模拟作战环境(通常由基于策略的模拟游戏或定制兵棋模拟器生成)来训练用于指挥决策支持的AI模型[16]–[20]。值得注意的是,MARL已在模拟作战环境中展示了建模和执行军事条令的潜力。例如,Basak等人[16]探索了将条令约束集成到MARL框架中,使自主智能体能够在适应动态作战场景的同时,与既定战略指南保持一致。这种混合方法增强了AI驱动决策的真实感,并确保学习到的行为符合实际军事条令。Kim等人[17]通过《星际争霸》多智能体探索挑战,深入探讨了训练AI智能体学习复杂、多阶段军事行动所面临的挑战。他们的研究强调了AI系统必须在环境不确定性下运作,并在不依赖精心设计的奖励函数的情况下作出多步决策的必要性。此类能力的发展对于推进能够执行战术行为(例如在不可预测和动态的作战场景中,在有利条件下——包括高地或隐蔽地形——率先探测敌方部队或接战)的AI模型至关重要。最近,Dimitriu等人[18]证明,基于强化学习的方法可在高度逼真的模拟(如《指挥:现代作战》(CMO)所提供的模拟,该模拟对历史和现代战争环境进行建模)中为作战规划和战略决策提供有价值的见解。为解决CMO中的独特挑战,他们开发了一种近端策略优化(PPO)强化学习智能体,成功学习了监视、敌我识别、战斗和区域扫荡等任务的接战策略。在此工作基础上,Choi等人[19]探索了利用强化学习实现地面部队作战兵棋模型的自动化。他们的研究表明,基于强化学习的计算机生成兵力(CGF)能够自动适应战术变化,优于依赖既定条令的传统基于规则的CGF。这一进展有潜力提高包括作战、无人机侦察和弹药补给任务在内的各种军事行动的准确性和效率。除这些贡献外,Li等人[20]引入了一种基于深度确定性策略梯度(DDPG)的智能算法来解决最优武器—目标分配问题。该方法优化了军事资产的部署,能够高效打击敌方部队并提高决策效率。先前的研究已在小规模军事行动模拟中比较了各种强化学习算法,这些模拟通常设置在受限环境中,如游戏或网格地图[21]–[23]。这些模拟通常涉及与静态敌人的交战或集结、避障和侦察等基本任务。这些研究已证明强化学习优于传统的专家或基于规则的指挥决策系统。然而,将这些发现应用于更大规模的作战(如旅级及以上)时,会面临与计算资源需求、模型可靠性和可扩展性假设相关的挑战。因此,为积累更真实的战场交战数据并增强基于智能体的指挥决策支持,本研究开发了一个将强化学习框架与真实战场数据相结合的虚拟战场模拟环境。我们提出了一种在反制力量分析中优化作战力量分配以支持指挥决策的方法。作战力量分配涉及众多变量,包括部队类型、能力、位置、敌方实力、地形和任务目标。强化学习擅长处理高维状态和动作空间,使其能够管理战场场景固有的复杂性。
战场环境的构建基于真实地形,用于优化友军部队和战略接近路的分配,同时融入了传统兵棋模型的模拟逻辑。与先前侧重于在CGF层面优化单个友军行动[19]、[22]或为策略模拟游戏开发强化学习智能体[24]–[26]的研究不同,本研究的目标是为更大规模作战场景中的友军部队分配和决策优化提供方法。利用强化学习进行作战力量分配优化的研究不仅仅是渐进式改进;它代表着向更智能、更具适应性和更有效的地面作战的根本性转变。通过利用强化学习,我们可以超越静态规划和人类认知偏见的局限,实现增强任务成功、最小化伤亡并确保宝贵军事资源最优利用的实时、数据驱动决策。
本研究的目标是优化友军部队的分配以与特定敌军部队交战——这是一种将战术目标融合为更高层级行动的方法——同时通过基于既定战术条令的规则模拟逻辑实现较低层级的部队行动,如机动、探测和射击。这种方法缓解了AI生成的部队行动可能与传统军事条令相冲突的问题。此外,我们应对了将AI技术(如强化学习)应用于大规模部队(旅级及以上)的挑战,其中计算和学习时间随智能体、状态和动作数量呈指数增长。本文介绍了一种可扩展的MARL方法,旨在最大化AI集成到真实世界指挥与控制系统的效率,并通过实验结果证明其有效性。
将智能体人工智能(AI)集成到海军指挥与控制(C2)系统中是保持决策优势的战略必然要求。然而,一个“最后一英里”差距持续存在:由于操作员信任不足和体制错位,先进人工智能工具未得到充分利用。本论文审视了影响美国海军采用智能体人工智能的人因与组织因素。本研究采用汇聚混合方法设计,使用自动系统信任量表调查了海军研究生院的现役军人,并进行了专家访谈。该研究评估了一个概念性决策支持系统“NavAI”,涵盖六个信任维度:能力、诚信、透明度、无偏性、警觉性和总体信任。主要研究结果表明,信任是系统采用的主要预测变量。回归分析显示,总体信任是感知作战有效性的唯一统计显著预测因子,其重要性超过服役年限或直接指挥与控制经验。此外,数据揭示了一个经验悖论。与预期相反,先前对人工智能的熟悉并不必然培养信任;相反,经验丰富的操作员表现出更强的审视,并给出了较低的总体信任分数。