将智能体人工智能(AI)集成到海军指挥与控制(C2)系统中是保持决策优势的战略必然要求。然而,一个“最后一英里”差距持续存在:由于操作员信任不足和体制错位,先进人工智能工具未得到充分利用。本论文审视了影响美国海军采用智能体人工智能的人因与组织因素。本研究采用汇聚混合方法设计,使用自动系统信任量表调查了海军研究生院的现役军人,并进行了专家访谈。该研究评估了一个概念性决策支持系统“NavAI”,涵盖六个信任维度:能力、诚信、透明度、无偏性、警觉性和总体信任。主要研究结果表明,信任是系统采用的主要预测变量。回归分析显示,总体信任是感知作战有效性的唯一统计显著预测因子,其重要性超过服役年限或直接指挥与控制经验。此外,数据揭示了一个经验悖论。与预期相反,先前对人工智能的熟悉并不必然培养信任;相反,经验丰富的操作员表现出更强的审视,并给出了较低的总体信任分数。
无人机系统(UAS)的扩散正在改变战争形态,并在国内外制造新挑战。无人机日益具备更强能力、更易获取且适应性更强,使国家与非国家行为体得以开展监视、扰乱行动并发动致命打击。威胁正迅速演变,防御必须同步进化。
美国联合反无人机特遣部队(JIATF)401的任务是统筹美国防部反无人机系统(C-UAS)工作,加速交付有效能力以保护人员与本土安全。完成该任务不仅需要提供技术,更需要联结更广泛的反无人机系统社群,分享有效做法,识别能力缺口,并确保经验教训、现有能力与有前景的解决方案能迅速送达需求者手中。应对反无人机系统挑战没有“银弹”。有效防御需要分层方法,整合传感器、指挥控制、动能与非动能手段,同样重要的是,还需有效运用这些手段所需的训练、战术、权限与政策。保持对威胁的领先优势,亦要求作战人员、执法与安全任务伙伴理解可用能力,并从最新作战经验中学习。
本快速参考指南旨在助力实现这一目标。它为更广泛的反无人机系统行动社群提供了一份关于当前能力、新兴技术以及不断演进的战术、技术与程序的通用参考。它并非条令或详细技术指南的替代品,而是一种实用工具,帮助领导者与操作人员更好地理解反无人机系统全景,识别适合其任务的解决方案,并应用来自联合部队及跨机构伙伴的经验教训。无人机威胁将持续变化。我们必须保持同等适应性:以作战经验为指引,跨组织联结,并聚焦于迅速将有效解决方案交到防御者手中。
经过数十年的发展,人工智能(AI)技术已到达一个临界点。它们正广泛扩散,并不断发掘新的军事与情报应用。随着基于日益庞大的数据集构建的更强大模型变得无处不在,各国军队正竞相部署人工智能。但这并非正确的竞赛方向。它们应当竞相争取的是分析优势。所谓分析优势,是指通过收集和处理数据、构建强大的分析模型,并将这些模型部署到军事系统中,从而获得作战与信息优势,同时削弱或剥夺对手实现同样目标的能力[1]。军事系统既包括信息系统,也包括物理系统。分析是指通过计算方法对数据进行系统性分析,以产生可供广泛应用的模型,其用途涵盖从提升物理系统性能以取得作战优势,到提升信息系统性能以取得决策优势。数据的规模、速度和多样性,加之日益强大的模型,已使分析优势成为作战优势与信息优势的关键要素。
正如净评估办公室(Net Assessment)主任安德鲁·马歇尔在20世纪90年代中期所论证的那样,争夺军事优势的竞争历来是一项智力与技术并重的努力。马歇尔曾预言,“信息优势”将占据作战艺术的重心,因为连通性对于精确打击至关重要。军事战略如今必须拥抱分析优势。
为协助作战人员应对这一挑战,阐述了分析在战争中持久的重要性,并提供了一条实现分析优势的路径图。
美国陆军工程研究与开发中心系统工程研究所2021财年的工作利用深度强化学习开发了智能系统(红方智能体),能够在军事行动方案兵棋推演海上框架基础设施中展现出可信行为。基于2021财年的研究,本项研究致力于探索改进兵棋推演框架基础设施的方案,并调查改善人工智能(AI)智能体行为的机会。兵棋推演框架基础设施的增强包括与支持智能体训练、利用高性能计算资源以及开发支持人工智能对人工智能智能体训练与游戏对抗的基础设施相关的更新。在评估了不同算法选项的智能体训练后,与采用优势行动者-评论者(A2C)或近端策略优化(PPO)算法训练的智能体相比,采用深度Q网络(DQN)训练的智能体表现更优。在不同场景中的实验表明,在原始基线场景中训练的智能体表现出了可接受的性能。通过针对先前训练的红方智能体训练蓝方智能体,研究人员成功展示了人工智能对人工智能的训练与游戏对抗能力。观察智能体游戏对抗的结果揭示了体现两条战争原则的行为的出现,即节约兵力与集中兵力。
无人机攻击对军队、设施和装备构成重大威胁。蜂群攻击放大了这一威胁,而当前防御基础设施无法完全应对来自协同无人机蜂群的攻击。协调当前反无人飞机系统(C-UAS)的集中式方法存在中心计算中枢发生故障的风险,这将导致整个防御网络失效。本论文研究如何协调分散式无人机蜂群以拦截攻击性无人机蜂群。该方法填补了传统反无人飞机系统(C-UAS)在处理无人机蜂群时所呈现的能力缺口。我们采用耦合自适应预解分裂算法(CARA)在独立无人机之间建立共识,仅需要基于共享目标的最小化无人机间通信。我们在3456种参数配置上对耦合自适应预解分裂算法进行评估,实现了74%的总体收敛率。通过最后迭代舍入,该结果提升至83%的拦截率;通过调整参数,对于规模不超过25的蜂群实现了100%的收敛率。在作战相关蜂群规模(不超过15)下,耦合自适应预解分裂算法在96%的运行中收敛到有效分配,证明该算法能够成功执行与防御攻击性无人机蜂群相关的分布式优化目标分配。
第二章概述了当前对抗敌方无人机的方法,以及所提出的方法如何融入这一框架。在这一特定领域内,还考量了当前用于控制无人机蜂群的其他技术,以及方法如何最适合防御场景。第三章提供了本工作的数学框架和方法论。第四章展示了我们的实验及仿真结果。第五章给出了结论以及该领域未来工作的机会。
对空中目标的及时分类与意图预测,对于作战飞机作出明智战术决策至关重要。当前主流的空中目标分类方法依赖使用时间序列数据的驱动模型。这些模型在长时段数据下表现良好;然而,在涉及快速演变威胁、要求迅速决策的作战情境中,这种做法并不现实。最小化错误预测至关重要,因为在高风险环境中,不确定性优于错误评估。本文提出一种目标分类与意图预测的综合方法,能够在威胁要求快速响应的环境中基于部分数据作出决策。在所提方法中,预测由短时序子样本生成,而非依赖整个时间序列,并通过在子样本间传播置信度来优化结果。分类器的输出通过证据推理框架进行组合,以管理不确定性。目标意图则利用基于规则的技术和基于距离的组合方法随时间融合信息来推断。由于缺乏公开可用数据集,本文生成了一个用于空中目标分类的数据集以进行评估。研究采用涉及八个目标的案例,展示了该方法的有效性,在目标类型分类和意图预测上分别达到88%和93%的准确率。
通过一个案例研究证明了该方法的有效性,该案例涉及对八种不同空中目标的分类,这些目标对本机表现出三种行为(意图):敌对、非敌对和可疑。实验结果显示,目标类型识别的分类准确率为88%,目标意图预测准确率为93%。基于图像的作战中目标类型分类[1, 2]受限于传感器约束、遮挡以及生成逼真数据集的困难。时间序列运动数据能更可靠地捕捉动态目标行为。因此,据我们所知,本研究首次实现了一种基于时间序列的方法,利用目标运动与动态特征进行作战环境中的目标类型分类。本研究的主要贡献如下:
1)引入了一种基于时间序列的方法,利用运动特征进行目标类型分类,据我们所知,这在以往工作中尚未被探索。2)提出了一种早期分类框架,利用目标运动轨迹数据的子样本,而非像现有目标分类工作通常那样依赖整个时间序列。这种方法能够实现更快决策,并有助于缩短飞行员反应时间。3)开发了一种空中目标分类的集成方法,整合了多个标准机器学习(ML)分类器的预测以及跨时间的预测。提出了一种新方法,以减少组合多个分类器预测和跨时间预测时的误分类。当预测相互冲突时,该方法不会作出可能错误的分类,而是将置信度重新分配给一组反映预测不确定性的类别。这确保了在证据不足时,该方法以不确定性作出预测,而非进行错误分类。4)提出了一种基于规则的分类器来预测空中目标的意图,将其归类为敌对、非敌对或可疑。该模块利用来自目标分类模块的目标类型预测,以及目标相对于本机的运动特征。5)在目标意图可能迅速转变的作战场景中,成熟的登普斯特组合规则往往难以有效处理高度冲突的证据。为克服这一局限,提出了一种组合技术,引入距离度量来定量评估来源间的冲突程度。当该度量超过预设阈值时,方法自适应地修改组合规则,以更好地管理冲突。通过这样做,防止了错误预测随时间传播,从而在动态环境中实现可靠的信息融合。
本文其余部分组织如下。第二节回顾了关于时间序列分类与组合技术的相关工作,涉及空中目标分类及其他相关应用。第三节提供了时间序列分类与组合技术的背景信息。第四节描述了所提出的综合目标分类与意图预测方法。第五节概述了本文使用的数据集,以及数据生成与预处理流程。第六节展示了实验评估的结果。最后,第七节讨论了结论与未来工作建议。
宾夕法尼亚大学 CIS 6280《World Models》课程主图。课程面向 2026 年秋季,主题是用于感知、规划、控制和决策的环境动力学表征与预测模型。
世界模型正在成为人工智能从“识别和生成”走向“理解、预测和行动”的关键接口。无论是强化学习中的想象展开、视频生成中的未来帧预测、三维空间中的动态建模,还是机器人和数字智能体中的规划与反馈,本质上都离不开一个问题:系统能否在内部形成一个关于外部世界如何变化的模型。 宾夕法尼亚大学 2026 年秋季课程 CIS 6280《World Models》正是围绕这一主题组织。课程由 Jiatao Gu 主讲,目标不是只讲某一个模型家族,而是把世界模型放在更大的技术谱系里:从状态空间模型、表征学习和生成模型基础出发,进入序列生成、模型式强化学习、视频世界模型、三维与四维动态、神经物理、机器人学习、语言模型和数字智能体。 这门课适合已经具备机器学习基础、希望系统理解“世界模型”概念的研究者和高年级学生。它的亮点在于跨越多个社区:强化学习、生成式建模、空间智能、具身智能和大模型智能体被放在同一条学习路线上,而不是彼此割裂地学习。
课程页面将世界模型定义为“环境动力学的学习型表征与预测器”,服务于感知、规划和决策。换句话说,世界模型不是单纯的视频生成器,也不是传统意义上的强化学习动力学模型,而是一类能把观察、状态、动作、记忆、预测、模拟、规划和推理连接起来的通用建模框架。 课程开设于宾夕法尼亚大学计算机与信息科学系,编号为 CIS 6280,时间为 2026 年秋季。上课时间为每周二、周四 12:00-1:29 PM,地点为 Amy Gutmann Hall 105A 与 105B。课程办公室时间为周四 4:30-5:30 PM,地点为 AGH 423。
课程建议先修背景为 CIS 5190、CIS 5200 或等价的研究生机器学习经验。这意味着它并不是入门机器学习课,而是默认读者已经理解监督学习、概率建模、优化、神经网络和基础强化学习概念。课程本身会讲必要的强化学习与控制工具,但重点是世界模型如何支撑决策,而不是把它定位成一门传统强化学习课。 课程地址: https://www.cis.upenn.edu/~cis6280/
课程团队。课程由 Jiatao Gu 主讲,Mutian Tong、Yong-Hyun Park、Enxin Song 和 Xinyue Ai 担任助教。
课程主讲人为 Jiatao Gu。课程团队还包括四位助教:Mutian Tong、Yong-Hyun Park、Enxin Song 和 Xinyue Ai。课程页面提供了主讲教师和助教的个人主页链接,便于学生了解各自研究方向。 从课程主题看,这支团队覆盖的方向明显偏向大模型、生成建模、多模态和具身智能交叉。世界模型本身也是一个高度交叉主题:既需要概率建模和表示学习,也需要生成模型、强化学习、机器人和系统评估视角。
课程共有 25 个课堂节点,其中包括 23 次讲座、1 次期末项目展示和 1 次期末考试。按照主题脉络,可以整理为七个模块。 第一个模块是建模基础,包括世界模型概览、历史与概率表述、环境和模拟器接口、状态空间模型。这里建立“观察、状态、转移、动作、反馈、轨迹”的基本语言。 第二个模块是表征学习,讨论模型应保留什么信息、如何检验表征、重构、掩码预测、自回归预测、对比学习,以及联合嵌入预测等路线。 第三个模块是生成模型基础,覆盖潜变量模型、对抗模型、自回归模型、扩散、流匹配、正规化流和自回归流。这一部分把现代生成模型与世界模型中的 rollout、预测和采样连接起来。 第四个模块是序列与控制,进入序列生成式世界模型、模型式强化学习、规划与控制,讨论想象轨迹、模型偏差、不确定性、模型预测控制、交叉熵方法和轨迹优化。 第五个模块是视频与空间世界模型,包括视频生成架构、交互、记忆、效率、三维几何表征和四维动态建模。 第六个模块是物理与机器人,覆盖神经物理、学习型物理动力学、机器人仿真、控制、仿真到现实,以及视觉语言动作模型和世界动作模型。 第七个模块是智能体与评估,讨论大语言模型作为世界模型、状态跟踪、具身落地、推理模型、测试时计算、数字智能体,以及世界模型的效用、鲁棒性、校准、分布外行为、延迟和开放问题。 课程学习路线图。课程从环境动力学、表征学习和生成模型出发,逐步进入视频、三维、机器人、数字智能体和世界模型评估。
课程从 8 月 25 日开始,以“世界模型概览”开篇;8 月底到 9 月初完成历史、概率建模、环境接口、状态空间模型和表征学习;9 月中下旬集中讲生成模型基础;10 月转向序列生成、模型式强化学习、视频和空间世界模型;11 月进入神经物理、机器人学习、语言模型、推理模型和数字智能体;12 月 1 日进行期末项目展示,12 月 3 日进行期末考试。 课程页面也标注了临时日程变化:9 月 15 日和 9 月 22 日暂定改为 Zoom 线上课,9 月 17 日因教师出差暂定停课;10 月 1 日为秋季假期,10 月 6 日和 10 月 8 日因 COLM 2026 停课,11 月 26 日为感恩节假期。 课程日程概览。课程共 25 个课堂节点,覆盖 23 次讲座、项目展示和期末考试。
课程资源部分将材料分为几类。第一类是核心论文与文章,包括 Ha 和 Schmidhuber 的 World Models、Yann LeCun 关于自主机器智能路径的文章、李飞飞关于空间智能的文章、World Labs 的世界模型功能分类、Google DeepMind 关于想象与规划智能体的文章,以及 Richard Sutton 关于智能决策者通用模型的思考。 第二类是教程、综述和课程材料,包括 CVPR 2025 “从视频生成到世界模型”教程、Mila 2026 世界模型研讨会、Awesome World Models 列表、世界模型到世界动作模型综述、CMU 生成式人工智能课程中的世界模型讲义,以及 Stanford CS234 中关于世界建模的讲义。
课程还列出了若干演讲资源,例如 Ilya Sutskever 与 Jensen Huang 的炉边谈话、Jitendra Malik 关于通往人工智能的感知运动道路、李飞飞关于空间智能的 TED 演讲,以及 Yann LeCun 关于自主机器智能路径的演讲。 系统与演示资源则包括 DreamerV3、Meta 的 V-JEPA 2、Google DeepMind 的 Genie、World Labs 的 Marble、Wayve 的 GAIA-4、GenBio AI 的 AIDO Cell Simulator、DayDreamer 以及 DINO-WM。这些资源覆盖从强化学习、视频预测、空间建模、自动驾驶、生物模拟到机器人学习的不同世界模型形态。
作业与项目节点。课程包含三次作业和一个期末项目,项目要求学生明确建模状态、转移、动作接口和评估准则。
课程设置三次作业。作业一于 9 月 10 日发布,9 月 24 日截止;作业二于 9 月 30 日发布,10 月 19 日截止;作业三于 10 月 21 日发布,11 月 18 日截止。课程页面说明,具体说明和评分权重会在每次作业发布前公布。 这三次作业很可能对应课程前中期的核心技术训练:从环境和状态空间模型,到表征学习、生成模型和序列建模,再到控制、视频、空间或机器人相关实验。
期末项目要求学生在一个应用领域中探索世界建模方法,并明确说明被建模的状态、转移、动作接口和评估标准。课程给出的应用方向包括物理系统、视频与空间世界、机器人学习、语言与数字智能体。 项目节点包括:10 月 14 日提交提案,说明问题、领域、方法和评估计划;11 月 16 日提交检查点,展示可运行系统、早期证据和风险;12 月 1 日进行期末项目展示,报告结果、失败分析和讨论;12 月 14 日提交最终报告和代码。
课程的官方信息、临时会议链接和课程问题会通过 Canvas 发布。课程页面提供了官方课程列表、宾大学术诚信政策和无障碍服务链接。页面还说明,评分、迟交政策和人工智能使用规则将另行公布。
课程页面特别说明,这不是一门纯强化学习课程。它会讲理解世界模型所需的强化学习和控制工具,但覆盖范围还包括表征学习、生成建模、视频与三维、机器人、语言和数字智能体。换言之,这门课真正关注的是“学习到的世界表示和预测器如何服务决策”,而不是某一类算法的窄门派训练。
过去几年,世界模型这个词在不同社区中同时升温。在强化学习中,它意味着让智能体在想象中试错;在视频生成中,它意味着对未来视觉世界进行连续预测;在空间智能中,它意味着理解三维结构和物理变化;在机器人中,它意味着把感知、动作和反馈放进可规划的动态系统;在大模型智能体中,它又意味着对任务状态、工具反馈和环境变化进行长期跟踪。 这门课的价值在于把这些分散方向放在一个统一框架下。它不把世界模型等同于“更强的视频生成”,也不把它缩小为“模型式强化学习”,而是把世界模型理解为面向决策的环境建模基础设施。
第一条主线是状态。世界模型必须回答系统内部到底表示什么:像素、潜变量、对象、几何、物理量、语言状态、任务进度,还是多层级记忆。 第二条主线是转移。世界模型的核心能力是预测变化:动作之后会发生什么,环境如何演化,长期 rollout 会如何漂移,模型不确定性如何积累。 第三条主线是使用。一个世界模型的价值最终不在于生成得多漂亮,而在于能否支持规划、控制、评估、数据生成、机器人学习和智能体决策。课程的期末项目也围绕这点设计:必须显式说明状态、转移、动作接口和评估标准。 对关注具身智能、空间智能、视频生成、自动驾驶、机器人基础模型和大模型智能体的读者来说,这门课程提供了一条很好的系统化路线:从“模型如何预测世界”走向“模型如何帮助智能体在世界中行动”。
本报告采用系统工程方法,开发并评估一种美新联合机器人、自主系统与人工智能(RAS-AI)系统之系统,以防御关键海上基础设施。报告识别并分析了能力差距、需求、备选方案、采购成本以及性能指标。所提出的解决方案——“自主响应与交战系统”(ARES),通过建模与仿真以及定性分析,针对四种不对称威胁场景进行了评估。ARES初期通过“ARES融合中心”(AFC)整合现有传感器、平台和指挥控制系统,以建立通用作战图并改善决策,随后分阶段扩展能力以解决已识别的缺陷。分析结果表明,在新加坡现有防御架构中,水下探测是主要的能力局限。敏感性分析发现,与同等幅度的探测概率提升相比,增加探测距离能带来更大的性能改进。此外,防御系统在应对蜂群战术时面临重大挑战,这凸显了早期威胁探测和多域协调的必要性。报告估算了系统的实施成本,并用于评估成本与性能之间的权衡。该分析支持系统的分阶段实施,以在适应预算的同时提升能力。
下一场重大冲突,将在由人工智能重塑的战场上展开。除其他必要调整外,应假定其系统将在被拒止、降级、间歇和受限(DDIL)条件下运行。这可能包括干扰、网络攻击和反卫星武器,所有这些都旨在切断连通性并使作战陷入混乱。
人工智能可帮助部队在干扰中坚持作战,从在失去与操作员联系后仍持续追踪目标的自主系统,到帮助军人拼凑破碎态势图的决策支持工具。然而,这项技术的发展速度已超越了其所需的授权、测试实践和训练,而这些正是军人在战术边缘信任该技术的前提。这一差距正是对手将着力打击之处。
本报告借鉴了五角大楼的“无人机主导”和反无人机系统计划、如“雷霆锻铸”等迭代项目、如海军陆战队“的黎波里”项目等模拟环境,以及约翰·迪尔和特斯拉在赢得用户对自主系统信任方面的私营部门经验,以阐明政策与实践滞后的领域。
在这些系统于实战中接受考验之前,需要付出何种行动才能迎头赶上?关键步骤包括:厘清谁在人工智能系统的整个生命周期中拥有控制权;在工业界与实际使用这些工具的军人之间建立更快速的反馈循环;针对训练期间从未遭遇的战场条件对人工智能进行对抗性测试与红队演练;以及通过职业军事教育让军人做好准备,以经过验证的信心而非本能的怀疑来运用人工智能。
美国国防部(DoD)日益依赖非传统国防承包商、风险投资支持的初创企业、两用技术公司、研究型大学以及商业创新生态系统来开发事关国家安全的能力。然而,由于接触机密空间的途径有限,参与机密项目仍受到制约。尽管创新活动已扩展至传统国防中心之外,但机密基础设施仍集中在传统的政府和防务工业所在地周围。因此,许多拥有事关国家安全技术的企业缺乏实际途径来获取参与机密工作所需的安全设施。
认识到这一挑战,美国国会向国防创新单元(DIU)拨款1.45亿美元,以扩大机密基础设施容量并探索“机密基础设施即服务”(CIaaS)解决方案。本论文通过识别未来对共享机密基础设施需求最有可能涌现的地理区域,以及未来机密空间投资可能提供最大战略价值的地方,来支持这一努力。
一个核心挑战在于,目前不存在衡量当前或未来对共享机密工作空间需求的综合数据集。因此,本研究基于创新集群理论和区域经济发展研究的代理指标来估算未来需求。数十年的研究表明,创新在美国并非随机分布。相反,创新活动往往通过集聚效应、知识溢出、劳动力流动、风险投资集中和组织衍生等机制在地理上趋于集中。企业频繁从现有技术领域中涌现,成功的创新生态系统通过人才、创意和资本的流动实现自我复制。以下四项发现为本研究选定的数据集提供了理论基础。
首先,使用了风险投资(VC)投资数据,因为风险投资公司将资源集中在预计会产生未来高增长企业的地区。因此,风险投资可作为未来初创企业形成和技术商业化最有可能发生的区域的指标。其次,纳入了“国家安全100强”和“美国活力”企业,因为它们代表了已在商业创新与国家安全交叉领域运营的现有公司。关于组织繁衍和产业集群的研究表明,成功的企业经常催生由前员工创立的衍生公司。因此,这些企业是未来防务相关初创企业可能涌现区域的领先指标。第三,纳入了大型科技公司的所在地,因为大型科技公司是区域创新生态系统的锚点。研究表明,大型公司产生知识溢出,吸引专业化劳动力,并创造支持创业和新公司形成的条件。员工频繁离开成熟的科技公司去创建新企业,通常仍留在同一地理区域内。最后,纳入了“小企业创新研究”(SBIR)奖项,因为它们代表了防务相关技术知识已经产生的地点。SBIR资金证明联邦资源已经为在特定地理区域开发防务相关专业能力作出了贡献。尽管SBIR活动本质上是回顾性的,但它提供了可能支持未来机密工作的技术能力积累的重要指标。
综合来看,这四个数据集代表了未来创新潜力的不同维度。风险投资反映了融资生态系统,“国家安全”和“美国活力”企业代表了防务相关的创业活动,大型科技公司代表了未来衍生企业和知识溢出的来源,而SBIR奖项则代表了现有防务相关技术知识的集中地。本论文并非试图直接衡量当前的机密空间需求,而是基于历史上产生创新集群的地理驱动因素,估算未来机密基础设施需求最有可能涌现的地点。
为评估这些地点,本研究对来自四个数据集的大约6600个观测值应用了加权空间凝聚聚类。聚类形成基于地理邻近性和加权来源关系。由于数据集规模差异很大,采用了来源归一化技术,以防止任何单一来源——尤其是较大的SBIR数据集——主导结果。随后,使用随机生成的权重组合进行了5000次蒙特卡洛分析,以评估候选地点在广泛合理政策优先级下的稳健性。
结果表明,归一化实质性地改变了决策空间。在没有归一化的情况下,大型数据集不成比例地影响了结果。归一化后,模型生成了在多种加权结构下持续出现的地点的更平衡表征。有几个地点在平均分、出现率和基于排名的衡量指标上表现强劲,包括华盛顿州梅迪纳、新泽西州霍博肯、加利福尼亚州山景城、弗吉尼亚州阿灵顿、华盛顿特区、加利福尼亚州戴利城和加利福尼亚州德尔艾尔。
随后,研究纳入了国防部区域成本系数(ACF),以估算在1.45亿美元固定预算下可交付的机密空间数量。该分析揭示了需求强度与建设购买力之间的显著权衡。高需求地区,如加利福尼亚州湾区和新泽西州北部,显示出强劲的创新信号,但面临显著的成本惩罚。低成本地区,如阿拉巴马州亨茨维尔、得克萨斯州奥斯汀、新墨西哥州阿尔伯克基和亚利桑那州坦佩,可交付显著更大的设施容量,但总体上需求信号较弱。
当综合评估模型强度、持久性、排名表现和成本调整后的购买力时,华盛顿州普吉特海湾地区成为最强劲的整体候选地。华盛顿州梅迪纳在模型中持续排名靠前,同时保持可接受的建设经济性。新泽西州霍博肯显示出最强劲的整体需求信号,而加利福尼亚州山景城、弗吉尼亚州阿灵顿、华盛顿特区和加利福尼亚州德尔艾尔也保持高度竞争力。其他几个地点,包括亚利桑那州坦佩、阿拉巴马州亨茨维尔、新墨西哥州阿尔伯克基、科罗拉多州科罗拉多斯普林斯、宾夕法尼亚州匹兹堡和加利福尼亚州圣迭戈,在多种加权情景下表现出强劲的持久性,值得考虑用于未来扩展。
与现有及计划中的国防创新单元地点进行比较后发现,与几个已识别的创新走廊存在大量重叠,包括加利福尼亚州湾区、得克萨斯州奥斯汀、阿拉巴马州亨茨维尔、马萨诸塞州波士顿/剑桥、纽约/新泽西以及加利福尼亚州圣迭戈。然而,分析也发现了潜在的基础设施缺口区域,如普吉特海湾地区、华盛顿特区国家首都区部分区域、新墨西哥州阿尔伯克基、科罗拉多州科罗拉多斯普林斯和宾夕法尼亚州匹兹堡。
本研究的主要结论是,未来的机密空间规划应以创新地理而非传统机密基础设施地理为指导。分析表明,未来对机密访问的需求最有可能在多种创新驱动因素汇聚的地点涌现,这些驱动因素包括风险投资、防务相关企业、大型技术生态系统以及积累的技术知识。然而,仅靠创新需求不足以作出投资决策。实际考量,如建设成本、设施容量和现有机密基础设施布局,也必须纳入考虑。因此,以下分析审视了在纳入成本调整后的购买力时,领先的以创新为中心的地点如何变化,以及这些发现与当前及计划中的国防创新单元扩展工作相比如何。总之,这些结果为识别未来机密基础设施投资可能产生最大战略价值的地点提供了一个框架。本研究结果总结于以下三个表格中:(1)成本效益分析前的机密空间候选地点;(2)成本效益分析后的地点排名;(3)与国防创新单元机密空间规划工作重叠的地点。
战争是一种人类活动——以武力与暴力的威胁或运用为特征的意志较量……它并非可以由机器、计算或流程精确控制的机械过程。——ADP 6-0,《指挥与控制》
随着人工智能日益塑造军队的感知、决策与行动方式,战争抗拒机械化的这一假设正受到条令未曾预料到的考验。从乌克兰人工智能赋能的无人机网络到美国与以色列针对伊朗的联合行动,近期多场冲突中,机器辅助系统正将决策周期压缩至超出人类认知处理能力的速率,实现了从传感器到射手的无缝链接,并以空前规模和节奏生成打击方案。在此类环境中,指挥官正从亲自决策转向在时间压力下从机器生成的建议中做出选择。问题已不再是人工智能是否会塑造军事行动——它已经在塑造。问题在于,它对指挥这些行动的军人造成了何种影响?
这一转变冲击了军事领导条令的根基。正如美《陆军条令出版物6-0:指挥与控制》所阐述的,任务式指挥建立在相互信任、共享理解以及受指挥官意图引导的纪律严明的主动性基础之上[1]。同样,作战流程将指挥官置于理解、可视化和指导这一迭代的、由人类驱动的周期中心[2]。然而,随着人工智能系统介导态势理解并影响决策输出,信任的重心正从人类领导者转向算法系统,而权限则日益分散于人类—机器网络之中。但责任仍由指挥官承担。
在战场之外,这些动态还延伸至日常组织领导。在组织层面,领导力从根本上讲是一种基于信任、氛围与专业判断的影响力行为[3]。随着人工智能赋能的工具嵌入规划、分析与决策支持,下属可能开始赋予机器衍生输出比指挥官意图更高的权重,因为算法的置信度逐渐取代了人类判断。问题不在于抗命,而在于人类判断被逐渐边缘化。
将这种状态描述为“失去控制的指挥”——权限在形式上依然完整,而赋予其活力的人类判断却被为速度而非智慧而优化的系统逐渐掏空。人工智能加速了军事决策,更重要的是,它重构了谁或什么被信任来做出决策,而问责制却保持不变。由此产生的与任务式指挥条令基础之间的张力正日益增长、未得到充分审视且影响深远。应对这一挑战,要求领导者不是拒绝人工智能,而是刻意且持续地在那些旨在让这种重申显得多余的系统内部,重申人类判断的首要地位。
设想两个规划室内。在其中一处,地图是手绘的,电台是连接上级的唯一纽带,决策来自指挥官本人在亲临的地形上做出的个人研判。在另一处,人工智能生成的叠加层以快于参谋人员审查的速度填满屏幕,而本能反应是依据输出构建方案而非质疑它。这种反差与能力无关,它源于机器使不确定性显得已然确定的速度。
任务式指挥建立在一个简单却苛刻的前提之上:指挥官通过相互信任建立凝聚团队,创造共享理解,提供清晰意图,并授权纪律严明的主动性[4]。这一理念假定人类在不确定性中解读信息、行使判断并在信任框架内行动。人工智能通过介导指挥系统内理解如何构建、信任如何形成以及决策如何执行,间接挑战了这些假设,而非简单地取代领导者。
第一个摩擦点在于共享理解,这是任务式指挥的基石。人工智能赋能的系统日益通过过滤、优先排序和呈现信息来塑造部队对战场的感知。关于人工智能赋能的军事决策的研究强调,此类系统能以超出人类处理能力的速度聚合海量数据集并生成综合作战图景[5]。在乌克兰,人工智能赋能的无人机网络将传感器到射手的周期从数小时压缩至数秒,展示了机器介导的情报、监视与侦察如何从根本上改变战术层面态势感知的构建与共享节奏[6]。正在进行的美国—以色列对伊朗的联合行动将这一模式扩展至战役规模,其人工智能目标定位系统在首个二十四小时内处理超过一千个打击目标,速度之快在结构上排除了对每项决策进行审慎的人类评估[7]。结果,传统的由参谋驱动的态势理解构建过程正被机器策划的输出所补充,并在某些情况下被取代。虽然这增强了速度和数据集成,但也引入了对算法过滤的依赖,从而在指挥流程中引发了关于可见性、偏见和可解释性的关键问题。
其次,人工智能重塑了军事决策流程及相关决策框架的执行。对人工智能集成到指挥与控制的分析表明,这些系统压缩了规划与执行时间线,实现了更快的方案生成与选择[8]。指挥官不再经历审慎的参谋流程,而是更频繁地被呈上已由人工智能系统过滤和塑造的选项。这种压缩挑战了条令预期——即指挥官应通过持续对话、分析和细化来发展理解。
第三,人工智能改变了军事组织内部相互信任的基础。任务式指挥假定信任在指挥官、下属和参谋之间流动,从而实现分散执行。然而,关于军事背景下人工智能支持决策的研究表明,过度依赖人工智能工具会削弱领导者内在的决策技能,并使其保持对复杂系统控制的能力复杂化[9]。随着时间的推移,这种信任会从人转向系统感知上的可靠性。费伦茨·法泽卡斯指出,人工智能赋能的指挥系统可能无意中集中信息权限,即使其本意是支持分散执行[10]。
第四,人工智能加剧了分散与集中之间的张力,这是任务式指挥的决定性特征。一些学者认为,人工智能可以强化分散执行。索林·马泰和凯尔·里德主张,人工智能赋能的指挥系统通过数据浓缩与提炼过程,可同时向高级指挥官和战术边缘传递具备决策质量的信息,从而增强而非侵蚀任务式指挥的意图驱动逻辑[11]。在此观点下,人工智能管理信息不对称的能力不是弱点,而是分布式主动性的赋能因素。
然而,美国陆军战争学院的兵棋推演证据对这一乐观评估提出了挑战。亚伦·威尔科克斯和蔡斯·梅特卡夫记录了人工智能赋能的规划系统如何在参谋军官中造成认知锚定,他们顺从于机器生成的行动方案,即使这些输出被证明在作战上存在缺陷[12]。人工智能系统非但没有赋能分散主动性,反而充当了集中化的认知权威——不是通过指挥层级,而是通过算法对选项如何被框定、排序和接受的影响。这意味着指挥官必须更加努力地维持控制与主动性之间的平衡,而不能假设它会自然产生。
最后,人工智能使任务式指挥中权限与问责之间的关系复杂化。虽然决策支持系统塑造建议并影响结果,但责任仍由人类指挥官承担。关于人工智能赋能的军事决策的研究强调,此类系统可能难以被用户完全解释,特别是当输出通过复杂模型和概率推理生成时,这使验证和信任变得复杂[13]。这造成了一个缺口:决策输入分散在系统和参与者之间,而问责仍由指挥官承担。
这些结构性压力使任务式指挥在纸面上保持完整,同时暴露了其人类基础开始侵蚀的条件。
一名参谋军官在三分钟内审查五十个由人工智能生成的打击选项,这在任何传统意义上都不是在做决策;他是在执行决策。这一区别在和平时期规划中微妙,在战斗中却是灾难性的,它正是人工智能对军事判断所造成影响的核心。条令一贯强调,指挥是在不确定性中运用判断的实践,要求领导者在信息不完整的情况下解读信息、接受风险并采取行动,尽管存在模糊性[14]。人工智能并未消除不确定性,却制造了一种确定性的幻觉,这种幻觉会扭曲领导者和下属的思考、决策与行动方式。
一个核心风险是自动化偏见日益普遍,即个体倾向于过度信任机器生成的输出,尤其是在快节奏环境中。实证研究证明,即使建议是错误的,用户也经常遵从算法推荐,尤其是在时间压力和认知负荷条件下[15]。在人工智能系统日益嵌入目标定位、情报分析和规划工具等军事背景下,这种偏见会微妙地将决策权限从人类判断移开。关键的是,这种倾向在目标定位背景下已被具体记录,对自动化推荐的过度依赖不仅引发作战问题,还引发关于遵守国际人道主义法区分和比例原则义务的法律关切[16]。领导者可能开始接受人工智能输出,不是将其视为有待质疑的输入,而是将其视为有待验证的结论。
这种转变对组织领导力和信任具有重要影响。军事组织内的领导力取决于基于专业判断和经验的的影响力。然而,随着人工智能系统嵌入规划和分析流程,这种影响力的基础可能演变。约瑟夫·休伊特认为,人工智能可以塑造决策如何被制定和解读,表明领导者必须防范对系统生成输出的过度依赖,特别是当此类输出在分析上显得稳健时[17]。在此类背景下,下属在形成自身评估时可能日益依赖系统输出。这不是抗命;它反映了组织内信任的重构,技术成为决策过程中更突出的中介。
这种脆弱性不仅限于在火力下认知疲劳的士兵。在美国陆军指挥与参谋学院,人工智能在规划演习、兵棋推演和学术评估中的集成进展迅速,足以促使正式的机构干预。2025年8月发布的《指挥与参谋学院公告921》明确警告,生成式人工智能工具“缺乏将摘要或比较可靠转化为合理分析或建议所需的背景和判断力”,并禁止在分级评估中未经授权使用,这一限制在拥有作战经验的中级军官中的必要性本身就具有启示意义[18]。事实上,这种情况甚至出现在专业军事教育环境中,表明接触人工智能本身就足以取代独立判断,无论军衔或经验如何。
人工智能还影响领导者如何应对不确定性和风险,这两者都是有效指挥的核心。军事领导力传统上要求在模糊中保持从容,并具备在信息不完整情况下做出决策的能力。然而,人工智能系统通过呈现结构化输出、概率和优先排序的建议,可以制造一种可能并不反映作战环境潜在复杂性的清晰感。研究指出,此类系统可以掩盖其自身局限性,特别是当使用者无法看到输出如何生成时[19]。更大的危险在于人工智能掩盖不确定性的倾向,助长对本质上仍不确定的决策的过度自信。
人工智能并未减轻指挥官的责任。如果说有什么变化的话,它使责任更重了。虽然人工智能系统日益为作战决策提供信息、确定优先顺序甚至塑造作战决策,但这些决策的伦理与法律重担仍牢牢由人类领导者承担。结果是形成一种指挥环境:权限扩大,而问责保持不变。
这种张力源于决策支持与决策所有权之间的关系。人工智能系统可以处理海量数据集,并以超越传统人类分析的速度生成打击方案。这提高了作战效率,但也给决策者带来压力,他们必须迅速评估系统生成的输出。在高节奏目标定位环境中,这种压力更为明显。在正在进行的伊朗冲突中,美国军方确认使用了“梅文智能系统”(融合超过170个情报来源)以及商业人工智能工具,以国防分析人士描述为在结构上与审慎法律审查不相容的规模和节奏生成和排序打击目标[20]。观察该行动的研究人员还指出,虽然人工智能显著加速了目标定位,但它并未减少——反而可能强化了——对人类判断的要求,正是因为机器生成选项的数量和速度压缩了可用于评估的空间[21]。在此类条件下,决策面临从审慎评估转向程序性验证的风险,人类指挥官的角色变成确认而非批判性审问系统输出。
与此同时,人工智能对问责结构构成了根本性挑战。传统的军事问责依赖于将决策与可识别的行动者联系起来的清晰链条。然而,人工智能赋能的系统将决策输入分散在设计者、数据源、操作者和指挥官组成的网络之中。伊朗行动以空前方式使这种分散变得可见:美国军方将Anthropic公司的Claude(一款商业大语言模型)与Palantir公司的“梅文”目标定位系统结合用于打击排序,引发了关于该用途伦理限度的公开争议[22]。这种裂痕精确地说明了当决策源于人类—机器网络而非可识别的人类行动者时,责任如何在商业开发者、军事操作者和指挥官之间分散。结果是,谁影响决策与谁对这些决策负责之间的差距日益扩大。
军事领导力建立在一个原则之上:指挥官对其部队所做或未做的一切负责,包括其决策的伦理影响[23]。人工智能使这一原则在实践中的应用复杂化。区分和比例等概念需要情境判断和仔细核实,而人工智能系统无法可靠提供。对伊朗—以色列对抗中算法目标定位的分析强调,如果没有充分的人类监督,人工智能目标定位系统可能导致平民伤害,并引发关于遵守国际人道主义法的关切[24]。依赖统计推断而非经验证法律确定性的目标定位系统破坏了国际人道主义法原则——区分和比例义务——造成了现有指挥结构无法应对的问责缺口[25]。
当问责变成点击目标清单这种程序性行为,而非实质性的审慎判断时,“失去控制的指挥”就不再是理论风险,而是作战现实。
图。人工智能时代军事领导力的重构(图由作者提供)
人工智能不需要新的军事领导理论;它要求在变化条件下更刻意地应用现有原则。前文确立了一种模式:人工智能不太可能直接从外部打破指挥,更可能通过使判断的让位感觉像效率一样,从内部侵蚀指挥。恢复有意义的指挥权限需要沿着三条相互强化的路线采取刻意行动(见图)。
首先,领导者必须刻意重申人类判断的首要地位。人工智能系统可以生成和优先排序选项,但无法取代情境理解、经验或伦理推理。领导者必须抵制将速度与合理决策等同的倾向,并确保关键决策保留一个审慎的人类检查点。这在高节奏环境中尤为重要,因为快速行动的压力可能将决策简化为在预处理选项中进行选择。重申判断不需要拒绝人工智能;它要求主动审问其输出、质疑假设,并确保决策植根于作战背景。
其次,领导者必须对人工智能系统建立纪律严明的信任。信任仍是任务式指挥的核心,但在人工智能赋能的环境中,它必须超越人际关系,扩展到人—机交互。这种信任不能是未经批判的。领导者必须了解所使用系统的能力和局限性,并确保下属将人工智能输出视为有待考虑的投入,而非有待接受的结论。建立这种纪律需要训练、重复和指挥强调。部队不仅必须学会如何使用人工智能,还必须学会如何适当地挑战它,特别是当输出与情境理解或指挥官意图冲突时。
第三,领导者必须积极维护指挥权限和问责。人工智能赋能的系统可以将决策输入分散在网络和流程中,但它们绝不能稀释指挥官作为最终决策权威的角色。领导者必须强化指挥官意图的首要地位,确保目的清晰,并保持对结果的所有权。同时,他们必须对受人工智能影响的决策保持问责,认识到责任不能委托给系统。这需要自觉努力保留对决策的道德和专业所有权,特别是在技术加速行动的环境中。
这些适应不是理论;它们是领导实践。通过这样做,它们在集成新能力的同时强化了指挥的人类基础。
最终,人工智能赋能部队的有效性不仅取决于技术复杂性,还取决于领导者能否保持对决策制定方式的控制。人工智能时代指挥的衡量标准不是领导者处理机器输出的速度,而是他在每一次顺从的压力下,是否选择不顺从。
正在进行的冲突已明确了本文通过条令、兵棋推演和机构观察所论证的观点:人工智能并非从外部威胁指挥,而是从内部掏空它。当一次行动在数小时内生成数千个由人工智能优先排序的目标,将商业大语言模型集成到打击决策中,并引发关于谁承担伦理责任的公开争议时,条令问责与作战现实之间的差距已不再是理论上的。它已成为结构性的。
这就是“失去控制的指挥”的状态。权限在形式上依然完整。指挥官保留他们的头衔、签名和法律责任。被侵蚀的是赋予指挥以意义的人类判断,它被并非出于恶意或疏忽所取代,而是被为速度、规模和分析完整性而优化的系统所取代,这些系统使判断的放弃感觉与效率无异。
然而,军事领导力的持久原则仍然有效。战争继续是一种人类活动,有效指挥仍取决于判断、信任和责任。一位曾在无机器抵达、无信号确认的地形上指挥过士兵的军官,对此的理解不是作为条令,而是作为经验。这种理解正是人工智能时代所要求的,也恰恰是它最面临被侵蚀风险的东西。当代领导者的任务是确保这些原则不被技术所取代,而是通过技术得到强化。
在以机器速度为特征的时代,决定性优势不属于处理信息最快的部队,而属于其领导者保持对信息如何被理解、解读和行动的控制的部队。军事有效性的未来不仅取决于技术优势,还取决于领导者抵制“失去控制的指挥”并在各方面保持指挥的能力。
ADP 6-0, Command and Control, v.
ADP 5-0, The Operations Process (US GPO, 2019), chap. 1.
Department of Command and Leadership, L100: Developing Leaders and Organizations (US Army Command and General Staff College, 2025), 8.
ADP 6-0, Command and Control, 9–15.
Emelia Probasco et al., AI for Military Decision-Making: Harnessing the Advantages and Avoiding the Risks (Center for Security and Emerging Technology, April 2025), 5, https://www.doi.org/10.51593/20240028.
Ashley Ruiz, “The Future of War: Kill-Chain Supremacy and Ukraine’s Lessons,” Journal of Strategic Security 18, no. 4 (2025): 53–63, https://doi.org/10.5038/1944-0472.18.4.2592; Kateryna Bondar, “Ukraine’s Future Vision and Current Capabilities for Waging AI-Enabled Autonomous Warfare,” Center for Strategic & International Studies, 6 March 2025, https://www.csis.org/analysis/ukraines-future-vision-and-current-capabilities-waging-ai-enabled-autonomous-warfare.
Dawn Zoldi, “AI-Powered Target Bank Warfare: U.S.-Israel Use Advanced Tools to Strike ‘Pop-Up’ Threats in Iran,” Autonomy Global, 20 March 2026, https://www.autonomyglobal.co/ai-powered-target-bank-warfare-u-s-israel-use-advanced-tools-to-strike-pop-up-threats-in-iran/; Carlotta Kozlowskyj, “Iran Conflict as a Testing Ground for AI Warfare Systems,” Bloomsbury Intelligence & Security Institute, 24 March 2026, https://bisi.org.uk/reports/iran-conflict-as-a-testing-ground-for-ai-warfare-systems.
Florian Gerster et al., “The Impact of Artificial Intelligence on the Military Decision-Making Process and Mission Command,” Defence Horizon Journal, 11 September 2025, https://tdhj.org/blog/post/ai-military-decision-making-2/.
Alexandru Baboş, “Artificial Intelligence as a Decision-Making Tool for Military Leaders,” Land Forces Academy Review 26, no. 4 (2021): 271–72, https://doi.org/10.2478/raft-2021-0034.
Ferenc Fazekas, “Mission Command and Artificial Intelligence,” Land Forces Academy Review 26, no. 4 (2021): 69–79, https://doi.org/10.2478/raft-2023-0010.
Sorin Matei and Kyle Reed, “Mission Command’s Asymmetric Advantage Through AI-Driven Data Management,” Parameters 56, no. 2 (Summer 2026): 106, https://doi.org/10.55540/0031-1723.3370.
Aaron Wilcox and Chase Metcalf, “AI Command and Staff—Operational Evidence and Insights from Wargaming,” Military Strategy Magazine 10, no. 4 (Winter 2026): 4–10, https://doi.org/10.64148/msm.v10i4.1.
Probasco et al., AI for Military Decision-Making, 17–20. ADP 6-0, Command and Control, chap. 2.
Raja Parasuraman, and Dietrich H. Manzey., “Complacency and Bias in Human Use of Automation: An Attentional Integration,” Human Factors: The Journal of the Human Factors and Ergonomics Society 52, no. 3 (2010): 381–410, https://doi.org/10.1177/0018720810376055; David Lyell and Enrico Coiera, “Automation Bias and Verification Complexity: A Systematic Review,” Journal of the American Medical Informatics Association 24, no. 2 (2017): 423–29, https://doi.org/10.1093/jamia/ocw105.
Antonio Coco, “Exploring the Impact of Automation Bias and Complacency on Individual Criminal Responsibility for War Crimes,” Journal of International Criminal Justice 21, no. 5 (2023): 1077–79, 1087–94, https://doi.org/10.1093/jicj/mqad034.
Joseph Huitt, “Leadership: Artificial Intelligence in Decision Making,” US Army, 3 July 2025, https://www.army.mil/article/286847/leadership_artificial_intelligence_in_decision_making.
Dean of Academics, “CGSC Bulletin 921: Artificial Intelligence Policy,” Command and General Staff College, 6 August 2025, para. 5,5a,10.
Probasco et al., AI for Military Decision-Making, 20–22.
Al Jazeera Staff, “US Military Confirms Use of ‘Advanced AI Tools’ in War Against Iran,” Al Jazeera, 11 March 2026, https://www.aljazeera.com/news/2026/3/11/us-military-confirms-use-of-advanced-ai-tools-in-war-against-iran; Zoldi, “AI-Powered Target Bank Warfare.”
Jon Lindsay, “US Military Leans into AI for Attack on Iran, but the Tech Doesn’t Lessen the Need for Human Judgment in War,” The Conversation, 11 March 2026, https://doi.org/10.64628/AAI.j6yj3a7e4.
Chris Rogers, “How Iran, Anthropic-DoD Dispute Show the Need for Protective AI,” Just Security, 23 March 2026, https://www.justsecurity.org/134321/iran-anthropic-dod-protective-ai/; Kozlowskyj, “Iran Conflict as a Testing Ground for AI Warfare Systems.” ADP 6-22, Army Leadership and the Profession (US GPO, July 2019), 1-6–1-8.
Lamia Faris, “Algorithmic Targeting in the Iranian–Israeli Confrontation: Technical Realities, Legal Thresholds, and the Boundaries of Human Control,” F1000 Research, June 2026, https://f1000research.com/articles/14-1200/v3.
Gerald Mako, “Legal Accountability for AI-Driven Autonomous Weapons,” Lieber Institute at West Point, 9 March 2026, https://lieber.westpoint.edu/legal-accountability-ai-driven-autonomous-weapons/.
论文:From Models to Systems: A Comprehensive Survey of Efficient Multimodal Learning 作者:Pan Wang、Siwei Song、Hui Ji 等 15 位作者 来源:Transactions on Machine Learning Research(TMLR),2026;arXiv:2609.19445 原文链接:论文页面|PDF|网页版|持续更新的资料库
导读:多模态模型同时处理图像、文本、语音、视频和传感器数据,瓶颈不只在参数量。即使模型 FLOPs 下降,视觉编码等待、显存中的 KV 缓存、不同模态的内存带宽与设备调度,仍可能让实际延迟居高不下。本文整理 Pan Wang 等人的综述,依原文 1—9 节展开:先建立模型—算法—系统(MAS)三级框架,再讨论多模态大模型、应用基准、跨层协同与开放挑战。论文汇集 300 余项研究;本文的图均截取自论文,图内保留原英文,中文图题为阅读说明。研究综述中的复杂度和方法效果须结合具体任务、硬件与测量条件理解。
多模态学习不只是把几条单模态流水线拼起来。图像是高密度空间信号,视频与语音带有不同时间尺度,文本则是离散且语义密集的序列。理解任务可能输出一个类别或答案,生成任务还要持续解码;数据又可能成对、弱配对乃至彼此分离。因此,单纯缩小某个编码器,不能保证整套系统高效。 论文将高效多模态学习(EML)的目标归纳为:在能力与泛化不被不合理牺牲的前提下,压低计算、显存、延迟、能耗及部署成本。作者没有把来自不同硬件和任务的加速数字排成统一榜单,而是追问“效率注入在计算栈的哪里,层间如何相互作用”。
MAS 框架给出三个相互关联的答案:模型层决定算什么,例如采用双塔还是统一编码器、是否使用专家稀疏路由;算法层决定怎么算,例如压缩 token、剪枝、量化、蒸馏、缓存与自适应退出;系统层决定何时何地算,例如显存管理、边云协作、流水线调度及软硬件协同。一个多模态应用通常同时跨越三层,效率收益也不能只归功于某个孤立模块。
图1|高效多模态学习的总体图景。模型结构、算法压缩与系统执行三层共同支撑自动驾驶、机器人、医疗、虚拟现实等应用。图内英文保留自原文;图片来源:原论文图1。
作者梳理 2020—2026 年间 300 余项工作,优先收录能说明 FLOPs、推理延迟、内存或能耗变化的研究;纯粹追求准确率提升的工作不作为本综述主线。论文的贡献是统一分类、分析纵向协同,以多模态大模型(MLLM)为案例观察演进,并为应用与未来研究提供路线图。它是一篇方法和系统视角的文献综述,不是在统一实验平台上重测所有方法的比较论文。
模型层改变架构拓扑,核心是减少不必要的处理,同时保留模态对齐、交互和表达能力。
视觉、文本、语音等先各自抽取特征,再做跨模态交互,是传统且有效的设计。视觉侧从轻量 CNN、层次化视觉 Transformer 到状态空间模型,分别压低局部计算、全局注意力或长序列成本;视频需要处理大量相似帧,采用掩码建模、时序分层或轻量时空模块。音频从卷积声谱图编码器走向自监督预训练与离散语音 token,重点是把高采样率连续信号变成语言模型可消费的紧凑表示。 这类架构能利用各模态成熟的归纳偏置,但专业编码器越多,跨模态接口、存储和调度也越复杂。对低照度图像、稀疏深度数据或不规则时间序列,保留特定前端仍可能比强行统一更稳妥。
图2|模态专用流水线与统一编码器的结构对照。左侧通过独立编码与后期对齐/融合处理异构信号;右侧让多模态输入进入共享参数核心。图片来源:原论文图3。
统一编码器试图让异构输入共享一个主干或潜在空间,减少并行分支的重复参数与基础设施。Perceiver 类方法用固定大小的潜变量承接不同长度输入;统一自回归方案则把图像、音频、视频转换为可混排的表征或 token,在共享序列目标下学习。这样有利于通用推理与跨模态生成,但前端编码、离散化误差、极长序列成本仍需单独处理。 论文强调两类结构不是“新旧优劣”的简单替换:模态专用编码器适合需要高保真局部细节的场景;统一核心更适合通用任务与跨模态交互。关键是把昂贵的感知流压缩到足够的信息密度,而不是仅仅减少模块数量。
混合专家(MoE)通过路由只激活部分参数,使总容量与每次前向的活跃计算脱钩。多模态模型可按模态分派专家,也可按 token 内容、难度和预算动态分派。它适合视觉 patch 大量冗余、文本 token 相对密集的非对称输入。不过,路由偏斜可能造成专家失衡和表示碎片化,迁移到新模态时也未必保持零样本泛化。结构稀疏内嵌在模型设计中,区别于训练后直接剪去权重。
高分辨率感知特征若全部交给自回归语言模型,跨模态注意力与生成成本会快速上升。Flamingo 的重采样器和 BLIP-2 的 Q-Former 代表了“有限查询接口”思路:先用少量潜在查询从密集视觉特征提炼信息,再接入语言解码器。它能把计算规模与原始输入长度部分解耦,却也可能像信息瓶颈一样滤掉细粒度定位、文字识别等任务所需的高频细节。
投影层、Adapter 与 LoRA 把跨模态连接或新任务适配放到小模块中,使大骨干保持冻结。LLaVA 式投影器负责把视觉特征映射到语言空间,低秩更新则降低微调与存储成本。好处是快速扩展能力、部署多个任务版本;局限是过窄的适配空间可能无法吸收与原有表征正交的新知识。论文因此把模块化适配视为能力扩展与骨干维护解耦的手段,而非无损替代全量训练。
模型层的演进主线是:从独立感知分支走向共享潜在核心,并以结构稀疏、受限接口和轻量模块管理不同模态的信息密度。最终评判仍应包括语义保真与泛化,不能只报参数量或理论复杂度。
算法层通常不彻底重画架构,而是调整信息流的长度、精度、稀疏性和复用方式。论文按原文分为七类。
图3|算法层效率方法示意。原文列出的七条主线包括 token 压缩、剪枝、量化、蒸馏、提示与推测解码、缓存复用、运行时稀疏;图中用若干代表机制辅助理解。图片来源:原论文图4。
视觉、视频和音频流常含大量相邻冗余,压缩目标应是保留任务相关的证据,而非机械地删去固定比例。免训练方法依据注意力、特征相似度或层间变化筛选和合并 token;训练式方法用可学习评分器、池化或聚类,在任务损失下学习保留哪些区域或片段。对于图表识别、细粒度目标或语音短瞬态,错删的代价远高于一般背景 patch。综述所引部分系统可大量删除视觉 token 并保持其设定下精度,但这一比例不能迁移为所有任务的默认阈值。
参数剪枝删除权重、神经元、注意力头或层。非结构化稀疏可在理论上压低乘加次数,却常因不规则访存而没有对应的真实加速;结构化剪枝更容易映射到 CPU/GPU 的连续数据布局。多模态的难点是不同分支与对齐层敏感度不同,因此应按模态与组件分配剪枝率,并用跨模态任务检查是否破坏语义对应。
量化把权重或激活映射到较低位宽,降低模型存储与内存带宽压力。多模态场景中,视觉、语音、文本特征的数值范围和离群点不同,统一位宽可能让某一模态失真,进而发生对齐漂移。后训练量化(PTQ)部署便捷;量化感知训练(QAT)在更激进低比特时通过训练适应量化噪声。方法如 Q-VLM、MBQ 采用模态敏感或混合精度策略。位宽变低不必然带来速度提升:还要看设备是否原生支持该格式,以及反量化和混合精度重排的成本。
大教师向小学生转移知识,论文进一步区分预测、表示和行为三类信号:对齐输出概率;匹配中间特征、注意力和关系结构;或迁移推理轨迹、偏好与决策过程。多模态蒸馏尤其需要保住视觉定位与语言推理之间的联系。只压缩最后答案,可能得到会模仿结论却不会可靠辨认图像证据的学生;加入空间或过程监督可缓解这一问题,但训练与教师查询也会增加成本。
连续提示或前缀微调只更新少量任务参数,降低适配存储和训练开销。推测解码则针对自回归生成的串行瓶颈:小模型先提出候选,大模型批量验证。在多模态情境中,共享视觉编码结果或缓存,可避免草稿模型与验证模型重复计算昂贵感知前缀。实际收益取决于候选接受率、验证批量与缓存共享,不能只看生成 token 数。
KV 缓存随序列和并发量增长,长视频或连续语音尤其容易触及显存上限。算法层可根据重要度淘汰/合并 token,对静态背景跨帧复用,对重复前缀或相似请求复用历史状态。删除冗余视觉 patch 时,必须保护承载指令和关键语义的锚点;跨会话复用还要考虑位置编码、隔离与隐私边界。
与永久剪枝不同,运行时稀疏按输入难度决定执行深度和连接密度:容易样本提前退出,稳定的视频帧跳过部分层,复杂目标再动用完整路径。它能让计算资源跟随样本而非固定最坏情况分配,但需校准退出置信度,防止“看似容易”的高风险输入被过早终止。
算法层的共同逻辑是尊重各模态的冗余不对称性:稀释冗余视觉/音频信息,同时保护稠密文本语义和跨模态锚点。理论 FLOPs、模型体积和真实服务延迟是不同指标,最终必须回到硬件和任务上测量。
当模型进入持续对话、实时视频或边缘设备,主要瓶颈会从算术运算转为显存、I/O、调度和数据移动。系统层把“可计算”变成“可交付”。
图4|系统层弹性资源编排。围绕 KV 缓存与服务、边云协作、延迟敏感调度、软硬件协同四条主线,将模型与算法层的理论收益转为实际吞吐和响应速度。图片来源:原论文图5。
多请求并发时,KV 块的物理布局、碎片与冷热迁移直接影响最大批量和响应时间。动态缓存池按请求生命周期管理显存,跨会话共享前缀则避免重复预填充。论文提及面向长上下文的分层缓存与持续状态方案,重点不只是“把 KV 压小”,而是让它成为可调度、可复用的资源。评估时应同时报告峰值显存、吞吐、首 token 延迟及长尾延迟。
边缘设备贴近传感器、响应快,却受功率和计算限制;云端推理强,但上行带宽与隐私约束更严。典型做法是边端先筛帧、提特征、处理简单样本,再把不确定或复杂请求上送;云端更新能力后回传轻量适配。这里的效率包含通信量、断网可用性和数据暴露,不只是两台设备上的 FLOPs 相加。
视觉编码和语言预填充往往耗时不同,串行执行会让某一计算单元等待另一模态。异步流水线可交错不同请求的编码、预填充和解码;按任务复杂度分层路由可满足服务等级约束。综述引用 RServe 的同设置实验说明并行编排可提升吞吐,但加速倍率不能脱离硬件、负载和批量条件复用。
算子需求不同:某些大矩阵乘法受计算单元限制,高分辨率特征与注意力则可能受带宽限制。软硬件协同把不同模态的算子映射到合适处理器,尽量减少数据搬运;也可把实际延迟、能耗和峰值内存纳入架构搜索。若某个 3-bit 格式或非规则稀疏在目标设备上没有原生支持,论文里的理论压缩就未必是部署收益。
系统层不是前两层做完后的“工程收尾”。它反过来约束模型拓扑和算法形式:能被融合的核、规则的数据布局、可共享的缓存,往往比纸面上更低的运算量更重要。
论文以高效 MLLM 为 MAS 的综合案例。早期 BLIP-2、LLaVA 等聚焦冻结骨干与轻量接口,解决跨模态对齐训练成本;随后关注视觉 token、KV 与生成延迟,通过压缩和动态执行控制运行成本;近年更强调端云分工、缓存共享、服务调度与硬件适配。这个时间线反映研究焦点的迁移,不是说早期模型已过时,也不等于每个新方法仅属于一个层级。
图5|代表性高效 MLLM 的时间线。原图按主要优化层级标色:绿色为模型层、蓝色为算法层、橙色为系统层。它用于观察研究主题变化,不代表完整模型清单或统一性能排名。图片来源:原论文图6。
稀疏专家使总容量与活跃计算分离;紧凑视觉编码需要能接住它的算子与调度;缓存复用必须与 token 筛选、位置处理相容。作者把这类架构—执行—系统联合设计视作下一阶段重点。所谓自调节计算,是根据输入难度、实时预算与设备状态动态决定“算什么、怎么算、在哪里算”的研究方向,而非已经普遍实现的产品能力。
语音、表情与文本共同提供情绪线索,响应必须及时,还涉及敏感个人数据。轻量适配、动态片段筛选、端侧推理应一起评估;常用基准包括 CMU-MOSI、CMU-MOSEI、IEMOCAP。对短促情绪变化不能过度压缩。
视觉—语言—动作闭环受感知到执行延迟约束。应优先保持动作相关的视觉细节,并把高成本编码与动作解码流水化;R2R、ALFRED、Ego4D 等分别覆盖导航、指令执行或视频活动理解。真实机器人还需关注功率和安全失误,不应只看离线准确率。
长视频和连续音视频的瓶颈是时空冗余与上下文显存。关键帧/片段选择、缓存复用和冷热状态分层尤其重要。Video-MME、MVBench 等能测理解能力,但完整服务评测仍应补上输入时长、峰值显存和流式延迟。
医学影像、报告、语音和传感器数据要求细节保真、可解释与隐私保护。过激量化或 token 筛选可能漏掉微小病灶;本地部署与联邦协作降低原始数据集中风险,但不能替代诊断校验。MIMIC-CXR、IU-Xray 等只覆盖部分任务情境。
自动驾驶和三维场景处理相机、雷达、点云及定位信号。把稀疏 3D 点云组织成鸟瞰图等紧凑结构,可改善计算布局,但同步和几何精度必须保留。nuScenes、Waymo Open Dataset 等基准应与车载硬件的端到端延迟、能耗共同看。
图表、视觉问答、数学和科学问题不仅要“看见”,还要逐步验证。模块化感知与程序化工具调用可把昂贵推理留给真正困难的子问题;VQAv2、ScienceQA、MathVista、ChartQA 关注能力侧,部署侧还要核算每题延迟及错误路径代价。
多医院或多设备合作训练时,可只同步提示、适配器等小参数,而非上传原始数据或完整模型。缺失模态与设备异构会影响对齐;本地保存数据也不自动等于隐私安全,仍需差分隐私、安全聚合和攻击测试。论文以 FedMultimodal、Med-MMFL 等作为相关评测资源。
跨层收益并非三项单独加速的简单相加。统一编码器改变了量化、剪枝面对的特征分布;结构化稀疏便于硬件核利用;算法压缩只有与内存布局、缓存生命周期匹配,才可能变成真实壁钟时间优势。这也是论文最有实践价值的判断:把 FLOPs 优化置于完整执行链中验证。
对机器人、自动驾驶等延迟优先任务,重点是边端感知过滤、流水线重叠和稳定的最坏情况时延;对医学影像等保真与隐私优先任务,应保护关键通道精度、审核压缩引起的细节损失,并用受控协作降低敏感数据流动;对云服务等吞吐优先任务,稀疏专家、共享状态与显存池有更大价值。最优方案是具体约束下的效率—效用—隐私折中,而非一套固定技巧。
论文展望系统把成本和设备状态纳入自身决策,按不确定性动态调节输入粒度、计算深度和执行位置。要从愿景走向可靠部署,还需要成本可观测、策略可校准,并对高风险样本设置不随意退出的约束。
图片、声音、视频和文本不必全部强行转成同一种离散词元,但它们需要可共享的语义接口和可控的序列长度。未来方向包括连续潜空间、共享码本、可变速率压缩,以及让分词/切片策略与缓存调度共同设计。
在视觉—语言任务上省算,不代表缺失音频、换传感器或跨领域时仍有效。需要检查模态缺失、分布偏移和任务切换条件下的能力与资源曲线,避免优化只适配某个数据集。
交叉注意力、动态模态切换和稀疏路由,对编译器和加速器提出不同于纯文本模型的要求。亟须硬件友好的稀疏模式、融合算子及端云弹性编排,让算法节省真正落到设备上。
用户感知的首响应时间、交互流畅性和延迟尖峰,与平均吞吐同样重要。对某些任务,轻微且不可察觉的精度退让可能换来更好的实时体验;但公平性和可解释性不能被纯资源指标掩盖。
端侧部署减少数据上云,不代表免于模型提取、侧信道或物理篡改。压缩也可能改变攻击面。效率、效用与隐私应共同建模;医疗影像和声纹等敏感模态尤其不能把“本地运行”直接等同于“合规安全”。
FLOPs、参数量只能描述局部成本,还应报告真实端到端延迟、首 token 时间、尾延迟、峰值显存、带宽、每次推理能耗、跨模态同步开销和任务质量。不同应用要在共享任务协议下给出硬件、批量与流式条件,避免把不可比数字当成统一榜单。论文希望形成类似多模态效率版 MLPerf 的部署感知评测。
这篇综述把高效多模态学习从“压缩某个模型”的问题扩展为完整计算栈设计:模型层规定结构,算法层管理信息流,系统层兑现性能。MLLM 演进、应用差异及挑战都指向同一个结论:只有跨层协同,才能在实际设备和隐私约束下取得可靠效率。它提供的是分类与设计路线图;具体方法是否优于另一方法,仍需在同一任务、硬件和预算下实测。
原文的社会影响讨论同时指出两面性:效率研究可降低高能力模型的使用门槛与能耗,但也会降低滥用成本;边缘智能减少传输,却增加本地攻击暴露。附录 A 给出边缘系统案例,附录 B 汇总近期高效多模态模型,附录 C 比较已有综述。本文为控制篇幅不逐表转录,完整文献与附录请查阅文首 PDF 和项目资料库。
当人伸手拿起杯子时,通常不会在脑海中生成一段高清操作视频,而是预估重量、抓取阻力和接触结果,据此调整动作。这个例子提示我们:世界模型的价值,在于预测能帮助智能体做什么,而不只在于画面看起来有多真实。
《World Models for Embodied Intelligence: From Plausible to Controllable to Actionable》提出一条面向决策的能力阶梯:模型首先要保持任务相关状态的一致性,其次要正确预测不同干预的影响,最终要把预测转化为可测量的行为或学习收益。本文将三层分别表述为“可信预测”“可控干预”和“行动效用”。这里的“可信”限定于被测试的状态、时域与条件,并非对模型整体可靠性的保证。 综述进一步用几何、物理、动作三个落地维度,与数据、奖励、策略、模型自身四种改进闭环组成一个三乘四矩阵,分析预测内容如何进入机器人系统。它覆盖操作、自动驾驶、导航、运动控制及跨机器人迁移,并提出与能力声明相匹配的评测要求。 下面沿用原文 11 个主体章节和小节顺序展开。配图截取自原文,保留图内文字,图注采用中文。本文介绍的是作者提出的综述框架;文献在分类中的位置不代表所有能力均已验证,也不构成统一条件下的性能排名。 论文信息
英文题名:World Models for Embodied Intelligence: From Plausible to Controllable to Actionable 作者:Nanjie Yao、Hao Wang、Chong Cheng、Zhikang Chen、Wenzhe Li、Jiafei Lyu、Li Shen、Peilin Zhao、Zongqing Lu、Gao Huang、Steven Hoi、Dacheng Tao、Deheng Ye。 作者单位包括香港科技大学(广州)、牛津大学、普林斯顿大学、腾讯、中山大学、上海交通大学、北京大学、清华大学、阿里巴巴、新加坡管理大学和南洋理工大学。论文为 arXiv 预印本,首次提交于 2026 年 9 月 15 日,PDF 共 51 页,含参考文献。 论文主页:https://arxiv.org/abs/2609.16697 原文 PDF:https://arxiv.org/pdf/2609.16697 项目页面:https://3dagentworld.github.io/EmbodiedWM/
视觉—语言—动作模型让机器人能够从多模态观测和指令直接产生动作。但直接映射没有自动提供维护隐藏状态、预见延迟后果和比较候选干预的机制。这些能力在部分可观测、接触丰富和长时序环境中尤其重要。 世界模型连接感知与决策:保持任务相关信息,预判行动后果,并在执行偏离预期时支持修正。既有综述常按架构、输出模态或应用领域整理研究;本文则追问,各种预测能力是否足以支持更好的具身行为。 作者提出三个逐步增强的要求:保存正确的状态;对干预作出正确响应;使预测产生下游收益。这个视角允许潜在动力学、视频生成、三维预测、物理建模和世界—动作模型在同一框架下比较,同时把几何、物理、动作接口与实际改进路径联系起来。
图1|综述总览。从历史观测出发,模型保持任务相关状态,比较同一初始状态下的不同干预,再通过预测改善决策;真实执行反馈进入数据、奖励、策略和模型自身闭环。几何、物理与动作落地贯穿三层能力。来源:原文图1。
早期视觉前瞻研究将机器人动作与未来像素预测连接,并在模型预测控制中反复规划。PETS 引入概率集成与轨迹采样处理不确定性,PlaNet 将规划转向紧凑潜在状态,Dreamer 系列进一步在想象轨迹中训练策略。 另一条路线强调决策等价性。MuZero 等模型无需重建观测,而是保留搜索和价值估计所需的内部结构。由此,世界模型不必复现完整外部世界,只需保持与预测和决策相关的信息。短想象时域、保守目标和真实数据校准则用于限制策略利用模型错误。
本文将世界模型定义为学习式或混合式的智能体—环境动力学预测模型:给定交互历史及可选候选动作,预测任务相关环境变量如何变化。预测状态可以是像素、特征、对象、几何、物理量、符号状态,或奖励与价值等决策相关量;解码回图像并非必要步骤。 学习仿真器是通过可重复轨迹接口暴露的世界模型;世界—动作模型则通过级联、共享表示或联合生成紧密连接预测和动作。纯反应式 VLA 不在本文操作性定义范围内,只有当可识别的未来预测机制影响动作、学习或执行时,才进入分类。奖励与评论家模型也仅在评价预测转移、想象轨迹或模型不确定性时纳入讨论。
表示选择有三组独立维度:预测空间是观测、潜在状态还是结构化对象;预测内容是外观、几何、物理还是任务量;时间与动作接口是单步、动作块、子目标或长轨迹,以及显式动作、潜在动作或高层技能。 这些选择决定模型如何被查询,却不决定能力强弱。三维输出不自动可靠,高清像素预测也可能服务规划。应分别验证状态一致性、干预准确性与决策收益。
“落地”指预测与可测量具身属性之间明确、可检验的对应。几何维度关注对象身份、位置、遮挡和跨视角一致性;物理维度关注接触、碰撞、摩擦、力和材料响应;动作维度关注命令身份、时序、幅度、组合、坐标系和机器人平台。 可信预测层要求未来与历史和相关环境结构一致。最低证据是,在离线或开环测试中,至少一种任务相关状态属性随时间保持一致。应报告误差随预测时域的曲线,让漂移可见。 可控干预层要求改变动作时,模型预测的变化与实际执行变化一致。需要同一初始状态下的配对或分支干预,而不是仅改变提示词后得到不同画面。记录动作上的条件预测仍可能存在混杂,不能直接证明因果响应。 行动效用层要求预测改变决策或学习更新,并在匹配控制器及计算预算下改善结果,如成功率、安全、恢复、策略排序或真实数据效率。定性想象视频不足以支持这一层。 三层在要求上累积,但实际论文可能展示高层用途、却未检验某项低层能力。下游成功不能反推对象恒存或动作因果效应已被完整验证,应明确列出未测试部分。
矩阵行表示预测的内容,列表示预测改变的系统环节。它描述可能的接口,不是互斥类别,也不是能力等级。 | 落地维度 | 数据闭环 | 奖励闭环 | 策略闭环 | 模型自身闭环 | | --- | --- | --- | --- | --- | | 几何 | 采集新视角、遮挡与拓扑变化 | 评价碰撞、可见性与可达性 | 选择可行路径与对象关系 | 修正地图、身份和持久场景状态 | | 物理 | 采集接触、滑移、形变和罕见失败 | 评价稳定性、能耗与力限制 | 避免物理不可行或危险行为 | 修正局部动力学并检查退化 | | 动作 | 采集时序、幅度或平台不同的干预 | 评价命令遵循、进展与风险 | 从有支持的反事实结果选择动作 | 修正动作语义、延迟与转移偏差 | 一项方法可以跨多个单元格。进入某条改进路径只说明预测被使用;是否带来行动效用,仍需与匹配基线比较。
C-SWM 用对象表示和关系网络描述状态,SlotFormer 在对象特征上预测动力学。联合嵌入预测路线则保留特征预测原则,不必显式拆分对象或重建像素,代表性研究包括 V-JEPA 等。 这一阶段减少预测目标的规模,并保留实体、关系或任务特征。但对象槽位不是场景中的度量位置,紧凑表示仍可能难以区分位置漂移与对象丢失。
OccWorld、MUVO 等将未来放入三维占用空间;鸟瞰、点云和高斯表示进一步使深度、占用或位移成为可量化目标。几何约束还能通过中间特征对齐和跨视角监督进入视频模型。 PointWorld 等把状态和动作关联到三维点流,便于检验空间变化。代价是表示随空间范围和预测长度增长;邻近视图一致也不代表离开场景后重访仍保持同一世界。
几何一致的场景仍可能出现穿透、失去支撑或不合理材料响应。IntPhys、PHYRE、CLEVRER 和 Physion 等提供将物理事件与画质分开检验的资源。 方法可以通过方程约束、对象局部动力学、粒子表示或物理相关辅助任务限制状态演化。PhyDNet、ParticleFormer 等体现不同归纳偏置。关键是把接触、摩擦、力和材料响应变成可评价变量,而非仅把物理合理性留给观看者判断。
持久场景或空间记忆存储并检索过去内容;长上下文状态空间模型和蒸馏则延长可承载时域。两类机制可以互补,但生成更长视频与保持状态一致是不同结论。 真正的检验是:对象离开视野后再出现,是否仍为同一身份、同一位置,并保留无法确定部分的不确定性。仅出现一幅类似旧画面的新图像,不等于记忆恢复。
图2|可信预测层。从紧凑潜在/对象状态,到度量几何、物理交互约束和持久记忆,逐步扩展可测试的状态内容。该图是概念组织方式,不是所有模型必须具备的组件清单。来源:原文图3。
模型接收电机命令、末端轨迹或驾驶动作,再预测后续状态。SAVP、FitVid、IRASim,以及驾驶领域的 GAIA-1、DriveDreamer 等展示不同接口。ACT-Bench 则将动作遵循单独作为测量目标。 接受动作输入不代表使用动作,更不代表正确执行其语义。模型可能忽略命令,仍输出自然流畅的视频,因此必须把场景真实感与命令响应分开评测。
Genie、LAPA、AdaWorld 等从无动作标签视频恢复潜在控制变量;其他方法用键盘、语言或目标图像指定干预,降低对平台专属标签的依赖。 语言组合和潜在动作扩大了控制集合,但命令进入模型内部单位后,实际效果更难直接测量。仍需建立潜在变量或语义意图与真实状态变化、机器人动作之间的对应。
相机位姿、对象路径、三维流、关节构型和接触力等变量可由外部传感器或标注测量,让请求变化与实现变化处于相同单位。MagicDrive、3DFlowAction、PIN-WM 和视觉—触觉方法体现这些方向。 对象运动接口还可以将命令与特定硬件分离,但获取几何、力或重建监督需要成本。一个可迁移的接口也仍需验证其在目标平台上的执行可达性。
交互式展开让策略根据模型生成的观测继续选择动作。Ctrl-World、iVideoGPT 等提供这样的预测环境;GR-1、PAD、UWM、WorldVLA 等进一步连接未来与动作输出。 新要求是,模型必须在策略自行访问的状态分布上保持忠实,而不只是预测数据集中记录的命令。联合训练也不必意味着推理时生成完整视频,部分设计可以直接解码动作。
图3|可控干预层。控制从显式动作扩展到潜在、语言和目标接口,再落到可测量几何/物理变量,最终支持策略交互与动作生成。可控性要求实现变化匹配干预,同时未受影响的状态保持一致。来源:原文图4。
外部策略或提议器生成候选行为,世界模型预测后果,评分机制决定选择。搜索对象可以是动作、子目标、位姿或符号状态。WorldPlanner、STORM、DINO-WM 等分别探索搜索、候选策略和特征空间规划。 效用不只取决于平均预测误差,还取决于是否保留了决定候选排序的关键差异。每个候选都会消耗模型调用,因此必须在固定预算下报告成功、规划遗憾和延迟。
预测可以作为预训练目标提升样本效率,也可以把生成未来转换为动作,或通过未来嵌入约束策略内部表示。FLARE、JEPA-VLA 等体现无需显示未来的预测策略;DreamZero 等世界—动作模型连接两种输出。 ForeWAM、Fast-WAM 等研究进一步追问,收益来自训练时的预测结构,还是运行时显式想象。能否省去渲染未来,应由行为收益与延迟共同决定。
在训练用途下,策略进入想象环境并依据奖励更新,要求模型对策略实际访问的状态保持可靠。在评估用途下,模型需要给出与真实执行一致的策略排序和结果估计。 WorldEval、WorldGym、WorldArena 等探索生成式评估与功能测试。重要边界是:训练策略的同一个模型不能单独为该策略提供独立认证,因为策略可能已经优化到模型误差上。需要真实结果、固定审计或独立验证信号。
论文区分四种逐渐增强的声明:诊断失败原因;在执行中检测失败;修改尚未发出的动作;回到可以继续任务的状态。只有报警不等于成功纠正,更不等于恢复。 CheckVLA 等比较预测与观察转移,FAWAM 等以末端力/力矩捕捉图像难以显现的接触错误。VLA-Corrector 等截断过时动作并生成后缀,CycleVLA 等则回退到早期子任务。预测残差因此成为控制信号,但必须及时到达,并统计误报、额外动作和恢复代价。
图4|行动效用层。预测可支持候选选择、动作解码、策略训练/评估,以及运行时验证、纠正和恢复。四个区域代表替代性的功能位置,不是必须串联执行的固定流程;箭头表示阅读顺序。来源:原文图5。
世界模型通过获取、生成和筛选轨迹改变训练经验。DreamGen、GigaWorld-0 扩展合成覆盖,Dream2Fix 等生成配对失败与纠正轨迹,帮助补充成功示范缺少的监督。 一次生成数据不等于持续误差驱动采集。闭环应证明后续样本针对预测盲区,并用独立检查验证覆盖。典型失败是数据逐渐收缩到当前模型擅长生成的场景;有效性应按单位真实交互带来的留出能力提升衡量。
预测被压缩为进展、可行性、回报或风险分数,用于提供密集反馈。RISE 将动力学和进展价值联系起来,世界模型式评论家则利用未来结构支撑价值估计。 危险在于策略学会满足评分器,而非完成真实任务。平均评分准确也可能颠倒最重要的两个候选,因此要在策略生成动作上检验预测评分与真实结果的排序和校准。
想象轨迹用于标注、练习、筛选或规划行为。World4RL、WoVR 和 WorldSample 等讨论如何使用不完美动力学,并选择哪些合成经验进入训练。 模型支持范围的门槛过严会丢弃有用经验,过松会接受不可信状态。应报告被接受的想象数据比例,并在匹配采样和计算预算下测量目标环境回报,避免只在模型内部改善。
预测误差或验证结果触发参数、状态、记忆或不确定性的修正。更强架构本身不是闭环,更新必须针对诊断出的弱点。RLVR-World、World Action Verifier 和 World-VLA-Loop 展示不同反馈路径。 模型与策略交替更新会让归因困难:模型看似更准,可能只是策略避开难预测状态;策略看似更好,也可能利用了新偏差。应同时检查诊断失败上的增益和固定审计集上的退化,持续改进需要多个更新周期的证据。
接触、摩擦、抓取位姿和力轨迹决定操作成败。触觉、点云和末端力预测使视觉难以表达的错误显现。长任务还要求诊断失败并找到可恢复状态。 测试应覆盖刚体与可形变物体、单臂与双臂、正常与扰动执行,并记录子任务进展,以区分规划失败、执行失败和恢复失败。
道路几何、多智能体意图、交通规则和自车控制必须共同保持。多个安全未来都可能成立,因此单条记录轨迹的偏差不宜成为唯一标准,概率应覆盖可行未来并保留关键风险。 闭环报告应包括路线完成、碰撞、舒适度、违规、人工干预和延迟,罕见事件单独统计。生成式仿真器与真实道路行为的一致性,也是评测可信度的一部分。
导航要求地点和对象离开视野后,空间信念仍然稳定,并能处理回环和视觉混淆。未来可见性、可通行性和目标进展比地图画得多完整更直接影响行为。 基准应将地图准确度与导航效用分开:完整地图不一定带来更好选择,紧凑信念也可能足够支持目标到达和探索。
运动控制受控制时钟约束,关注短时域身体动力学、地形接触和稳定性。紧凑状态常比视频解码更合适,效用由回报、跌倒率、约束违反和地形适应衡量。 慢速视觉预测可服务高层规划,快速动力学模型负责底层反馈。分层系统需对齐状态时间戳和不确定性,并分别报告感知、预测、规划与控制频率。
表示、动力学、动作语义和决策逻辑是不同迁移对象。对象恒存和自由空间可能较易共享,接触动力学需要考虑材料、工具和执行器差异;同一语言目标也不代表相同动作实现。 可采用三个协议:固定任务换机器人;固定机器人换对象、场景或动力学;同时改变二者。每项都应说明冻结和适配模块,以及消耗的真实转移数量。共享接口与测得迁移效果是两个声明。
轨迹应连接初始状态、观测、动作、时间及结果,还可包含目标、相机标定、深度、本体状态、力、声音、奖励、失败起点与恢复结果。RoboNet、Open X-Embodiment、BridgeData V2 和 DROID 提供不同动作对齐资源。 跨平台使用必须保留控制频率、坐标系和原始动作定义,归一化向量不自动构成共享干预。成功示范不足以训练恢复,应补充失败原因、可恢复状态、纠正动作和最终结果。可重置仿真器支持同状态不同动作的分支数据。
可信预测测试固定上下文下的未见轨迹,结合画质与对象、位置、深度、占用、接触等状态指标,报告漂移曲线、遮挡后记忆和不确定性校准。 可控干预测试从同一状态改变动作、时序、力或路径,并比较预测与执行。应保留未受影响区域的一致性,加入无动作、掩蔽、打乱和错误动作对照,以检验模型是否真正使用命令。 行动效用需要匹配基线。规划报告成功、遗憾、调用次数和延迟;强化学习报告真实回报、交互量和约束成本;策略评估报告真实结果排序相关性;验证报告精确率、召回率、误报与检测延迟;恢复报告条件成功、保留进展、耗时和安全违反。
预测状态应尽可能在可执行环境中验证;同起点开放动作分支;画质与功能分开报告;扰动可重复;记录墙钟时间与模型调用。额外相机、特权状态和额外计算都应计入资源条件。 不确定性需按时域和动作检验,并报告固定覆盖率下风险。生成样本的多样性不等于可信不确定性:样本必须覆盖可行结果,并保留其风险关系。
挑战是构建可修正的持久状态,在加入新观测时不重写已经一致的历史,并在隐藏信息无法确定时保持不确定性。遮挡—重现测试应同时追踪对象身份、位姿及质量、摩擦等物理属性,记录错误何时出现和能否修复。
专家会根据环境选择合适动作,使动作与结果存在混杂。模型可能复现常见结果却忽略命令。需要固定初始状态、单变量动作扰动和失败分支,并在跨机器人时同时检验高层意图与平台特定实现。
动作响应正确的模型仍可能太慢,或错过改变候选排序的小差别。未来应研究保留价值、可行性和安全信息的决策压缩,并在固定计算预算下测试规划遗憾,比较视频、潜在、对象和三维接口何时有效。
几何、物理和动作模块需要在状态、时间与不确定性上保持一致,而非仅拼接特征。应测试轴间冲突:空间可达但抓取不稳,物理可行但违反指令,或坐标系改变后动作失效。这比单独验证每个模态更能揭示接口问题。
策略更新会改变访问状态,让旧校准失效。低置信度时,系统需要明确采取缩短预测、保守评分、采集数据、切换策略或停止等行为。 四种闭环也可能让错误循环传播:合成数据带入伪影,评分器奖励伪影,策略进一步寻找伪影。应经过多个更新周期测量收益、退化、多样性和真实交互成本,并保留生成器不能查看的动力学与失败审计集。
共同评测层可测状态稳定、干预一致、决策遗憾、校准与闭环效用,领域层再加入接触力、跌倒、地图或驾驶指标。真实实验应报告足够试验和不确定性,覆盖变异与罕见失败。 异步系统还需明确时间戳、已提交动作前缀、取消规则和延迟契约,测试可变推理时间与传感器延迟。复现材料应包含动作接口、数据过滤、计算预算、种子和失败案例;仅发布权重不足以复现能力声明。
世界模型对具身智能的价值,取决于预测如何改善行为。本文提出的三层能力,将状态一致性、干预保真度与下游效用分开;三乘四矩阵进一步说明预测内容如何进入持续学习与执行。 这套框架支持能力声明的定性比较,但不同文献的异质评测限制了直接性能比较。未来进展需要在明确的数据、计算与延迟预算下,证明落地预测能够改善闭环行为,并通过独立测试维持改进闭环的稳定性。 论文主页:https://arxiv.org/abs/2609.16697 原文 PDF:https://arxiv.org/pdf/2609.16697 项目页面:https://3dagentworld.github.io/EmbodiedWM/
论文题目:Causal Inductive Biases for Learning Structured World Models 作者:Anson Lei 机构:Mansfield College, University of Oxford 学位:Doctor of Philosophy 时间:Michaelmas 2025 论文链接:https://ora.ox.ac.uk/objects/uuid:e14fe66f-83bf-4faa-a658-b87e3a168f55/files/dj38607754
世界模型是强化学习与智能体研究中的核心范式:如果智能体能学习一个环境预测模型,就可以在想象中推演未来,从而进行规划和决策。过去几年,世界模型在游戏、机器人和视觉控制中表现突出,但很多方法仍采用密集、整体式的神经网络结构,把环境动态压缩进一个难解释的黑箱。 这篇 Oxford 博士论文提出一个清晰问题:真实世界往往由稀疏、局部、可复用的因果机制组成,那么世界模型是否也应该显式利用这种结构?作者围绕“因果归纳偏置”展开,试图让模型不仅预测准确,还能更好地适应分布变化、抵抗无关干扰,并提供可解释的内部结构。 论文主体由三条技术路线组成。第一,VCD 将潜在变量学习、稀疏因果图和变分世界模型结合起来,使模型能学习更解耦的表示并进行模块化适应。第二,COMET 用 competition-of-experts 机制学习可复用的独立动力学机制,再在新环境中组合这些机制。第三,SPARTAN 使用稀疏注意力学习局部因果依赖,把结构发现嵌入 Transformer-like 世界模型。最后,论文还把 SPARTAN 扩展到强化学习优势估计和语言模型机制可解释性,展示稀疏结构不只适用于世界模型,也可能成为更通用的可解释建模工具。 这篇论文的价值在于,它没有把世界模型只看作“预测下一个状态”的网络,而是把它看作对环境结构的学习:哪些变量真正相关,哪些机制在不同环境中保持不变,哪些局部交互决定未来。对于希望构建可迁移、可诊断、可解释智能体的人来说,这是一条非常值得关注的路线。
世界模型通常由表示模型、动力学模型和规划或策略学习模块组成。表示模型把高维观测压缩为潜在状态,动力学模型预测潜在状态如何随动作和时间演化,智能体再基于预测结果进行决策。
然而,真实环境并不是一个均质整体。物体之间通常只发生局部交互,一些因果机制在环境变化时保持不变,另一些机制会因干预而改变。比如物体碰撞、弹簧约束、交通参与者之间的相互影响,都具有稀疏性和模块性。 论文认为,如果世界模型能够显式表示这些结构,就能获得三类优势:适应性、鲁棒性和可解释性。适应性来自只更新受干预影响的机制;鲁棒性来自忽略非因果干扰;可解释性来自可以查看潜在变量、机制模块或稀疏注意力边。
作者把论文组织成七章。第 1 章给出动机和贡献,第 2 章回顾世界模型、结构与因果、相关工作;第 3 章提出 Variational Causal Dynamics;第 4 章提出通过竞争学习独立机制的 COMET;第 5 章提出用稀疏 Transformer 学习局部依赖结构的 SPARTAN;第 6 章展示稀疏 Transformer 在世界模型之外的两个案例;第 7 章总结贡献、局限和未来方向。 整体看,论文试图回答三个递进问题:如何学习因果表示,如何学习独立机制,如何发现局部依赖结构。VCD、COMET 和 SPARTAN 分别对应这三个问题。
早期世界模型常把观测压缩到一个连续潜在空间,再用递归或前馈动力学网络预测未来。这种方式可以提高计算效率,但潜在变量未必对应真实世界中的可解释因素。对象中心表示学习试图把场景分解为 object slots,让每个 slot 对应一个物体或部件;但仅有对象分解还不够,模型还需要理解对象之间如何交互。 论文将这个问题放入因果建模框架。因果图中的每个变量由父变量和对应机制决定,环境变化常可视为对少数机制的干预。独立因果机制原则认为,不同机制可以相对独立地变化;稀疏机制转移假设进一步指出,分布变化通常只影响少数机制。因此,如果世界模型显式学习稀疏因果结构,就有机会在新环境中只更新必要部分。
论文综述了三类关键结构偏置。第一是因果表示学习,即让潜在变量对应真实因素,并让动力学图尽可能稀疏。第二是独立机制学习,即把环境动力学分解为可复用的交互原语。第三是结构发现,即在复杂场景中识别哪些实体之间存在局部依赖。 这些偏置共同指向一个目标:让模型的计算结构更接近世界的生成结构。论文后续三章分别从不同角度实现这一目标。
VCD 面向的核心问题是:能否同时学习潜在表示和稀疏因果动力学,使世界模型在环境变化时进行模块化适应?它以潜在状态空间模型为基础,但不把动力学建成一个整体网络,而是把潜在变量视为因果变量,每个变量只依赖其因果父节点。
VCD 的动力学模型由独立机制、稀疏因果依赖和稀疏干预三部分构成。不同环境共享未受干预的机制,只为受干预变量学习环境特定参数。这样,当模型进入新环境时,它不需要整体重训,而是识别变化发生在哪些机制上,并只更新相关部分。
作者在二维多体模拟环境上评估 VCD。环境包含多个粒子,粒子之间通过类似弹簧或电磁力的交互影响彼此,动作则对其中一个粒子施加外力。实验包含混合状态观测和图像观测两种设置,并与 RSSM 和 MultiRSSM 比较。
结果显示,VCD 在预测误差上优于整体式 RSSM,并能达到或接近多模型专家式 MultiRSSM 的表现。更重要的是,VCD 学到的表示更解耦,能更准确识别稀疏因果关系和干预目标。论文报告的 modified MCC 中,VCD 在 mixed-state 设置达到 0.975,在 image 设置达到 0.908,均显著高于 RSSM。 这一章的关键结论是:稀疏因果图不仅能提高可解释性,也能作为学习解耦表示和模块化适应的归纳偏置。
VCD 强调潜在变量和因果图,COMET 则进一步关注动力学机制本身。人类理解世界时,往往会把变化归结为可复用规则:碰撞、堆叠、滚动、吸引、排斥、速度限制等。这些规则可以在不同环境中重新组合。 COMET 的目标是学习一组独立参数化的机制模块,并在新环境中组合它们。它采用两阶段训练:第一阶段是竞争,让多个机制解释来自多环境的数据,预测误差最低的机制获得更新;第二阶段是组合,在新环境中学习如何选择和组合这些已学机制。
COMET 的优势在于,它不是为每个环境训练一套完整动力学模型,也不是用一个整体网络平均所有环境动态,而是学习跨环境可迁移的交互机制。进入新环境后,模型可以少量数据学习机制组合,而不是重学全部动力学。 实验显示,COMET 能在图像观测环境中学习可识别的机制,并在物体数量变化的新环境里用更少样本完成适应。论文也指出,竞争机制并非没有难点:如果初始阶段某些机制过强,可能垄断更新,导致其他机制难以学习;因此 warm-start 和机制有效时间范围等设计会影响训练稳定性。 这一章的贡献在于说明,结构化世界模型不只需要“变量解耦”,也需要“规则解耦”。当环境变化可以被解释为机制重新组合时,机制级模块化比整体参数更新更自然。
第 5 章提出 SPARTAN,解决固定全局因果图在复杂物理环境中不够灵活的问题。在真实场景里,并不是所有对象始终相互作用。一个物体在某一时刻只与附近对象产生因果关系,而这种关系会随状态变化。因此,局部、状态依赖的因果图比固定全局图更合适。 SPARTAN 使用稀疏硬注意力来学习对象之间的局部依赖。模型以对象嵌入为输入,通过稀疏注意力选择当前状态下真正相关的父节点,从而把 Transformer 的注意力模式转化为可解释的局部因果结构。
论文在 Interventional Pong、CREATE 和 Traffic 等环境上评估 SPARTAN。与普通 Transformer 和全局图基线相比,SPARTAN 在保持预测能力的同时,更准确恢复局部因果图,并在少量轨迹适应新环境时表现更好。
论文还通过移除非因果实体来测试鲁棒性。若模型依赖虚假相关,移除无关对象会显著改变预测;如果模型抓住真正因果父节点,则应保持稳定。结果显示,SPARTAN 相比非正则化 Transformer 更能抵抗这类无关干扰。 SPARTAN 的意义在于,它把 Transformer 的强表达能力与因果结构发现结合起来:注意力不再只是可视化工具,而是被稀疏约束塑造成可解释的局部依赖图。
第 6 章把 SPARTAN 拓展到世界模型之外。第一个案例是强化学习中的 Direct Advantage Estimation。作者使用稀疏 Transformer 从图像 patch 中同时学习价值函数和优势函数,并通过稀疏注意力识别哪些图像区域影响决策。
这种结构带来两个好处。第一,显式优势学习可以改善策略泛化。第二,稀疏注意力让人能够观察模型依赖哪些视觉区域,从而判断策略是否关注真正与任务相关的对象,而不是被外源奖励或无关背景吸引。
第二个案例是语言模型机制可解释性。作者将标准 Transformer 的 dense attention 替换为 SPARTAN 式稀疏硬注意力,并将其作为 post-training 技术用于 GPT-2 和 LLaMA-1B 等模型。实验表明,稀疏模型可以用更少 attention heads 解释相当比例的行为效应。 这说明稀疏注意力不仅可用于物理世界模型,也可能帮助构建更可解释的语言模型内部机制。论文强调这仍是初步探索,但方向很有启发:如果模型计算本身更稀疏、更局部,分析者就更容易定位真正起作用的组件。
这篇论文围绕一个核心主张展开:当模型计算结构尊重世界中的因果结构时,适应性、鲁棒性和可解释性会自然受益。VCD 展示了如何用稀疏因果图推动表示解耦和模块化适应;COMET 展示了如何通过竞争学习可复用的独立机制;SPARTAN 展示了如何用稀疏注意力发现局部、状态依赖的因果结构。 三者是互补的。VCD 偏向因果表示学习,COMET 偏向机制学习,SPARTAN 偏向局部结构发现。它们共同说明,结构化世界模型不应该只追求预测误差最低,还应追求能解释、能迁移、能在变化环境中快速调整。
论文也指出了重要局限。首先,许多实验仍依赖模拟环境和可控干预,真实世界中的观测噪声、部分可观测性和复杂交互会更难。其次,因果结构的可识别性依赖数据分布和归纳偏置,若真实机制高度耦合或图结构过密,稀疏假设可能失效。第三,SPARTAN 等稀疏结构在更大规模模型和真实机器人任务中的效果还需要进一步验证。 未来方向包括把三类方法结合起来:例如把 SPARTAN 的稀疏注意力正则与 VCD 的联合表示学习结合,把 COMET 的机制竞争引入 Transformer-like 架构,或者在机器人、自动驾驶和长期智能体任务中检验结构化世界模型的可扩展性。
这篇论文提醒我们,世界模型的目标不只是“预测未来像素”,而是学习世界如何组织自身。一个真正有用的世界模型,应该知道哪些变量重要、哪些机制可复用、哪些变化需要适应、哪些干扰可以忽略。因果归纳偏置正是朝这个方向迈出的一步。 对于智能体研究而言,这条路线尤其关键。未来的自主系统需要在变化环境中持续行动,如果它们的内部模型只是密集黑箱,就很难诊断失败、快速适应和安全部署。结构化世界模型则提供了一种更可控的可能:让模型不仅学会预测世界,也学会以更接近世界本身结构的方式理解世界。
论文附录提供了 VCD、COMET、SPARTAN 和第 6 章案例的推导、实现细节、数据集说明和更多实验结果。其中包括 VCD 的潜在空间可视化、COMET 的消融实验、SPARTAN 的超参数和数据集细节,以及稀疏语言模型的更多注意力模式分析。对复现实验或深入理解模型训练细节的读者,附录是重要补充。
在所有领域众多指挥、控制、通信、计算机、网络、情报、监视与侦察(C5ISR)能力中,可靠且有韧性地接入电磁(EM)频谱具有根本重要性。因此,在电子监视、攻击与防护领域开发和部署灵活的电磁战(EW)解决方案的需求日益增长,以应对现代网络化、多域战场空间中日益拥挤且充满对抗的电磁环境(EME)中快速演变的威胁。本文介绍了人工智能赋能的适应性多功能电磁战(ARES-EW)概念,该概念有助于提供(半)自主与认知电磁战能力。通过使用人工智能/机器学习,它最大化电磁战性能并减轻操作员工作量。在介绍完全软件定义的ARES-EW试验台之后,重点讨论用于被动电磁监视的射频指纹识别与辨识(RFFI)。我们给出了来自实测试验的示例性射频指纹识别与辨识结果,并概述了ARES-EW的未来方向。
ARES-EW是一种模块化、完全软件定义的方法,包含若干人工智能赋能的子系统能力;每个子系统都可被视为一项服务。它们可以单独或联合应用,以形成一个连贯的整体认知电磁战系统。图1在感知-决策-效果(SDE)循环的背景下描绘了各种此类子系统能力及其所采用的人工智能/机器学习,例如:
• 射频指纹识别与辨识:利用深度学习,在第3节中讨论。
• 检测器与参数估计:信号分离(例如雷达辐射的去噪与去交织)、检测与地理定位(例如视线角(LoB)估计)。对于低成本、未校准阵列,机器学习可以提供相比经典方法(如MUSIC、ESPRIT等)显著改善的视线角估计[2];ARES-EW同时应用两类技术。
• 认知干扰(决策):基于深度强化学习的闭环、完全自适应/认知电磁攻击(EA)[3]。干扰机利用可用的感知(与理解)功能持续评估电磁攻击对电磁环境和受害系统的影响,然后以机器速度确定最佳行动方案(COA)。
图1:感知、决策与效果循环背景下的ARES-EW概念。
例如,ARES-EW可以快速检测、通过射频指纹识别与辨识识别并利用基于机器学习的视线角估计定位电磁辐射源,然后引导认知干扰机自适应地瞄准该发射器。