摘要 随着人工智能(AI)赋能系统与人类操作员的融合日益深入,各领域对无缝协作的需求愈发迫切。精准的人类行为建模可使人工智能系统预判人类决策,并主动调整自身行为以辅助人类完成复杂任务。现有研究多聚焦于个体人类行为建模,本文则针对面向协作目标的异构团队内部人类行为进行建模。此类团队成员通常具备各异的技能、知识与认知水平,这些因素显著影响其决策过程。本文将团队行为建模为一种次优的混合式多智能体强化学习范式,通过融合集中式训练与“集中式/分散式”混合执行机制,模型能够刻画从完全集中式到完全分散式乃至中间状态的连续团队行为谱系。本文对各团队成员的认知水平与沟通能力进行了量化建模,实现了基于观测数据对上述参数的逆学习推断。数值实验验证了该框架在不同场景与团队构成下的鲁棒性与准确性,凸显了其在模拟复杂人类交互行为方面的有效性。
关键词:逆学习;多智能体强化学习;人类行为建模
图1 团队场景下人类沟通范围与认知范围示意图。位于中心位置的个体可与紫色智能体(处于沟通范围内)进行信息交互,并能观测到红色智能体(处于认知范围内)。
随着人工智能系统日益融入传统由人类主导的领域,实现人机高效协作变得至关重要。典型案例包括:网络空间内协助人类检测并抵御对抗攻击的人工智能系统(Sarker, 2023;Kazeminajafabadi和Imani, 2023);制造业中与人类协同作业以提升效率与精度的机器人(Matheson等, 2019);未知环境中由自主系统辅助人类导航与分析的人工智能驱动勘探任务(Wu等, 2019;Shafti等, 2020;Imbiriba等, 2019);以及灾害响应等场景中辅助关键决策的安全应用(O'Neill等, 2022;Unhelkar等, 2020)。因此,构建精准的人类行为模型是实现无缝人机协作的基础,有助于人工智能体预判人类行动,进而提升安全性与协作效能(Hong等, 2020;Lin等, 2024)。
近年来涌现出多种人类行为建模方法,包括通过监督学习模仿人类动作的模仿学习(Le Mero等, 2022),以及推断驱动人类决策潜在奖励函数的逆强化学习(Arora和Doshi, 2021;Hoffman等, 2024;Casper等, 2023)。其中,最大熵逆强化学习(Ziebart等, 2008)等代表性方法通过建模最大化奖励与熵的行为来处理不确定性。此外,生成对抗模仿学习(Ho和Ermon, 2016)利用对抗训练机制模拟人类行为。然而,这些方法主要设计用于个体行为建模,依赖于个体执行相似任务的轨迹数据,已广泛应用于自主导航(Vasquez等, 2014;Alali和Imani, 2024)、人机交互(Liu等, 2022)及博弈场景(Cao和Xie, 2022;Hosseini和Imani, 2024),其优势在于单智能体行为刻画(Wilder等, 2021)。尽管这些方法在个体建模上成效显著,但由于团队动力学的复杂性,将其拓展至多智能体场景仍面临挑战。
近期将逆强化学习拓展至多智能体场景的研究,旨在将单智能体模型推广至人类团队。然而,这些方法往往只能捕捉同质团队行为,即所有成员均在完全集中式或完全分散式模式下运作。集中式模型假定所有成员能够持续、完整地获取彼此信息(Natarajan等, 2010;Suresh等, 2024),但这在复杂的现实环境中并不现实——个体通常仅掌握局部或角色特定的队友信息(Zarei和Shafai, 2024)。另一方面,完全分散式模型(如基于QMix(Rashid等, 2020)或多智能体近端策略优化(PPO)(Yu等, 2022;Ahmad等, 2024)的模型)将团队视为孤立个体的集合,成员间不交换信息,亦不了解队友状态。此类模型同样无法反映真实人类团队的异质性,即成员在沟通技巧、知识储备与认知水平上的差异。这些属性显著影响团队内部的互动与决策过程,导致复杂的团队动力学,是单纯的集中式或分散式模型难以充分刻画的(Tabrez等, 2020;Zhang等, 2025;Iftikhar等, 2023)。
本文提出一种创新性混合框架,旨在解决现有团队动力学建模的局限性。该框架提供了一种灵活且鲁棒的模型,充分考虑了异构人类团队协作决策中个体差异化的认知水平与沟通能力。例如,部分成员可能与队友频繁交流信息,而其他成员则可能仅掌握有限的队友信息甚至一无所知。本模型重点捕捉影响人类决策的两大核心特征:认知水平,反映个体对队友状态的掌握程度;沟通能力,表征个体共享任务相关信息的广度。我们假设沟通围绕团队需协同完成的一组子任务展开,从而实现对团队高层共享心智的有效建模。模型采用集中式训练与“集中式/分散式”混合执行机制,能够学习适配不同认知水平与沟通技能的团队行为策略。基于可获取的观测状态序列数据,本研究构建了逆学习框架,以估算最能解释观测数据的全体成员认知水平与沟通能力参数。分析结果表明,完全集中式与完全分散式模型均为本文模型的特例,而所提模型能够覆盖更广泛的团队行为谱系。此外,本文还论证了代表个体决策随机性程度的人类理性水平如何影响团队建模性能。数值实验验证了该框架在不同团队构成与场景下的鲁棒性与适应性,证明了其在精准建模复杂异构人类交互行为方面的有效性。