通过观察智能体行为推断其目标,是人工智能领域的一项常见问题,被称为目标识别(GR)。在目标繁多且不断变化的动态环境中,该任务变得尤为艰巨。我们引入了通用动态目标识别(GDGR)问题,这是对GR的广义定义,旨在实现GR系统的实时自适应。本文提出了两种应对GDGR的新方法:(1)GC-AURA,利用目标条件强化学习泛化至新目标;(2)Meta-AURA,利用元强化学习适应新环境。我们在多种环境中对这些方法进行了评估,证明了它们在动态与噪声条件下实现快速适应及高GR准确率的能力。这项工作是在动态且不可预测的真实世界环境中实现GR的重要一步。
目标识别(GR)是人工智能(AI)的一个子领域,专注于根据观察到的动作推断智能体的目标。该任务在多个领域至关重要,特别是在人机交互[19,26,35]与多智能体系统[5,16,23,31]的应用中,预测其他智能体的目标与动作能使系统做出有效且恰当的响应。
GR是一个在线推理问题,然而近期的方法依赖于训练模型来学习与单一环境中预定义候选目标集相关的模式。尽管在有限场景下有效,但这类方法难以适应同一环境或全新环境中的新目标集,需要从头开始重新执行流程(例如,为每个新目标重新应用规划器或强化学习(RL))。这种重启会显著增加开销时间,使得这些方法在目标空间连续或需要快速适应具有不同目标与环境的动态变化GR问题的实时场景中变得不切实际。例如,在面向老年人或运动障碍者的辅助技术[14,19,36]中,机器人助手必须适应跨领域的目标变化:在一个任务中通过手势与上下文推断所需的烘焙原料,在另一个任务中利用类似线索与先验知识识别偏好的书籍。这些场景凸显了对自适应GR系统的需求,该系统能够跨任务泛化知识并将其迁移到新情境中。在实时应用中,此类系统无法承受每次都从头重新学习的代价。
本文通过以下方式向解决这些局限性迈出了第一步:(1)为新问题提供定义:通用动态目标识别(GDGR),这是对GR的推广,以解释不断变化的目标与领域;(2)概述GDGR的解决方案范式,命名为自适应通用识别算法(AURA);(3)提出AURA的两种实现,分别使用目标条件RL(GC-AURA)与元RL(Meta-AURA),以实现跨多个领域内多个动态变化任务的实时GR。
图1突出了GDGR与经典GR区别的三个增量阶段:(a)领域自适应,识别器适应新引入的领域(例如,一个空的MiniGrid);(b)目标自适应,在该领域内引入新的候选目标;(c)识别推理,系统需要根据部分观察推断最可能的目标。这种分解强调了GDGR的动态特性:与假设固定领域与目标集的传统GR不同,GDGR需要在领域、目标与观察序列之间进行持续适应。
在三个属性各异的环境中展示了结果:Minigrid[6]、Point Maze[8]与Panda-Gym[12]。结果表明,与现有方法相比,AURA显著减少了新目标与环境变化的适应时间,展示了AURA在动态真实场景推进GR的潜力。完整版本见[9]。