通过观察智能体行为推断其目标,是人工智能领域的一项常见问题,被称为目标识别(GR)。在目标繁多且不断变化的动态环境中,该任务变得尤为艰巨。我们引入了通用动态目标识别(GDGR)问题,这是对GR的广义定义,旨在实现GR系统的实时自适应。本文提出了两种应对GDGR的新方法:(1)GC-AURA,利用目标条件强化学习泛化至新目标;(2)Meta-AURA,利用元强化学习适应新环境。我们在多种环境中对这些方法进行了评估,证明了它们在动态与噪声条件下实现快速适应及高GR准确率的能力。这项工作是在动态且不可预测的真实世界环境中实现GR的重要一步。

目标识别(GR)是人工智能(AI)的一个子领域,专注于根据观察到的动作推断智能体的目标。该任务在多个领域至关重要,特别是在人机交互[19,26,35]与多智能体系统[5,16,23,31]的应用中,预测其他智能体的目标与动作能使系统做出有效且恰当的响应。

GR是一个在线推理问题,然而近期的方法依赖于训练模型来学习与单一环境中预定义候选目标集相关的模式。尽管在有限场景下有效,但这类方法难以适应同一环境或全新环境中的新目标集,需要从头开始重新执行流程(例如,为每个新目标重新应用规划器或强化学习(RL))。这种重启会显著增加开销时间,使得这些方法在目标空间连续或需要快速适应具有不同目标与环境的动态变化GR问题的实时场景中变得不切实际。例如,在面向老年人或运动障碍者的辅助技术[14,19,36]中,机器人助手必须适应跨领域的目标变化:在一个任务中通过手势与上下文推断所需的烘焙原料,在另一个任务中利用类似线索与先验知识识别偏好的书籍。这些场景凸显了对自适应GR系统的需求,该系统能够跨任务泛化知识并将其迁移到新情境中。在实时应用中,此类系统无法承受每次都从头重新学习的代价。

本文通过以下方式向解决这些局限性迈出了第一步:(1)为新问题提供定义:通用动态目标识别(GDGR),这是对GR的推广,以解释不断变化的目标与领域;(2)概述GDGR的解决方案范式,命名为自适应通用识别算法(AURA);(3)提出AURA的两种实现,分别使用目标条件RL(GC-AURA)与元RL(Meta-AURA),以实现跨多个领域内多个动态变化任务的实时GR。

图1突出了GDGR与经典GR区别的三个增量阶段:(a)领域自适应,识别器适应新引入的领域(例如,一个空的MiniGrid);(b)目标自适应,在该领域内引入新的候选目标;(c)识别推理,系统需要根据部分观察推断最可能的目标。这种分解强调了GDGR的动态特性:与假设固定领域与目标集的传统GR不同,GDGR需要在领域、目标与观察序列之间进行持续适应。

在三个属性各异的环境中展示了结果:Minigrid[6]、Point Maze[8]与Panda-Gym[12]。结果表明,与现有方法相比,AURA显著减少了新目标与环境变化的适应时间,展示了AURA在动态真实场景推进GR的潜力。完整版本见[9]

成为VIP会员查看完整内容
2

相关内容

军事防务数据板块介绍:系统化采集、存储、管理、分析与军事国防安全相关信息的专用数据板块,其核心在于整合全球新兴国防技术(军事人工智能、无人系统等)、热点案例(俄乌战争、美以伊战争)等方面的最新时讯、研究报告/论文、条令法规、案例分析,为战略研判、情报分析、决策支持等提供知识支撑。
《分布式多智能体强化学习策略的可解释性研究》
专知会员服务
30+阅读 · 2025年11月17日
面向视觉的强化学习综述
专知会员服务
23+阅读 · 2025年8月12日
《用于空战机动的分层多智能体强化学习》
专知会员服务
70+阅读 · 2023年10月5日
【牛津大学博士论文】元强化学习的快速自适应,217页pdf
专知会员服务
106+阅读 · 2022年9月19日
专知会员服务
94+阅读 · 2021年8月29日
强化学习《奖励函数设计: Reward Shaping》详细解读
深度强化学习实验室
20+阅读 · 2020年9月1日
基于深度学习的目标检测算法综述
AI研习社
15+阅读 · 2018年4月25日
【强化学习】强化学习+深度学习=人工智能
产业智能官
55+阅读 · 2017年8月11日
国家自然科学基金
2+阅读 · 2017年12月31日
国家自然科学基金
43+阅读 · 2015年12月31日
国家自然科学基金
9+阅读 · 2015年12月31日
国家自然科学基金
52+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
5+阅读 · 2015年12月31日
国家自然科学基金
6+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2013年12月31日
国家自然科学基金
50+阅读 · 2009年12月31日
VIP会员
最新内容
博士论文 | 大动作空间中的在线与离线策略学习
专知会员服务
0+阅读 · 今天14:06
论文 | 全球负责任 AI 指数 2026 方法论
专知会员服务
0+阅读 · 今天13:59
超致命战场空间中的战术通信生存能力
专知会员服务
0+阅读 · 今天13:08
《基于无人机的集成感知与通信进展:全面综述》
综述 | 面向机器人的视觉触觉智能
专知会员服务
4+阅读 · 8月22日
论文 | 基础模型驱动具身智能体安全综述
专知会员服务
2+阅读 · 8月22日
伊朗-美国-以色列冲突教训
专知会员服务
2+阅读 · 8月22日
《美国陆军 · 战役规划手册(2027年)》237页
专知会员服务
8+阅读 · 8月22日
综述 | 自我中心视频中的视觉语言模型
专知会员服务
2+阅读 · 8月21日
相关VIP内容
《分布式多智能体强化学习策略的可解释性研究》
专知会员服务
30+阅读 · 2025年11月17日
面向视觉的强化学习综述
专知会员服务
23+阅读 · 2025年8月12日
《用于空战机动的分层多智能体强化学习》
专知会员服务
70+阅读 · 2023年10月5日
【牛津大学博士论文】元强化学习的快速自适应,217页pdf
专知会员服务
106+阅读 · 2022年9月19日
专知会员服务
94+阅读 · 2021年8月29日
相关基金
国家自然科学基金
2+阅读 · 2017年12月31日
国家自然科学基金
43+阅读 · 2015年12月31日
国家自然科学基金
9+阅读 · 2015年12月31日
国家自然科学基金
52+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
5+阅读 · 2015年12月31日
国家自然科学基金
6+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2013年12月31日
国家自然科学基金
50+阅读 · 2009年12月31日
微信扫码咨询专知VIP会员