STaR：面向长周期多模态机器人记忆的可扩展任务条件检索 (STaR: Scalable Task-Conditioned Retrieval for Long-Horizon Multimodal Robot Memory) - 专知论文

会员服务 ·

0

多模 · 模态 · 构建 · 机器人 · 多模态 ·

STaR: Scalable Task-Conditioned Retrieval for Long-Horizon Multimodal Robot Memory

翻译：STaR：面向长周期多模态机器人记忆的可扩展任务条件检索

Mingfeng Yuan,Hao Zhang,Mahan Mohammadi,Runhao Li,Jinjun Shan,Steven L. Waslander

Mobile robots are often deployed over long durations in diverse open, dynamic scenes, including indoor setting such as warehouses and manufacturing facilities, and outdoor settings such as agricultural and roadway operations. A core challenge is to build a scalable long-horizon memory that supports an agentic workflow for planning, retrieval, and reasoning over open-ended instructions at variable granularity, while producing precise, actionable answers for navigation. We present STaR, an agentic reasoning framework that (i) constructs a task-agnostic, multimodal long-term memory that generalizes to unseen queries while preserving fine-grained environmental semantics (object attributes, spatial relations, and dynamic events), and (ii) introduces a Scalable TaskConditioned Retrieval algorithm based on the Information Bottleneck principle to extract from long-term memory a compact, non-redundant, information-rich set of candidate memories for contextual reasoning. We evaluate STaR on NaVQA (mixed indoor/outdoor campus scenes) and WH-VQA, a customized warehouse benchmark with many visually similar objects built with Isaac Sim, emphasizing contextual reasoning. Across the two datasets, STaR consistently outperforms strong baselines, achieving higher success rates and markedly lower spatial error. We further deploy STaR on a real Husky wheeled robot in both indoor and outdoor environments, demonstrating robust longhorizon reasoning, scalability, and practical utility.

翻译：移动机器人通常需在多样化的开放动态场景中长期部署，包括仓库和制造设施等室内环境，以及农业和道路作业等室外环境。其核心挑战在于构建一个可扩展的长周期记忆系统，以支持基于开放式多粒度指令的规划、检索与推理的智能体工作流，同时为导航任务生成精确且可执行的答案。本文提出STaR——一个智能体推理框架，其具备以下特点：（i）构建与任务无关的多模态长期记忆，该记忆能够泛化至未见查询，同时保留细粒度的环境语义（物体属性、空间关系及动态事件）；（ii）基于信息瓶颈原理提出一种可扩展的任务条件检索算法，从长期记忆中提取紧凑、非冗余且信息丰富的候选记忆集合以支持上下文推理。我们在NaVQA（室内外混合校园场景）与WH-VQA上评估STaR的性能，其中WH-VQA是基于Isaac Sim构建的定制化仓库基准数据集，包含大量视觉相似物体并强调上下文推理能力。在两个数据集上，STaR均持续超越现有强基线模型，实现了更高的任务成功率与显著降低的空间误差。我们进一步在真实Husky轮式机器人上于室内外环境中部署STaR，验证了其在长周期推理、可扩展性及实际应用方面的鲁棒性。

0

相关内容

机器人领域的多任务泛化研究

机器人领域的多任务泛化研究

专知会员服务

16+阅读 · 1月14日

【斯坦福博士论文】协作多机器人学习算法

【斯坦福博士论文】协作多机器人学习算法

专知会员服务

17+阅读 · 2025年1月6日

【AAAI2025】通过多模态思维链得分协作增强多机器人语义导航

【AAAI2025】通过多模态思维链得分协作增强多机器人语义导航

专知会员服务

18+阅读 · 2024年12月28日

空间智能如何？牛津大学博士论文《深度具身智能体的空间推理与规划》230页pdf

空间智能如何？牛津大学博士论文《深度具身智能体的空间推理与规划》230页pdf

专知会员服务

58+阅读 · 2024年10月23日

【ETHZ博士论文】在机器人领域中实现高效、可扩展且精确的体积映射和规划的多分辨率方法

【ETHZ博士论文】在机器人领域中实现高效、可扩展且精确的体积映射和规划的多分辨率方法

专知会员服务

19+阅读 · 2024年7月30日

《通信受限环境中机器人网络的高效任务规划》172页

《通信受限环境中机器人网络的高效任务规划》172页

专知会员服务

74+阅读 · 2024年4月15日

人形机器人系列报告：AI超预期助力产业落地，核心零部件配套星辰大海

人形机器人系列报告：AI超预期助力产业落地，核心零部件配套星辰大海

专知会员服务

45+阅读 · 2024年3月12日

大模型如何用于机器人？CMU谷歌等最新《基于基础模型的通用机器人》综述，详解机器人技术基础模型

大模型如何用于机器人？CMU谷歌等最新《基于基础模型的通用机器人》综述，详解机器人技术基础模型

专知会员服务

65+阅读 · 2023年12月16日

《探索基于深度学习的机器人感知技术，用于在户外地形中导航》美空军研究实验室2022最新20页报告

《探索基于深度学习的机器人感知技术，用于在户外地形中导航》美空军研究实验室2022最新20页报告

专知会员服务

34+阅读 · 2022年12月12日

【牛津大学博士论文】基于强化学习的无地图机器人导航，Reinforcement Learning Based MRN

【牛津大学博士论文】基于强化学习的无地图机器人导航，Reinforcement Learning Based MRN

专知会员服务

123+阅读 · 2020年5月18日

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

专知

12+阅读 · 2023年4月4日

推荐！【DARPA终身学习机器（L2M）】《自主系统中用于感知和行动的终身学习》美空军、宾大2022最新234页技术报告

推荐！【DARPA终身学习机器（L2M）】《自主系统中用于感知和行动的终身学习》美空军、宾大2022最新234页技术报告

专知

26+阅读 · 2022年11月24日

【集群机器人】《考虑敌手的多智能体系统协同任务分配与运动规划》2022最新226页博士论文，密歇根大学

【集群机器人】《考虑敌手的多智能体系统协同任务分配与运动规划》2022最新226页博士论文，密歇根大学

专知

29+阅读 · 2022年11月23日

【斯坦福博士论文】利用先验知识和结构进行数据高效的机器学习，154页pdf

【斯坦福博士论文】利用先验知识和结构进行数据高效的机器学习，154页pdf

专知

28+阅读 · 2022年9月11日

【美国陆军】《人工智能系统能否提高陆军任务指挥过程中的信息收集效率？》39页技术报告

【美国陆军】《人工智能系统能否提高陆军任务指挥过程中的信息收集效率？》39页技术报告

专知

50+阅读 · 2022年8月31日

IROS2020|机器人自主探索与建图算法，代码已开源！

IROS2020|机器人自主探索与建图算法，代码已开源！

中国图象图形学报

34+阅读 · 2020年9月8日

专访俞栋：多模态是迈向通用人工智能的重要方向

专访俞栋：多模态是迈向通用人工智能的重要方向

AI科技评论

26+阅读 · 2019年9月9日

【协作机器人】人机协作机器人的核心是多传感器技术与智能控制算法、工业机器人协作应用挑战

【协作机器人】人机协作机器人的核心是多传感器技术与智能控制算法、工业机器人协作应用挑战

产业智能官

13+阅读 · 2019年1月17日

【紫冬分享】移动机器人视觉里程计综述

【紫冬分享】移动机器人视觉里程计综述

中国科学院自动化研究所

12+阅读 · 2018年10月31日

深思考人工智能蝉联SMP2018多轮语义对话冠军，报告解读多轮人机对话实现过程

深思考人工智能蝉联SMP2018多轮语义对话冠军，报告解读多轮人机对话实现过程

人工智能学家

15+阅读 · 2018年8月4日

三维空间基于角度测量的多机器人系统协同定位与编队控制

国家自然科学基金

11+阅读 · 2015年12月31日

基于三维激光测距的移动机器人室外环境语义地图构建

国家自然科学基金

2+阅读 · 2015年12月31日

不确定环境下的自主移动机器人目标搜索问题研究

国家自然科学基金

50+阅读 · 2015年12月31日

野外环境下四足机器人地形辨识与可通过性评价方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

网络化遥操作多机器人系统时滞相关控制研究

国家自然科学基金

0+阅读 · 2015年12月31日

广域动态的野外环境中移动机器人六维全局定位方法的研究

国家自然科学基金

1+阅读 · 2015年12月31日

未知环境中移动机器人探索式路径规划方法研究

国家自然科学基金

7+阅读 · 2015年12月31日

基于深度学习的特征融合在移动机器人视觉中的场景理解及研究

国家自然科学基金

12+阅读 · 2014年12月31日

基于逆向强化学习和人工智能的移动机器人自主学习方法研究

国家自然科学基金

12+阅读 · 2013年12月31日

基于多智能体强化学习的多机器人系统研究

国家自然科学基金

48+阅读 · 2009年12月31日

A Latency-Aware Framework for Visuomotor Policy Learning on Industrial Robots

Arxiv

0+阅读 · 2月15日

ColorBrowserAgent: Complex Long-Horizon Browser Agent with Adaptive Knowledge Evolution

Arxiv

0+阅读 · 2月15日

STaR: Scalable Task-Conditioned Retrieval for Long-Horizon Multimodal Robot Memory

Arxiv

0+阅读 · 2月12日

Effective Task Planning with Missing Objects using Learning-Informed Object Search

Arxiv

0+阅读 · 2月12日

Sci-VLA: Agentic VLA Inference Plugin for Long-Horizon Tasks in Scientific Experiments

Arxiv

0+阅读 · 2月10日

Learning to Continually Learn via Meta-learning Agentic Memory Designs

Arxiv

0+阅读 · 2月8日

TACO: Temporal Consensus Optimization for Continual Neural Mapping

Arxiv

0+阅读 · 2月4日

MOSAIC: Modular Scalable Autonomy for Intelligent Coordination of Heterogeneous Robotic Teams

Arxiv

0+阅读 · 1月30日

How Human Motion Prediction Quality Shapes Social Robot Navigation Performance in Constrained Spaces

Arxiv

0+阅读 · 1月14日

Look as You Leap: Planning Simultaneous Motion and Perception for High-DOF Robots

Arxiv

0+阅读 · 1月13日

VIP会员

文章信息

相关主题

相关VIP内容

机器人领域的多任务泛化研究

机器人领域的多任务泛化研究

专知会员服务

16+阅读 · 1月14日

【斯坦福博士论文】协作多机器人学习算法

【斯坦福博士论文】协作多机器人学习算法

专知会员服务

17+阅读 · 2025年1月6日

【AAAI2025】通过多模态思维链得分协作增强多机器人语义导航

【AAAI2025】通过多模态思维链得分协作增强多机器人语义导航

专知会员服务

18+阅读 · 2024年12月28日

空间智能如何？牛津大学博士论文《深度具身智能体的空间推理与规划》230页pdf

空间智能如何？牛津大学博士论文《深度具身智能体的空间推理与规划》230页pdf

专知会员服务

58+阅读 · 2024年10月23日

【ETHZ博士论文】在机器人领域中实现高效、可扩展且精确的体积映射和规划的多分辨率方法

【ETHZ博士论文】在机器人领域中实现高效、可扩展且精确的体积映射和规划的多分辨率方法

专知会员服务

19+阅读 · 2024年7月30日

《通信受限环境中机器人网络的高效任务规划》172页

《通信受限环境中机器人网络的高效任务规划》172页

专知会员服务

74+阅读 · 2024年4月15日

人形机器人系列报告：AI超预期助力产业落地，核心零部件配套星辰大海

人形机器人系列报告：AI超预期助力产业落地，核心零部件配套星辰大海

专知会员服务

45+阅读 · 2024年3月12日

大模型如何用于机器人？CMU谷歌等最新《基于基础模型的通用机器人》综述，详解机器人技术基础模型

大模型如何用于机器人？CMU谷歌等最新《基于基础模型的通用机器人》综述，详解机器人技术基础模型

专知会员服务

65+阅读 · 2023年12月16日

《探索基于深度学习的机器人感知技术，用于在户外地形中导航》美空军研究实验室2022最新20页报告

《探索基于深度学习的机器人感知技术，用于在户外地形中导航》美空军研究实验室2022最新20页报告

专知会员服务

34+阅读 · 2022年12月12日

【牛津大学博士论文】基于强化学习的无地图机器人导航，Reinforcement Learning Based MRN

【牛津大学博士论文】基于强化学习的无地图机器人导航，Reinforcement Learning Based MRN

专知会员服务

123+阅读 · 2020年5月18日

热门VIP内容

开通专知VIP会员享更多权益服务

【CMU博士论文】基于自适应表征的高效视觉建模

《多域作战中融合网络、电子战与动能机动》

AI智能体时代大模型安全风险与攻防新挑战

迈向个性化大语言模型驱动的智能体：基础、评估与未来方向

相关资讯

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

专知

12+阅读 · 2023年4月4日

推荐！【DARPA终身学习机器（L2M）】《自主系统中用于感知和行动的终身学习》美空军、宾大2022最新234页技术报告

推荐！【DARPA终身学习机器（L2M）】《自主系统中用于感知和行动的终身学习》美空军、宾大2022最新234页技术报告

专知

26+阅读 · 2022年11月24日

【集群机器人】《考虑敌手的多智能体系统协同任务分配与运动规划》2022最新226页博士论文，密歇根大学

【集群机器人】《考虑敌手的多智能体系统协同任务分配与运动规划》2022最新226页博士论文，密歇根大学

专知

29+阅读 · 2022年11月23日

【斯坦福博士论文】利用先验知识和结构进行数据高效的机器学习，154页pdf

【斯坦福博士论文】利用先验知识和结构进行数据高效的机器学习，154页pdf

专知

28+阅读 · 2022年9月11日

【美国陆军】《人工智能系统能否提高陆军任务指挥过程中的信息收集效率？》39页技术报告

【美国陆军】《人工智能系统能否提高陆军任务指挥过程中的信息收集效率？》39页技术报告

专知

50+阅读 · 2022年8月31日

IROS2020|机器人自主探索与建图算法，代码已开源！

IROS2020|机器人自主探索与建图算法，代码已开源！

中国图象图形学报

34+阅读 · 2020年9月8日

专访俞栋：多模态是迈向通用人工智能的重要方向

专访俞栋：多模态是迈向通用人工智能的重要方向

AI科技评论

26+阅读 · 2019年9月9日

【协作机器人】人机协作机器人的核心是多传感器技术与智能控制算法、工业机器人协作应用挑战

【协作机器人】人机协作机器人的核心是多传感器技术与智能控制算法、工业机器人协作应用挑战

产业智能官

13+阅读 · 2019年1月17日

【紫冬分享】移动机器人视觉里程计综述

【紫冬分享】移动机器人视觉里程计综述

中国科学院自动化研究所

12+阅读 · 2018年10月31日

深思考人工智能蝉联SMP2018多轮语义对话冠军，报告解读多轮人机对话实现过程

深思考人工智能蝉联SMP2018多轮语义对话冠军，报告解读多轮人机对话实现过程

人工智能学家

15+阅读 · 2018年8月4日

相关论文

A Latency-Aware Framework for Visuomotor Policy Learning on Industrial Robots

Arxiv

0+阅读 · 2月15日

ColorBrowserAgent: Complex Long-Horizon Browser Agent with Adaptive Knowledge Evolution

Arxiv

0+阅读 · 2月15日

STaR: Scalable Task-Conditioned Retrieval for Long-Horizon Multimodal Robot Memory

Arxiv

0+阅读 · 2月12日

Effective Task Planning with Missing Objects using Learning-Informed Object Search

Arxiv

0+阅读 · 2月12日

Sci-VLA: Agentic VLA Inference Plugin for Long-Horizon Tasks in Scientific Experiments

Arxiv

0+阅读 · 2月10日

Learning to Continually Learn via Meta-learning Agentic Memory Designs

Arxiv

0+阅读 · 2月8日

TACO: Temporal Consensus Optimization for Continual Neural Mapping

Arxiv

0+阅读 · 2月4日

MOSAIC: Modular Scalable Autonomy for Intelligent Coordination of Heterogeneous Robotic Teams

Arxiv

0+阅读 · 1月30日

How Human Motion Prediction Quality Shapes Social Robot Navigation Performance in Constrained Spaces

Arxiv

0+阅读 · 1月14日

Look as You Leap: Planning Simultaneous Motion and Perception for High-DOF Robots

Arxiv

0+阅读 · 1月13日

相关基金

三维空间基于角度测量的多机器人系统协同定位与编队控制

国家自然科学基金

11+阅读 · 2015年12月31日

基于三维激光测距的移动机器人室外环境语义地图构建

国家自然科学基金

2+阅读 · 2015年12月31日

不确定环境下的自主移动机器人目标搜索问题研究

国家自然科学基金

50+阅读 · 2015年12月31日

野外环境下四足机器人地形辨识与可通过性评价方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

网络化遥操作多机器人系统时滞相关控制研究

国家自然科学基金

0+阅读 · 2015年12月31日

广域动态的野外环境中移动机器人六维全局定位方法的研究

国家自然科学基金

1+阅读 · 2015年12月31日

未知环境中移动机器人探索式路径规划方法研究

国家自然科学基金

7+阅读 · 2015年12月31日

基于深度学习的特征融合在移动机器人视觉中的场景理解及研究

国家自然科学基金

12+阅读 · 2014年12月31日

基于逆向强化学习和人工智能的移动机器人自主学习方法研究

国家自然科学基金

12+阅读 · 2013年12月31日

基于多智能体强化学习的多机器人系统研究

国家自然科学基金

48+阅读 · 2009年12月31日

微信扫码咨询专知VIP会员