目标链式分层策略：面向长时域离线目标条件强化学习 (Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL) - 专知论文

会员服务 ·

0

分层 · 时域 · 潜在 · 强化学习 · 任务分解 ·

Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL

翻译：目标链式分层策略：面向长时域离线目标条件强化学习

Jinwoo Choi,Sang-Hyun Lee,Seung-Woo Seo

from arxiv, 22 pages

Offline goal-conditioned reinforcement learning remains challenging for long-horizon tasks. While hierarchical approaches mitigate this issue by decomposing tasks, most existing methods rely on separate high- and low-level networks and generate only a single intermediate subgoal, making them inadequate for complex tasks that require coordinating multiple intermediate decisions. To address this limitation, we draw inspiration from the chain-of-thought paradigm and propose the Chain-of-Goals Hierarchical Policy (CoGHP), a novel framework that reformulates hierarchical decision-making as autoregressive sequence modeling within a unified architecture. Given a state and a final goal, CoGHP autoregressively generates a sequence of latent subgoals followed by the primitive action, where each latent subgoal acts as a reasoning step that conditions subsequent predictions. To implement this efficiently, we pioneer the use of an MLP-Mixer backbone, which supports cross-token communication and captures structural relationships among state, goal, latent subgoals, and action. Across challenging navigation and manipulation benchmarks, CoGHP consistently outperforms strong offline baselines, demonstrating improved performance on long-horizon tasks.

翻译：离线目标条件强化学习在长时域任务中仍然面临挑战。尽管分层方法通过任务分解缓解了这一问题，但现有方法大多依赖独立的高层与低层网络，且仅生成单一中间子目标，使其难以胜任需要协调多个中间决策的复杂任务。为解决这一局限，我们受思维链范式的启发，提出目标链式分层策略——一种在统一架构中将分层决策重构为自回归序列建模的新颖框架。给定状态与最终目标，CoGHP 以自回归方式生成一系列潜在子目标及原始动作，其中每个潜在子目标作为推理步骤条件化后续预测。为实现高效计算，我们率先采用MLP-Mixer骨干网络，该网络支持跨令牌通信并能捕捉状态、目标、潜在子目标与动作间的结构关系。在具有挑战性的导航与操作基准测试中，CoGHP 持续优于现有离线基线方法，显著提升了长时域任务的性能表现。

0

相关内容

《基于分层多智能体强化学习的逼真空战协同策略》

《基于分层多智能体强化学习的逼真空战协同策略》

专知会员服务

39+阅读 · 2025年10月30日

北航团队提出SIDM：基于结构信息原理的通用分层决策框架

北航团队提出SIDM：基于结构信息原理的通用分层决策框架

专知会员服务

19+阅读 · 2025年5月14日

离线强化学习研究综述

离线强化学习研究综述

专知会员服务

38+阅读 · 2025年1月12日

分层强化学习在无人机领域应用综述

分层强化学习在无人机领域应用综述

专知会员服务

53+阅读 · 2024年3月19日

基于多智能体强化学习的协同目标分配

基于多智能体强化学习的协同目标分配

专知会员服务

136+阅读 · 2023年9月5日

基于多智能体深度强化学习的体系任务分配方法

基于多智能体深度强化学习的体系任务分配方法

专知会员服务

157+阅读 · 2023年5月4日

「深度分层强化学习DHRL」最新2022研究与进展综述

「深度分层强化学习DHRL」最新2022研究与进展综述

专知会员服务

99+阅读 · 2022年8月6日

万字长文！离线强化学习(OfflineRL)总结(原理、数据集、算法、复杂性分析、超参数调优等）

万字长文！离线强化学习(OfflineRL)总结(原理、数据集、算法、复杂性分析、超参数调优等）

专知会员服务

42+阅读 · 2022年5月12日

【ICLR2021】一种基于距离度量学习及行为正则化的完全离线的元强化学习方法

专知会员服务

17+阅读 · 2021年2月9日

【NeurIPS 2019-教程】强化学习:过去、现在和未来展望（Rinforcement Learning: Past, Present, and Future Perspectives），微软首席研究员Katja Hofmann

【NeurIPS 2019-教程】强化学习:过去、现在和未来展望（Rinforcement Learning: Past, Present, and Future Perspectives），微软首席研究员Katja Hofmann

专知会员服务

59+阅读 · 2019年12月9日

【ICML2020-天津大学】多智能体深度强化学习中的Q值路径分解

【ICML2020-天津大学】多智能体深度强化学习中的Q值路径分解

专知

37+阅读 · 2020年7月2日

八千字长文深度解读，迁移学习在强化学习中的应用及最新进展

八千字长文深度解读，迁移学习在强化学习中的应用及最新进展

机器之心

13+阅读 · 2019年10月17日

【综述】《视频目标分割与跟踪》最新39页综述论文，带你了解视频分析进展

【综述】《视频目标分割与跟踪》最新39页综述论文，带你了解视频分析进展

专知

54+阅读 · 2019年4月24日

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

人工智能前沿讲习班

21+阅读 · 2018年12月21日

【论文推荐】最新七篇强化学习相关论文—逻辑约束、综述、多任务深度强化学习、参数服务器、事件抽取、分层强化学习、过拟合研究

【论文推荐】最新七篇强化学习相关论文—逻辑约束、综述、多任务深度强化学习、参数服务器、事件抽取、分层强化学习、过拟合研究

专知

25+阅读 · 2018年4月29日

【论文推荐】最新六篇强化学习相关论文—Sublinear、机器阅读理解、加速强化学习、对抗性奖励学习、人机交互

【论文推荐】最新六篇强化学习相关论文—Sublinear、机器阅读理解、加速强化学习、对抗性奖励学习、人机交互

专知

17+阅读 · 2018年4月28日

深度学习时代的目标检测算法

深度学习时代的目标检测算法

炼数成金订阅号

40+阅读 · 2018年3月19日

综述：深度学习时代的目标检测算法

综述：深度学习时代的目标检测算法

极市平台

27+阅读 · 2018年3月17日

【干货】结合单阶段和两阶段目标检测的优势：基于单次精化神经网络的目标检测方法

【干货】结合单阶段和两阶段目标检测的优势：基于单次精化神经网络的目标检测方法

专知

12+阅读 · 2018年1月12日

【干货】首次使用分层强化学习框架进行视频描述生成，王威廉组最新工作

【干货】首次使用分层强化学习框架进行视频描述生成，王威廉组最新工作

专知

14+阅读 · 2017年12月9日

针对大规模环境下复杂任务的策略搜索强化学习方法研究

国家自然科学基金

42+阅读 · 2015年12月31日

基于重要性采样的并行离策略强化学习方法研究

国家自然科学基金

23+阅读 · 2015年12月31日

基于云计算的动态分布式多目标粒子群算法研究

国家自然科学基金

1+阅读 · 2015年12月31日

面向大规模多步学习问题的学习分类元系统技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

基于分层图结构化稀疏低秩表示的目标联合分割方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

多目标分段线性分式规划的若干问题研究

国家自然科学基金

0+阅读 · 2014年12月31日

高分辨率极化SAR图像对象化目标分解方法研究

国家自然科学基金

1+阅读 · 2014年12月31日

基于认知技术的分层异构网络能效分析与资源分配研究

国家自然科学基金

0+阅读 · 2014年12月31日

产业链离散化空间逻辑及其演化机制、衔接模式与大国区间雁阵架构研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于支持向量机的复杂连续系统强化学习控制研究

国家自然科学基金

11+阅读 · 2008年12月31日

Locally Adaptive Multi-Objective Learning

Arxiv

0+阅读 · 2月16日

Data-Efficient Hierarchical Goal-Conditioned Reinforcement Learning via Normalizing Flows

Arxiv

0+阅读 · 2月11日

Deep Learning of Compositional Targets with Hierarchical Spectral Methods

Arxiv

0+阅读 · 2月11日

Long Chain-of-Thought Compression via Fine-Grained Group Policy Optimization

Arxiv

0+阅读 · 2月10日

Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization

Arxiv

0+阅读 · 2月8日

Hierarchical Entity-centric Reinforcement Learning with Factored Subgoal Diffusion

Arxiv

0+阅读 · 2月2日

Offline Goal-Conditioned Reinforcement Learning with Projective Quasimetric Planning

Arxiv

0+阅读 · 1月30日

RN-D: Discretized Categorical Actors with Regularized Networks for On-Policy Reinforcement Learning

Arxiv

0+阅读 · 1月30日

Divide-and-Conquer CoT: RL for Reducing Latency via Parallel Reasoning

Arxiv

0+阅读 · 1月30日

Less is More: Clustered Cross-Covariance Control for Offline RL

Arxiv

0+阅读 · 1月28日

VIP会员

文章信息

相关主题

相关VIP内容

《基于分层多智能体强化学习的逼真空战协同策略》

《基于分层多智能体强化学习的逼真空战协同策略》

专知会员服务

39+阅读 · 2025年10月30日

北航团队提出SIDM：基于结构信息原理的通用分层决策框架

北航团队提出SIDM：基于结构信息原理的通用分层决策框架

专知会员服务

19+阅读 · 2025年5月14日

离线强化学习研究综述

离线强化学习研究综述

专知会员服务

38+阅读 · 2025年1月12日

分层强化学习在无人机领域应用综述

分层强化学习在无人机领域应用综述

专知会员服务

53+阅读 · 2024年3月19日

基于多智能体强化学习的协同目标分配

基于多智能体强化学习的协同目标分配

专知会员服务

136+阅读 · 2023年9月5日

基于多智能体深度强化学习的体系任务分配方法

基于多智能体深度强化学习的体系任务分配方法

专知会员服务

157+阅读 · 2023年5月4日

「深度分层强化学习DHRL」最新2022研究与进展综述

「深度分层强化学习DHRL」最新2022研究与进展综述

专知会员服务

99+阅读 · 2022年8月6日

万字长文！离线强化学习(OfflineRL)总结(原理、数据集、算法、复杂性分析、超参数调优等）

万字长文！离线强化学习(OfflineRL)总结(原理、数据集、算法、复杂性分析、超参数调优等）

专知会员服务

42+阅读 · 2022年5月12日

【ICLR2021】一种基于距离度量学习及行为正则化的完全离线的元强化学习方法

专知会员服务

17+阅读 · 2021年2月9日

【NeurIPS 2019-教程】强化学习:过去、现在和未来展望（Rinforcement Learning: Past, Present, and Future Perspectives），微软首席研究员Katja Hofmann

【NeurIPS 2019-教程】强化学习:过去、现在和未来展望（Rinforcement Learning: Past, Present, and Future Perspectives），微软首席研究员Katja Hofmann

专知会员服务

59+阅读 · 2019年12月9日

热门VIP内容

开通专知VIP会员享更多权益服务

智能体记忆深度剖析：评价指标与系统局限性的分类体系及实证分析

《可信人工智能赋能系统的支柱》

【CMU博士论文】可靠轨迹预测的分层基石：数据、评估与方法

人工智能赋能边缘与自主系统：美陆军现代化进程聚焦威胁探测与战术边缘情报

相关资讯

【ICML2020-天津大学】多智能体深度强化学习中的Q值路径分解

【ICML2020-天津大学】多智能体深度强化学习中的Q值路径分解

专知

37+阅读 · 2020年7月2日

八千字长文深度解读，迁移学习在强化学习中的应用及最新进展

八千字长文深度解读，迁移学习在强化学习中的应用及最新进展

机器之心

13+阅读 · 2019年10月17日

【综述】《视频目标分割与跟踪》最新39页综述论文，带你了解视频分析进展

【综述】《视频目标分割与跟踪》最新39页综述论文，带你了解视频分析进展

专知

54+阅读 · 2019年4月24日

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

人工智能前沿讲习班

21+阅读 · 2018年12月21日

【论文推荐】最新七篇强化学习相关论文—逻辑约束、综述、多任务深度强化学习、参数服务器、事件抽取、分层强化学习、过拟合研究

【论文推荐】最新七篇强化学习相关论文—逻辑约束、综述、多任务深度强化学习、参数服务器、事件抽取、分层强化学习、过拟合研究

专知

25+阅读 · 2018年4月29日

【论文推荐】最新六篇强化学习相关论文—Sublinear、机器阅读理解、加速强化学习、对抗性奖励学习、人机交互

【论文推荐】最新六篇强化学习相关论文—Sublinear、机器阅读理解、加速强化学习、对抗性奖励学习、人机交互

专知

17+阅读 · 2018年4月28日

深度学习时代的目标检测算法

深度学习时代的目标检测算法

炼数成金订阅号

40+阅读 · 2018年3月19日

综述：深度学习时代的目标检测算法

综述：深度学习时代的目标检测算法

极市平台

27+阅读 · 2018年3月17日

【干货】结合单阶段和两阶段目标检测的优势：基于单次精化神经网络的目标检测方法

【干货】结合单阶段和两阶段目标检测的优势：基于单次精化神经网络的目标检测方法

专知

12+阅读 · 2018年1月12日

【干货】首次使用分层强化学习框架进行视频描述生成，王威廉组最新工作

【干货】首次使用分层强化学习框架进行视频描述生成，王威廉组最新工作

专知

14+阅读 · 2017年12月9日

相关论文

Locally Adaptive Multi-Objective Learning

Arxiv

0+阅读 · 2月16日

Data-Efficient Hierarchical Goal-Conditioned Reinforcement Learning via Normalizing Flows

Arxiv

0+阅读 · 2月11日

Deep Learning of Compositional Targets with Hierarchical Spectral Methods

Arxiv

0+阅读 · 2月11日

Long Chain-of-Thought Compression via Fine-Grained Group Policy Optimization

Arxiv

0+阅读 · 2月10日

Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization

Arxiv

0+阅读 · 2月8日

Hierarchical Entity-centric Reinforcement Learning with Factored Subgoal Diffusion

Arxiv

0+阅读 · 2月2日

Offline Goal-Conditioned Reinforcement Learning with Projective Quasimetric Planning

Arxiv

0+阅读 · 1月30日

RN-D: Discretized Categorical Actors with Regularized Networks for On-Policy Reinforcement Learning

Arxiv

0+阅读 · 1月30日

Divide-and-Conquer CoT: RL for Reducing Latency via Parallel Reasoning

Arxiv

0+阅读 · 1月30日

Less is More: Clustered Cross-Covariance Control for Offline RL

Arxiv

0+阅读 · 1月28日

相关基金

针对大规模环境下复杂任务的策略搜索强化学习方法研究

国家自然科学基金

42+阅读 · 2015年12月31日

基于重要性采样的并行离策略强化学习方法研究

国家自然科学基金

23+阅读 · 2015年12月31日

基于云计算的动态分布式多目标粒子群算法研究

国家自然科学基金

1+阅读 · 2015年12月31日

面向大规模多步学习问题的学习分类元系统技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

基于分层图结构化稀疏低秩表示的目标联合分割方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

多目标分段线性分式规划的若干问题研究

国家自然科学基金

0+阅读 · 2014年12月31日

高分辨率极化SAR图像对象化目标分解方法研究

国家自然科学基金

1+阅读 · 2014年12月31日

基于认知技术的分层异构网络能效分析与资源分配研究

国家自然科学基金

0+阅读 · 2014年12月31日

产业链离散化空间逻辑及其演化机制、衔接模式与大国区间雁阵架构研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于支持向量机的复杂连续系统强化学习控制研究

国家自然科学基金

11+阅读 · 2008年12月31日

微信扫码咨询专知VIP会员