基于分布扭曲的离线强化学习策略评估 (Distorted Distributional Policy Evaluation for Offline Reinforcement Learning) - 专知论文

会员服务 ·

0

学习策略 · 策略评估 · 强化学习 · 离线强化学习 · 在线 ·

Distorted Distributional Policy Evaluation for Offline Reinforcement Learning

翻译：基于分布扭曲的离线强化学习策略评估

Ryo Iwaki,Takayuki Osogami

from arxiv, The preprint version of the paper accepted to ICONIP2025. The Version of Record is available online at https://link.springer.com/chapter/10.1007/978-981-95-4091-4_35

While Distributional Reinforcement Learning (DRL) methods have demonstrated strong performance in online settings, its success in offline scenarios remains limited. We hypothesize that a key limitation of existing offline DRL methods lies in their approach to uniformly underestimate return quantiles. This uniform pessimism can lead to overly conservative value estimates, ultimately hindering generalization and performance. To address this, we introduce a novel concept called quantile distortion, which enables non-uniform pessimism by adjusting the degree of conservatism based on the availability of supporting data. Our approach is grounded in theoretical analysis and empirically validated, demonstrating improved performance over uniform pessimism.

翻译：尽管分布强化学习方法在在线场景中已展现出卓越性能，但其在离线环境中的成功应用仍十分有限。我们认为现有离线分布强化学习方法的主要局限在于其均匀低估回报分位数的处理方式。这种均匀悲观性可能导致价值估计过于保守，最终阻碍模型的泛化能力与性能表现。为解决这一问题，我们提出了一种称为分位数扭曲的新概念，该方法通过根据支撑数据的可用性调整保守程度，从而实现非均匀的悲观性估计。我们的方法建立在理论分析基础之上，并经过实证验证，结果表明其性能相较于均匀悲观方法有显著提升。

0

相关内容

学习策略

离线强化学习研究综述

离线强化学习研究综述

专知会员服务

38+阅读 · 2025年1月12日

深度图学习在分布偏移下的综述：从图的分布外泛化到自适应

深度图学习在分布偏移下的综述：从图的分布外泛化到自适应

专知会员服务

18+阅读 · 2024年10月28日

基于表征学习的离线强化学习方法研究综述

基于表征学习的离线强化学习方法研究综述

专知会员服务

29+阅读 · 2024年7月2日

【NeurIPS2023】不仅仅是均匀采样：面对不平衡数据集的离线强化学习

【NeurIPS2023】不仅仅是均匀采样：面对不平衡数据集的离线强化学习

专知会员服务

32+阅读 · 2023年10月10日

推荐！《医疗保健中强化学习的离策略评估》哈佛大学181页博士论文

推荐！《医疗保健中强化学习的离策略评估》哈佛大学181页博士论文

专知会员服务

27+阅读 · 2022年7月21日

万字长文！离线强化学习(OfflineRL)总结(原理、数据集、算法、复杂性分析、超参数调优等）

万字长文！离线强化学习(OfflineRL)总结(原理、数据集、算法、复杂性分析、超参数调优等）

专知会员服务

42+阅读 · 2022年5月12日

强化学习如何做数据分析？新加坡国立等最新TKDE2022《深度强化学习数据处理与分析》综述论文阐述DRL数据分析落地应用

强化学习如何做数据分析？新加坡国立等最新TKDE2022《深度强化学习数据处理与分析》综述论文阐述DRL数据分析落地应用

专知会员服务

67+阅读 · 2022年3月28日

分布外泛化(Out-Of-Distribution Generalization) 综述论文，22页pdf240篇文献

专知会员服务

64+阅读 · 2021年9月2日

【ICLR2021】一种基于距离度量学习及行为正则化的完全离线的元强化学习方法

专知会员服务

17+阅读 · 2021年2月9日

基于决策树模型重用的分布变化流数据学习

专知会员服务

24+阅读 · 2021年1月30日

【NeurIPS 2020 Tutorial】离线强化学习:从算法到挑战，80页ppt

【NeurIPS 2020 Tutorial】离线强化学习:从算法到挑战，80页ppt

专知

16+阅读 · 2020年12月9日

Distributional Soft Actor-Critic (DSAC)强化学习算法的设计与验证

Distributional Soft Actor-Critic (DSAC)强化学习算法的设计与验证

深度强化学习实验室

19+阅读 · 2020年8月11日

【万字长文总结】如何解决"稀疏奖励(Sparse Reward)"下的强化学习问题？

【万字长文总结】如何解决"稀疏奖励(Sparse Reward)"下的强化学习问题？

深度强化学习实验室

43+阅读 · 2020年7月6日

最新《迁移学习:域自适应理论》综述论文，128页ppt讲解迁移学习与最优传输

最新《迁移学习:域自适应理论》综述论文，128页ppt讲解迁移学习与最优传输

专知

16+阅读 · 2020年4月27日

强化学习落地！京东等发布综述《深度强化学习在搜索，推荐和在线广告中的应用》

强化学习落地！京东等发布综述《深度强化学习在搜索，推荐和在线广告中的应用》

专知

26+阅读 · 2019年2月19日

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

人工智能前沿讲习班

21+阅读 · 2018年12月21日

一文了解强化学习

一文了解强化学习

AI100

15+阅读 · 2018年8月20日

论强化学习的根本缺陷

论强化学习的根本缺陷

AI科技评论

11+阅读 · 2018年7月24日

【论文推荐】最新六篇强化学习相关论文—Sublinear、机器阅读理解、加速强化学习、对抗性奖励学习、人机交互

【论文推荐】最新六篇强化学习相关论文—Sublinear、机器阅读理解、加速强化学习、对抗性奖励学习、人机交互

专知

17+阅读 · 2018年4月28日

基于强化学习的量化交易框架

基于强化学习的量化交易框架

机器学习研究会

30+阅读 · 2018年2月22日

针对大规模环境下复杂任务的策略搜索强化学习方法研究

国家自然科学基金

42+阅读 · 2015年12月31日

基于重要性采样的并行离策略强化学习方法研究

国家自然科学基金

23+阅读 · 2015年12月31日

基于微型批量采样的分布式多智能个体网络协同优化算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

分布式有监督学习的学习理论

国家自然科学基金

17+阅读 · 2015年12月31日

运用协同分布估计算法优化交通调度问题的研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于强化学习的分布参数系统数据驱动控制

国家自然科学基金

7+阅读 · 2015年12月31日

面向异分布数据的主动学习方法

国家自然科学基金

12+阅读 · 2015年12月31日

复杂数据模型中的分布逼近方法

国家自然科学基金

3+阅读 · 2014年12月31日

基于贝叶斯推理的模糊逻辑强化学习模型研究

国家自然科学基金

18+阅读 · 2012年12月31日

基于支持向量机的复杂连续系统强化学习控制研究

国家自然科学基金

11+阅读 · 2008年12月31日

Distributional Reinforcement Learning with Diffusion Bridge Critics

Arxiv

0+阅读 · 2月5日

Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL

Arxiv

0+阅读 · 2月3日

Zero-Shot Off-Policy Learning

Arxiv

0+阅读 · 2月2日

Less is More: Clustered Cross-Covariance Control for Offline RL

Arxiv

0+阅读 · 1月28日

Composite Flow Matching for Reinforcement Learning with Shifted-Dynamics Data

Arxiv

0+阅读 · 1月21日

A Simple Unified Uncertainty-Guided Framework for Offline-to-Online Reinforcement Learning

Arxiv

0+阅读 · 1月16日

Off Policy Lyapunov Stability in Reinforcement Learning

Arxiv

0+阅读 · 1月16日

A Differential Perspective on Distributional Reinforcement Learning

Arxiv

0+阅读 · 1月13日

Learning Design-Score Manifold to Guide Diffusion Models for Offline Optimization

Arxiv

0+阅读 · 1月12日

Long-Horizon Model-Based Offline Reinforcement Learning Without Conservatism

Arxiv

0+阅读 · 1月5日

VIP会员

文章信息

相关主题

离线强化学习

相关VIP内容

离线强化学习研究综述

离线强化学习研究综述

专知会员服务

38+阅读 · 2025年1月12日

深度图学习在分布偏移下的综述：从图的分布外泛化到自适应

深度图学习在分布偏移下的综述：从图的分布外泛化到自适应

专知会员服务

18+阅读 · 2024年10月28日

基于表征学习的离线强化学习方法研究综述

基于表征学习的离线强化学习方法研究综述

专知会员服务

29+阅读 · 2024年7月2日

【NeurIPS2023】不仅仅是均匀采样：面对不平衡数据集的离线强化学习

【NeurIPS2023】不仅仅是均匀采样：面对不平衡数据集的离线强化学习

专知会员服务

32+阅读 · 2023年10月10日

推荐！《医疗保健中强化学习的离策略评估》哈佛大学181页博士论文

推荐！《医疗保健中强化学习的离策略评估》哈佛大学181页博士论文

专知会员服务

27+阅读 · 2022年7月21日

万字长文！离线强化学习(OfflineRL)总结(原理、数据集、算法、复杂性分析、超参数调优等）

万字长文！离线强化学习(OfflineRL)总结(原理、数据集、算法、复杂性分析、超参数调优等）

专知会员服务

42+阅读 · 2022年5月12日

强化学习如何做数据分析？新加坡国立等最新TKDE2022《深度强化学习数据处理与分析》综述论文阐述DRL数据分析落地应用

强化学习如何做数据分析？新加坡国立等最新TKDE2022《深度强化学习数据处理与分析》综述论文阐述DRL数据分析落地应用

专知会员服务

67+阅读 · 2022年3月28日

分布外泛化(Out-Of-Distribution Generalization) 综述论文，22页pdf240篇文献

专知会员服务

64+阅读 · 2021年9月2日

【ICLR2021】一种基于距离度量学习及行为正则化的完全离线的元强化学习方法

专知会员服务

17+阅读 · 2021年2月9日

基于决策树模型重用的分布变化流数据学习

专知会员服务

24+阅读 · 2021年1月30日

热门VIP内容

开通专知VIP会员享更多权益服务

智能体记忆深度剖析：评价指标与系统局限性的分类体系及实证分析

《可信人工智能赋能系统的支柱》

【CMU博士论文】可靠轨迹预测的分层基石：数据、评估与方法

人工智能赋能边缘与自主系统：美陆军现代化进程聚焦威胁探测与战术边缘情报

相关资讯

【NeurIPS 2020 Tutorial】离线强化学习:从算法到挑战，80页ppt

【NeurIPS 2020 Tutorial】离线强化学习:从算法到挑战，80页ppt

专知

16+阅读 · 2020年12月9日

Distributional Soft Actor-Critic (DSAC)强化学习算法的设计与验证

Distributional Soft Actor-Critic (DSAC)强化学习算法的设计与验证

深度强化学习实验室

19+阅读 · 2020年8月11日

【万字长文总结】如何解决"稀疏奖励(Sparse Reward)"下的强化学习问题？

【万字长文总结】如何解决"稀疏奖励(Sparse Reward)"下的强化学习问题？

深度强化学习实验室

43+阅读 · 2020年7月6日

最新《迁移学习:域自适应理论》综述论文，128页ppt讲解迁移学习与最优传输

最新《迁移学习:域自适应理论》综述论文，128页ppt讲解迁移学习与最优传输

专知

16+阅读 · 2020年4月27日

强化学习落地！京东等发布综述《深度强化学习在搜索，推荐和在线广告中的应用》

强化学习落地！京东等发布综述《深度强化学习在搜索，推荐和在线广告中的应用》

专知

26+阅读 · 2019年2月19日

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

人工智能前沿讲习班

21+阅读 · 2018年12月21日

一文了解强化学习

一文了解强化学习

AI100

15+阅读 · 2018年8月20日

论强化学习的根本缺陷

论强化学习的根本缺陷

AI科技评论

11+阅读 · 2018年7月24日

【论文推荐】最新六篇强化学习相关论文—Sublinear、机器阅读理解、加速强化学习、对抗性奖励学习、人机交互

【论文推荐】最新六篇强化学习相关论文—Sublinear、机器阅读理解、加速强化学习、对抗性奖励学习、人机交互

专知

17+阅读 · 2018年4月28日

基于强化学习的量化交易框架

基于强化学习的量化交易框架

机器学习研究会

30+阅读 · 2018年2月22日

相关论文

Distributional Reinforcement Learning with Diffusion Bridge Critics

Arxiv

0+阅读 · 2月5日

Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL

Arxiv

0+阅读 · 2月3日

Zero-Shot Off-Policy Learning

Arxiv

0+阅读 · 2月2日

Less is More: Clustered Cross-Covariance Control for Offline RL

Arxiv

0+阅读 · 1月28日

Composite Flow Matching for Reinforcement Learning with Shifted-Dynamics Data

Arxiv

0+阅读 · 1月21日

A Simple Unified Uncertainty-Guided Framework for Offline-to-Online Reinforcement Learning

Arxiv

0+阅读 · 1月16日

Off Policy Lyapunov Stability in Reinforcement Learning

Arxiv

0+阅读 · 1月16日

A Differential Perspective on Distributional Reinforcement Learning

Arxiv

0+阅读 · 1月13日

Learning Design-Score Manifold to Guide Diffusion Models for Offline Optimization

Arxiv

0+阅读 · 1月12日

Long-Horizon Model-Based Offline Reinforcement Learning Without Conservatism

Arxiv

0+阅读 · 1月5日

相关基金

针对大规模环境下复杂任务的策略搜索强化学习方法研究

国家自然科学基金

42+阅读 · 2015年12月31日

基于重要性采样的并行离策略强化学习方法研究

国家自然科学基金

23+阅读 · 2015年12月31日

基于微型批量采样的分布式多智能个体网络协同优化算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

分布式有监督学习的学习理论

国家自然科学基金

17+阅读 · 2015年12月31日

运用协同分布估计算法优化交通调度问题的研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于强化学习的分布参数系统数据驱动控制

国家自然科学基金

7+阅读 · 2015年12月31日

面向异分布数据的主动学习方法

国家自然科学基金

12+阅读 · 2015年12月31日

复杂数据模型中的分布逼近方法

国家自然科学基金

3+阅读 · 2014年12月31日

基于贝叶斯推理的模糊逻辑强化学习模型研究

国家自然科学基金

18+阅读 · 2012年12月31日

基于支持向量机的复杂连续系统强化学习控制研究

国家自然科学基金

11+阅读 · 2008年12月31日

微信扫码咨询专知VIP会员