We study performance-driven environment abstraction for decision-making in large Markov decision processes. Rather than preserving geometric or topological structure, we seek abstractions that directly optimize decision quality. We model abstraction as a controlled approximation obtained by aggregating the state space and enforcing a shared action distribution within each aggregated state. For a fixed partition, we establish a performance guarantee that separates value-function approximation error from the loss introduced by action sharing. Guided by this analysis, we develop a multi-timescale reinforcement learning framework that jointly adapts the policy and a tree-structured environment abstraction. The resulting algorithm refines and coarsens regions of the state space based on Q-value discrepancies, balancing performance against abstraction size and complexity. Empirical results demonstrate substantial state compression, improved sample efficiency, and faster replanning compared to actor-critic baselines.


翻译:我们研究面向性能驱动的环境抽象方法,用于大规模马尔可夫决策过程中的决策制定。不同于保留几何或拓扑结构,我们寻求直接优化决策质量的抽象形式。我们将抽象建模为受控近似,通过聚合状态空间并在每个聚合状态内强制执行共享动作分布实现。针对固定划分,我们建立了性能保证,该保证将价值函数近似误差与动作共享引入的损失分离开来。基于这一分析,我们开发了一个多时间尺度强化学习框架,该框架联合调整策略与树结构环境抽象。所提出的算法根据Q值差异细化或粗化状态空间区域,在性能与抽象规模及复杂度之间取得平衡。实验结果表明,与Actor-Critic基线方法相比,该方法实现了显著的状态压缩、样本效率提升及更快的重规划速度。

0
下载
关闭预览

相关内容

【CMU博士论文】强化学习中的涌现式抽象
专知会员服务
16+阅读 · 3月8日
《分布式多智能体强化学习策略的可解释性研究》
专知会员服务
29+阅读 · 2025年11月17日
自动驾驶中的多智能体强化学习综述
专知会员服务
47+阅读 · 2024年8月20日
【2024新书】强化学习中利用环境可配置性,377页pdf
专知会员服务
54+阅读 · 2024年2月19日
【牛津大学博士论文】强化学习时间抽象和泛化,196页pdf
【ICML2023】表示驱动强化学习
专知会员服务
39+阅读 · 2023年6月2日
基于模型的强化学习综述
专知会员服务
48+阅读 · 2023年1月9日
「基于通信的多智能体强化学习」 进展综述
多模态视觉语言表征学习研究综述
专知
27+阅读 · 2020年12月3日
【综述】多智能体强化学习算法理论研究
深度强化学习实验室
16+阅读 · 2020年9月9日
深度多模态表示学习综述论文,22页pdf
专知
33+阅读 · 2020年6月21日
半监督多任务学习:Semisupervised Multitask Learning
我爱读PAMI
18+阅读 · 2018年4月29日
展望:模型驱动的深度学习
人工智能学家
12+阅读 · 2018年1月23日
国家自然科学基金
43+阅读 · 2015年12月31日
国家自然科学基金
5+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
2+阅读 · 2014年12月31日
国家自然科学基金
17+阅读 · 2008年12月31日
VIP会员
最新内容
学习数据的几何:形状空间分析数学综述
专知会员服务
7+阅读 · 6月17日
定向能反无人机系统最新发展动态
专知会员服务
7+阅读 · 6月17日
从燃煤战舰到算法战争:水面指挥的永恒要求
专知会员服务
6+阅读 · 6月17日
相关VIP内容
【CMU博士论文】强化学习中的涌现式抽象
专知会员服务
16+阅读 · 3月8日
《分布式多智能体强化学习策略的可解释性研究》
专知会员服务
29+阅读 · 2025年11月17日
自动驾驶中的多智能体强化学习综述
专知会员服务
47+阅读 · 2024年8月20日
【2024新书】强化学习中利用环境可配置性,377页pdf
专知会员服务
54+阅读 · 2024年2月19日
【牛津大学博士论文】强化学习时间抽象和泛化,196页pdf
【ICML2023】表示驱动强化学习
专知会员服务
39+阅读 · 2023年6月2日
基于模型的强化学习综述
专知会员服务
48+阅读 · 2023年1月9日
相关基金
国家自然科学基金
43+阅读 · 2015年12月31日
国家自然科学基金
5+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
2+阅读 · 2014年12月31日
国家自然科学基金
17+阅读 · 2008年12月31日
Top
微信扫码咨询专知VIP会员