Optimal Posterior Sampling for Policy Identification in Tabular Markov Decision Processes - 专知论文

会员服务 ·

0

样本 · 优化器 · Markov · Processing（编程语言） · 近似 ·

Optimal Posterior Sampling for Policy Identification in Tabular Markov Decision Processes

翻译：表格型马尔可夫决策过程中策略识别的最优后验采样

Cyrille Kone,Kevin Jamieson

from arxiv, AISTATS 2026

We study the $(\varepsilon, δ)$-PAC policy identification problem in finite-horizon episodic Markov Decision Processes. Existing approaches provide finite-time guarantees for approximate settings ($\varepsilon>0$) but suffer from high computational cost, rendering them hard to implement, and also suffer from suboptimal dependence on $\log(1/δ)$. We propose a randomized and computationally efficient algorithm for best policy identification that combines posterior sampling with an online learning algorithm to guide exploration in the MDP. Our method achieves asymptotic optimality in sample complexity, also in terms of posterior contraction rate, and runs in $O(S^2AH)$ per episode, matching standard model-based approaches. Unlike prior algorithms such as MOCA and PEDEL, our guarantees remain meaningful in the asymptotic regime and avoid sub-optimal polynomial dependence on $\log(1/δ)$. Our results provide both theoretical insights and practical tools for efficient policy identification in tabular MDPs.

翻译：我们研究了有限时域情节马尔可夫决策过程中的$(\varepsilon, δ)$-PAC策略识别问题。现有方法虽能确保近似设定（$\varepsilon>0$）下的有限时间保证，但存在计算成本高昂导致难以实现的问题，且对$\log(1/δ)$的依赖存在次优性。我们提出了一种随机化且计算高效的算法用于最优策略识别，该算法将后验采样与在线学习算法相结合来引导MDP中的探索。我们的方法在样本复杂度（包括后验收缩速度）方面达到渐近最优性，且每次情节的计算复杂度为$O(S^2AH)$，与标准基于模型的方法相当。与MOCA和PEDEL等现有算法不同，我们的保证在渐近区域中仍然有效，且避免了在$\log(1/δ)$上出现次优多项式依赖。研究结果为表格MDP中的高效策略识别提供了理论洞见与实践工具。

0

相关内容

《结构化部分可观测下的序贯决策研究》2026年300页

《结构化部分可观测下的序贯决策研究》2026年300页

专知会员服务

16+阅读 · 7月11日

《自适应鲁棒马尔可夫决策过程：协同作战飞机（CCA）对抗性监视任务应用》44页技术报告

《自适应鲁棒马尔可夫决策过程：协同作战飞机（CCA）对抗性监视任务应用》44页技术报告

专知会员服务

27+阅读 · 2025年12月9日

《概率结果下全局最优决策的高效树生成方法》最新30页报告

《概率结果下全局最优决策的高效树生成方法》最新30页报告

专知会员服务

17+阅读 · 2025年5月6日

【普林斯顿博士论文】高效决策背后的结构化表征

【普林斯顿博士论文】高效决策背后的结构化表征

专知会员服务

40+阅读 · 2024年11月26日

McGill大学等最新《不确定性决策下的上下文优化方法》综述

McGill大学等最新《不确定性决策下的上下文优化方法》综述

专知会员服务

33+阅读 · 2023年6月25日

【伯克利博士论文】不确定性序列决策:最优性保证，组合学习，以及在机器人技术和生态学中的应用，256页pdf

【伯克利博士论文】不确定性序列决策:最优性保证，组合学习，以及在机器人技术和生态学中的应用，256页pdf

专知会员服务

39+阅读 · 2023年5月17日

《可解释决策算法和可问责决策算法之间的冲突》2022最新18页论文

《可解释决策算法和可问责决策算法之间的冲突》2022最新18页论文

专知会员服务

51+阅读 · 2022年11月20日

《多目标响应面可取性函数最优点评价的统计推断》2022最新295页博士论文【含代码】，美国空军技术学院

《多目标响应面可取性函数最优点评价的统计推断》2022最新295页博士论文【含代码】，美国空军技术学院

专知会员服务

30+阅读 · 2022年11月3日

策略梯度方法的算子视图，An operator view of policy gradient methods

策略梯度方法的算子视图，An operator view of policy gradient methods

专知会员服务

11+阅读 · 2020年6月23日

【谷歌大脑新论文】利用可微摄动优化器进行学习，Learning with Differentiable Perturbed Optimizers

【谷歌大脑新论文】利用可微摄动优化器进行学习，Learning with Differentiable Perturbed Optimizers

专知会员服务

29+阅读 · 2020年2月22日

【佐治亚理工博士论文】基于策略智能体和有限反馈的序列决策，211页pdf

【佐治亚理工博士论文】基于策略智能体和有限反馈的序列决策，211页pdf

专知

39+阅读 · 2023年4月13日

推荐！《不确定性下的作战决策：推理、序贯和对抗性方法》美国空军293页博士论文，含代码

推荐！《不确定性下的作战决策：推理、序贯和对抗性方法》美国空军293页博士论文，含代码

专知

52+阅读 · 2022年11月16日

推荐！【中文版】美国陆军《用于决策动力学、欺骗和博弈论的新型人工智能决策辅助工具》52页技术总结报告

推荐！【中文版】美国陆军《用于决策动力学、欺骗和博弈论的新型人工智能决策辅助工具》52页技术总结报告

专知

84+阅读 · 2022年7月7日

论文浅尝｜简单高效的知识图谱表示学习负样本采样方法

论文浅尝｜简单高效的知识图谱表示学习负样本采样方法

开放知识图谱

14+阅读 · 2021年7月25日

一文带你读懂 DeconvNet 上采样层（语义分割）

一文带你读懂 DeconvNet 上采样层（语义分割）

AI研习社

26+阅读 · 2019年3月16日

Github 项目推荐 | 论文的代码实现：可变形ConvNets v2的PyTorch实现

Github 项目推荐 | 论文的代码实现：可变形ConvNets v2的PyTorch实现

AI研习社

22+阅读 · 2019年1月10日

【论文推荐】最新6篇视觉问答（VQA）相关论文—目标推理、深度循环模型、可解释性、数据可视化、Triplet学习、基准

【论文推荐】最新6篇视觉问答（VQA）相关论文—目标推理、深度循环模型、可解释性、数据可视化、Triplet学习、基准

专知

15+阅读 · 2018年2月3日

【干货】终极入门马尔可夫网络 (Markov Networks)——概率图模型

【干货】终极入门马尔可夫网络 (Markov Networks)——概率图模型

机器学习研究会

31+阅读 · 2018年1月7日

不用数学也能讲清贝叶斯理论的马尔可夫链蒙特卡洛方法？这篇文章做到了

不用数学也能讲清贝叶斯理论的马尔可夫链蒙特卡洛方法？这篇文章做到了

AI100

11+阅读 · 2017年12月24日

【论文】变分推断（Variational inference)的总结

【论文】变分推断（Variational inference)的总结

机器学习研究会

39+阅读 · 2017年11月16日

基于马尔科夫信道模型的无线网络通信系统时延性能研究

国家自然科学基金

0+阅读 · 2015年12月31日

连续时间马氏决策过程受约束问题的研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于深度学习和马尔科夫逻辑网络的特殊视频识别研究

国家自然科学基金

0+阅读 · 2015年12月31日

有理 Krylov 子空间算法的最优参数选取

国家自然科学基金

0+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

基于GEP的可拓策略自组织生成理论与方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于离散化Lyapunov-Krasovskii泛函方法的时滞Markov跳变系统分析与综合

国家自然科学基金

0+阅读 · 2015年12月31日

机制转化下的最优停时问题研究---以金融中投资决策分析为例

国家自然科学基金

2+阅读 · 2014年12月31日

多域网络安全的异构策略语义形态与验证机制

国家自然科学基金

0+阅读 · 2014年12月31日

保险中两类随机最优控制问题及策略过程概率分布研究

国家自然科学基金

0+阅读 · 2014年12月31日

Learning Policy from a Single Trajectory in Average-Reward Markov Decision Process

Arxiv

0+阅读 · 6月15日

Lyapunov-Based Sample Complexity Analysis for Weakly-Coupled MDPs

Arxiv

0+阅读 · 6月15日

Asymptotically Optimal Sequential Testing with Markovian Data

Arxiv

0+阅读 · 6月12日

A comparison between initialization strategies for the infinite hidden Markov model

Arxiv

0+阅读 · 6月12日

Randomization for Faster Exact Optimization of Discounted Markov Decision Processes

Arxiv

0+阅读 · 6月3日

The Value Function Semi-Algebraic Set in Partially Observable Markov Decision Processes

Arxiv

0+阅读 · 6月2日

Minimax-Optimal Policy Regret in Partially Observable Markov Games

Arxiv

0+阅读 · 6月1日

Tight Sample Complexity Bounds for Entropic Best Policy Identification

Arxiv

0+阅读 · 5月13日

Fast Computation of Conditional Probabilities in MDPs and Markov Chain Families

Arxiv

0+阅读 · 5月13日

Ensuring Logic in the Fog: Sound POMDP Synthesis with LTL Objectives

Arxiv

0+阅读 · 5月12日

VIP会员

文章信息

相关主题

Processing（编程语言）

最新内容

《美国空军B-2“幽灵”隐身轰炸机系统工程案例研究》117页

《美国空军B-2“幽灵”隐身轰炸机系统工程案例研究》117页

专知会员服务

5+阅读 · 今天4:35

隐身技术前沿综述：物理机理、工程实践与战略展望

隐身技术前沿综述：物理机理、工程实践与战略展望

专知会员服务

3+阅读 · 今天4:24

《多变海洋环境下无人水面艇与自主水下机器人对接的最优路径规划》

《多变海洋环境下无人水面艇与自主水下机器人对接的最优路径规划》

专知会员服务

3+阅读 · 今天4:18

《以机反机：基于无人机载麦克风的空中周界入侵检测》

《以机反机：基于无人机载麦克风的空中周界入侵检测》

专知会员服务

4+阅读 · 今天4:15

《无人机脆弱性利用：网络空间力量的新域》

《无人机脆弱性利用：网络空间力量的新域》

专知会员服务

2+阅读 · 今天4:08

美空军如何将人工智能从战场部署至后方机关

美空军如何将人工智能从战场部署至后方机关

专知会员服务

11+阅读 · 7月31日

《美战争部指令文件：网络空间效应与使能能力测试评估》

《美战争部指令文件：网络空间效应与使能能力测试评估》

专知会员服务

7+阅读 · 7月31日

《史诗怒火行动：多域前瞻评估》49页报告

《史诗怒火行动：多域前瞻评估》49页报告

专知会员服务

7+阅读 · 7月31日

《英国防部：未来空战系统数字化战略》33页

《英国防部：未来空战系统数字化战略》33页

专知会员服务

5+阅读 · 7月31日

《面向自主飞行网络的智能体人工智能架构》

《面向自主飞行网络的智能体人工智能架构》

专知会员服务

7+阅读 · 7月31日

“史诗怒火”行动：现代多域作战的重要节点

“史诗怒火”行动：现代多域作战的重要节点

专知会员服务

8+阅读 · 7月30日

《下一代无线网络中的多无人机通信资源管理》

《下一代无线网络中的多无人机通信资源管理》

专知会员服务

8+阅读 · 7月30日

《高分辨率模拟下的聚合战斗建模：以“会战交锋”场景为例》

《高分辨率模拟下的聚合战斗建模：以“会战交锋”场景为例》

专知会员服务

9+阅读 · 7月30日

《人机协同在安全关键型操作决策中的应用》120页

《人机协同在安全关键型操作决策中的应用》120页

专知会员服务

8+阅读 · 7月30日

网络防御与空中力量网络防护：21世纪空中力量历史与理论的启示

网络防御与空中力量网络防护：21世纪空中力量历史与理论的启示

专知会员服务

6+阅读 · 7月30日

相关VIP内容

《结构化部分可观测下的序贯决策研究》2026年300页

《结构化部分可观测下的序贯决策研究》2026年300页

专知会员服务

16+阅读 · 7月11日

《自适应鲁棒马尔可夫决策过程：协同作战飞机（CCA）对抗性监视任务应用》44页技术报告

《自适应鲁棒马尔可夫决策过程：协同作战飞机（CCA）对抗性监视任务应用》44页技术报告

专知会员服务

27+阅读 · 2025年12月9日

《概率结果下全局最优决策的高效树生成方法》最新30页报告

《概率结果下全局最优决策的高效树生成方法》最新30页报告

专知会员服务

17+阅读 · 2025年5月6日

【普林斯顿博士论文】高效决策背后的结构化表征

【普林斯顿博士论文】高效决策背后的结构化表征

专知会员服务

40+阅读 · 2024年11月26日

McGill大学等最新《不确定性决策下的上下文优化方法》综述

McGill大学等最新《不确定性决策下的上下文优化方法》综述

专知会员服务

33+阅读 · 2023年6月25日

【伯克利博士论文】不确定性序列决策:最优性保证，组合学习，以及在机器人技术和生态学中的应用，256页pdf

【伯克利博士论文】不确定性序列决策:最优性保证，组合学习，以及在机器人技术和生态学中的应用，256页pdf

专知会员服务

39+阅读 · 2023年5月17日

《可解释决策算法和可问责决策算法之间的冲突》2022最新18页论文

《可解释决策算法和可问责决策算法之间的冲突》2022最新18页论文

专知会员服务

51+阅读 · 2022年11月20日

《多目标响应面可取性函数最优点评价的统计推断》2022最新295页博士论文【含代码】，美国空军技术学院

《多目标响应面可取性函数最优点评价的统计推断》2022最新295页博士论文【含代码】，美国空军技术学院

专知会员服务

30+阅读 · 2022年11月3日

策略梯度方法的算子视图，An operator view of policy gradient methods

策略梯度方法的算子视图，An operator view of policy gradient methods

专知会员服务

11+阅读 · 2020年6月23日

【谷歌大脑新论文】利用可微摄动优化器进行学习，Learning with Differentiable Perturbed Optimizers

【谷歌大脑新论文】利用可微摄动优化器进行学习，Learning with Differentiable Perturbed Optimizers

专知会员服务

29+阅读 · 2020年2月22日

热门VIP内容

开通专知VIP会员享更多权益服务

隐身技术前沿综述：物理机理、工程实践与战略展望

《以机反机：基于无人机载麦克风的空中周界入侵检测》

《美国空军B-2“幽灵”隐身轰炸机系统工程案例研究》117页

《多变海洋环境下无人水面艇与自主水下机器人对接的最优路径规划》

相关资讯

【佐治亚理工博士论文】基于策略智能体和有限反馈的序列决策，211页pdf

【佐治亚理工博士论文】基于策略智能体和有限反馈的序列决策，211页pdf

专知

39+阅读 · 2023年4月13日

推荐！《不确定性下的作战决策：推理、序贯和对抗性方法》美国空军293页博士论文，含代码

推荐！《不确定性下的作战决策：推理、序贯和对抗性方法》美国空军293页博士论文，含代码

专知

52+阅读 · 2022年11月16日

推荐！【中文版】美国陆军《用于决策动力学、欺骗和博弈论的新型人工智能决策辅助工具》52页技术总结报告

推荐！【中文版】美国陆军《用于决策动力学、欺骗和博弈论的新型人工智能决策辅助工具》52页技术总结报告

专知

84+阅读 · 2022年7月7日

论文浅尝｜简单高效的知识图谱表示学习负样本采样方法

论文浅尝｜简单高效的知识图谱表示学习负样本采样方法

开放知识图谱

14+阅读 · 2021年7月25日

一文带你读懂 DeconvNet 上采样层（语义分割）

一文带你读懂 DeconvNet 上采样层（语义分割）

AI研习社

26+阅读 · 2019年3月16日

Github 项目推荐 | 论文的代码实现：可变形ConvNets v2的PyTorch实现

Github 项目推荐 | 论文的代码实现：可变形ConvNets v2的PyTorch实现

AI研习社

22+阅读 · 2019年1月10日

【论文推荐】最新6篇视觉问答（VQA）相关论文—目标推理、深度循环模型、可解释性、数据可视化、Triplet学习、基准

【论文推荐】最新6篇视觉问答（VQA）相关论文—目标推理、深度循环模型、可解释性、数据可视化、Triplet学习、基准

专知

15+阅读 · 2018年2月3日

【干货】终极入门马尔可夫网络 (Markov Networks)——概率图模型

【干货】终极入门马尔可夫网络 (Markov Networks)——概率图模型

机器学习研究会

31+阅读 · 2018年1月7日

不用数学也能讲清贝叶斯理论的马尔可夫链蒙特卡洛方法？这篇文章做到了

不用数学也能讲清贝叶斯理论的马尔可夫链蒙特卡洛方法？这篇文章做到了

AI100

11+阅读 · 2017年12月24日

【论文】变分推断（Variational inference)的总结

【论文】变分推断（Variational inference)的总结

机器学习研究会

39+阅读 · 2017年11月16日

相关论文

Learning Policy from a Single Trajectory in Average-Reward Markov Decision Process

Arxiv

0+阅读 · 6月15日

Lyapunov-Based Sample Complexity Analysis for Weakly-Coupled MDPs

Arxiv

0+阅读 · 6月15日

Asymptotically Optimal Sequential Testing with Markovian Data

Arxiv

0+阅读 · 6月12日

A comparison between initialization strategies for the infinite hidden Markov model

Arxiv

0+阅读 · 6月12日

Randomization for Faster Exact Optimization of Discounted Markov Decision Processes

Arxiv

0+阅读 · 6月3日

The Value Function Semi-Algebraic Set in Partially Observable Markov Decision Processes

Arxiv

0+阅读 · 6月2日

Minimax-Optimal Policy Regret in Partially Observable Markov Games

Arxiv

0+阅读 · 6月1日

Tight Sample Complexity Bounds for Entropic Best Policy Identification

Arxiv

0+阅读 · 5月13日

Fast Computation of Conditional Probabilities in MDPs and Markov Chain Families

Arxiv

0+阅读 · 5月13日

Ensuring Logic in the Fog: Sound POMDP Synthesis with LTL Objectives

Arxiv

0+阅读 · 5月12日

相关基金

基于马尔科夫信道模型的无线网络通信系统时延性能研究

国家自然科学基金

0+阅读 · 2015年12月31日

连续时间马氏决策过程受约束问题的研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于深度学习和马尔科夫逻辑网络的特殊视频识别研究

国家自然科学基金

0+阅读 · 2015年12月31日

有理 Krylov 子空间算法的最优参数选取

国家自然科学基金

0+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

基于GEP的可拓策略自组织生成理论与方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于离散化Lyapunov-Krasovskii泛函方法的时滞Markov跳变系统分析与综合

国家自然科学基金

0+阅读 · 2015年12月31日

机制转化下的最优停时问题研究---以金融中投资决策分析为例

国家自然科学基金

2+阅读 · 2014年12月31日

多域网络安全的异构策略语义形态与验证机制

国家自然科学基金

0+阅读 · 2014年12月31日

保险中两类随机最优控制问题及策略过程概率分布研究

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员