部分可观测系统中确定性等价策略的次优性界 (Sub-optimality bounds for certainty equivalent policies in partially observed systems) - 专知论文

会员服务 ·

0

系统 · 最优 · 代价 · 线性系统 · 随机控制 ·

Sub-optimality bounds for certainty equivalent policies in partially observed systems

翻译：部分可观测系统中确定性等价策略的次优性界

Berk Bozkurt,Aditya Mahajan,Ashutosh Nayyar,Yi Ouyang

from arxiv, 12 pages, 0 figures

In this paper, we present a generalization of the certainty equivalence principle of stochastic control. One interpretation of the classical certainty equivalence principle for linear systems with output feedback and quadratic costs is as follows: the optimal action at each time is obtained by evaluating the optimal state-feedback policy of the stochastic linear system at the minimum mean square error (MMSE) estimate of the state. Motivated by this interpretation, we consider certainty equivalent policies for general (non-linear) partially observed stochastic systems that allow for any state estimate rather than restricting to MMSE estimates. In such settings, the certainty equivalent policy is not optimal. For models where the cost and the dynamics are smooth in an appropriate sense, we derive upper bounds on the sub-optimality of certainty equivalent policies. We present several examples to illustrate the results.

翻译：本文提出了随机控制中确定性等价原理的一个推广。对于具有输出反馈和二次代价的线性系统，经典确定性等价原理的一种解释如下：每个时刻的最优动作是通过在状态的最小均方误差（MMSE）估计处评估随机线性系统的最优状态反馈策略而得到的。受此解释启发，我们考虑一般（非线性）部分可观测随机系统的确定性等价策略，这些策略允许使用任意状态估计而非仅限于MMSE估计。在此类设定下，确定性等价策略并非最优。针对代价函数和系统动力学在适当意义上光滑的模型，我们推导了确定性等价策略次优性的上界。我们通过若干算例对结果进行了说明。

0

相关内容

《主观概率约束下寻找可行系统及其军事应用》69页

《主观概率约束下寻找可行系统及其军事应用》69页

专知会员服务

26+阅读 · 2025年9月27日

【ETHZ博士论文】分布不确定性下的决策，234页pdf

【ETHZ博士论文】分布不确定性下的决策，234页pdf

专知会员服务

49+阅读 · 2024年4月5日

【普林斯顿博士论文】从博弈论视角看控制中的鲁棒性，266页pdf

【普林斯顿博士论文】从博弈论视角看控制中的鲁棒性，266页pdf

专知会员服务

40+阅读 · 2024年2月27日

【ETHZ博士论文】贝叶斯优化：风险规避与计算效率决策，183页pdf

【ETHZ博士论文】贝叶斯优化：风险规避与计算效率决策，183页pdf

专知会员服务

30+阅读 · 2024年1月19日

【牛津大学博士论文】结合统计学习的自适应鲁棒控制, 164页pdf

【牛津大学博士论文】结合统计学习的自适应鲁棒控制, 164页pdf

专知会员服务

21+阅读 · 2023年6月24日

《基于因子图模型的非视线定位鲁棒误差估计》美国空军技术学院2022最新27页论文

《基于因子图模型的非视线定位鲁棒误差估计》美国空军技术学院2022最新27页论文

专知会员服务

14+阅读 · 2022年10月18日

【干货书】随机优化方法在工程与运筹学中的应用，368页pdf

【干货书】随机优化方法在工程与运筹学中的应用，368页pdf

专知会员服务

77+阅读 · 2022年9月27日

2022最新综述《贝叶斯视角下深度学习分类系统中的不确定性估计综述》巴塞罗那大学

2022最新综述《贝叶斯视角下深度学习分类系统中的不确定性估计综述》巴塞罗那大学

专知会员服务

58+阅读 · 2022年7月26日

【普林斯顿干货书】强化学习与随机优化，728页pdf阐述序列决策统一框架

【普林斯顿干货书】强化学习与随机优化，728页pdf阐述序列决策统一框架

专知会员服务

131+阅读 · 2021年4月25日

【AAAI 2019 Tutorial】不确定性下基于知识的顺序决策（Knowledge-based Sequential Decision-Making under Uncertainty），张世琦，Mohan Sridharan

【AAAI 2019 Tutorial】不确定性下基于知识的顺序决策（Knowledge-based Sequential Decision-Making under Uncertainty），张世琦，Mohan Sridharan

专知会员服务

13+阅读 · 2019年11月18日

【佐治亚理工博士论文】基于策略智能体和有限反馈的序列决策，211页pdf

【佐治亚理工博士论文】基于策略智能体和有限反馈的序列决策，211页pdf

专知

38+阅读 · 2023年4月13日

推荐！《不确定性下的作战决策：推理、序贯和对抗性方法》美国空军293页博士论文，含代码

推荐！《不确定性下的作战决策：推理、序贯和对抗性方法》美国空军293页博士论文，含代码

专知

47+阅读 · 2022年11月16日

【干货书】凸随机优化，320页pdf

【干货书】凸随机优化，320页pdf

专知

12+阅读 · 2022年9月16日

【干货书】深度不确定性条件下的决策:理论到实践，408页pdf

【干货书】深度不确定性条件下的决策:理论到实践，408页pdf

专知

17+阅读 · 2021年1月18日

【干货书-斯坦福】最优化算法，521页pdf，《Algorithms for Optimization》MIT出版社

【干货书-斯坦福】最优化算法，521页pdf，《Algorithms for Optimization》MIT出版社

专知

58+阅读 · 2020年7月2日

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

AINLP

19+阅读 · 2020年6月14日

(普林斯顿讲义)：高维概率论，326页pdf《Probability in High Dimension》

(普林斯顿讲义)：高维概率论，326页pdf《Probability in High Dimension》

专知

21+阅读 · 2020年5月30日

稀疏性的3个优势 -《稀疏统计学习及其应用》

稀疏性的3个优势 -《稀疏统计学习及其应用》

遇见数学

15+阅读 · 2018年10月24日

【学科发展报告】自适应动态规划

【学科发展报告】自适应动态规划

中国自动化学会

25+阅读 · 2018年9月14日

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

机器学习研究会

19+阅读 · 2018年3月11日

逻辑等价算子在不确定性推理中的应用

国家自然科学基金

1+阅读 · 2015年12月31日

基于非凸控制区域的倒向重随机控制系统最优控制必要条件的研究

国家自然科学基金

0+阅读 · 2015年12月31日

若干偏微分方程控制系统的适定正则性及稳定性分析

国家自然科学基金

0+阅读 · 2015年12月31日

有限范围随机最优控制系统的数值方法与均场倒向随机系统的最优控制问题研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于扩展状态观测器的不确定分数阶系统镇定设计

国家自然科学基金

0+阅读 · 2015年12月31日

非线性不确定系统的齐次控制理论及应用研究

国家自然科学基金

0+阅读 · 2015年12月31日

随机递归最优控制及其在金融中的应用研究

国家自然科学基金

0+阅读 · 2014年12月31日

随机动态系统的风险分析及其最优控制问题

国家自然科学基金

1+阅读 · 2014年12月31日

具摩擦非线性系统随机振动分析与最优控制

国家自然科学基金

0+阅读 · 2014年12月31日

基于动态规划粘性解及特征正交分解降维方法的偏微分方程最优控制

国家自然科学基金

0+阅读 · 2014年12月31日

Partial Optimality in the Preordering Problem

Arxiv

0+阅读 · 2月19日

Optimization under uncertainty: understanding orders and testing programs with specifications

Arxiv

0+阅读 · 2月13日

Tight Efficiency Bounds for the Probabilistic Serial and Related Mechanisms

Arxiv

0+阅读 · 2月12日

Rate-Reliability Tradeoff for Deterministic Identification over Gaussian Channels

Arxiv

0+阅读 · 2月12日

It's all In the (Exponential) Family: An Equivalence between Maximum Likelihood Estimation and Control Variates for Sketching Algorithms

Arxiv

0+阅读 · 2月4日

Bias-Optimal Bounds for SGD: A Computer-Aided Lyapunov Analysis

Arxiv

0+阅读 · 1月30日

It's all the (Exponential) Family: An Equivalence between Maximum Likelihood Estimation and Control Variates for Sketching Algorithms

Arxiv

0+阅读 · 1月29日

On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization

Arxiv

0+阅读 · 1月29日

Derandomizing Simultaneous Confidence Regions for Band-Limited Functions by Improved Norm Bounds and Majority-Voting Schemes

Arxiv

0+阅读 · 1月23日

On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization

Arxiv

0+阅读 · 1月21日

VIP会员

文章信息

相关主题

相关VIP内容

《主观概率约束下寻找可行系统及其军事应用》69页

《主观概率约束下寻找可行系统及其军事应用》69页

专知会员服务

26+阅读 · 2025年9月27日

【ETHZ博士论文】分布不确定性下的决策，234页pdf

【ETHZ博士论文】分布不确定性下的决策，234页pdf

专知会员服务

49+阅读 · 2024年4月5日

【普林斯顿博士论文】从博弈论视角看控制中的鲁棒性，266页pdf

【普林斯顿博士论文】从博弈论视角看控制中的鲁棒性，266页pdf

专知会员服务

40+阅读 · 2024年2月27日

【ETHZ博士论文】贝叶斯优化：风险规避与计算效率决策，183页pdf

【ETHZ博士论文】贝叶斯优化：风险规避与计算效率决策，183页pdf

专知会员服务

30+阅读 · 2024年1月19日

【牛津大学博士论文】结合统计学习的自适应鲁棒控制, 164页pdf

【牛津大学博士论文】结合统计学习的自适应鲁棒控制, 164页pdf

专知会员服务

21+阅读 · 2023年6月24日

《基于因子图模型的非视线定位鲁棒误差估计》美国空军技术学院2022最新27页论文

《基于因子图模型的非视线定位鲁棒误差估计》美国空军技术学院2022最新27页论文

专知会员服务

14+阅读 · 2022年10月18日

【干货书】随机优化方法在工程与运筹学中的应用，368页pdf

【干货书】随机优化方法在工程与运筹学中的应用，368页pdf

专知会员服务

77+阅读 · 2022年9月27日

2022最新综述《贝叶斯视角下深度学习分类系统中的不确定性估计综述》巴塞罗那大学

2022最新综述《贝叶斯视角下深度学习分类系统中的不确定性估计综述》巴塞罗那大学

专知会员服务

58+阅读 · 2022年7月26日

【普林斯顿干货书】强化学习与随机优化，728页pdf阐述序列决策统一框架

【普林斯顿干货书】强化学习与随机优化，728页pdf阐述序列决策统一框架

专知会员服务

131+阅读 · 2021年4月25日

【AAAI 2019 Tutorial】不确定性下基于知识的顺序决策（Knowledge-based Sequential Decision-Making under Uncertainty），张世琦，Mohan Sridharan

【AAAI 2019 Tutorial】不确定性下基于知识的顺序决策（Knowledge-based Sequential Decision-Making under Uncertainty），张世琦，Mohan Sridharan

专知会员服务

13+阅读 · 2019年11月18日

热门VIP内容

开通专知VIP会员享更多权益服务

《无人机与战争：被忽视的环境影响及无人机保护潜力》

俄罗斯规划未来无人机驱动军队

《整合杀伤链：一个用于边缘目标验证与战术推理的零样本框架》最新资料

《人工智能、武器与影响力：前沿模型在模拟核危机中展现复杂推理》2026最新46页报告

相关资讯

【佐治亚理工博士论文】基于策略智能体和有限反馈的序列决策，211页pdf

【佐治亚理工博士论文】基于策略智能体和有限反馈的序列决策，211页pdf

专知

38+阅读 · 2023年4月13日

推荐！《不确定性下的作战决策：推理、序贯和对抗性方法》美国空军293页博士论文，含代码

推荐！《不确定性下的作战决策：推理、序贯和对抗性方法》美国空军293页博士论文，含代码

专知

47+阅读 · 2022年11月16日

【干货书】凸随机优化，320页pdf

【干货书】凸随机优化，320页pdf

专知

12+阅读 · 2022年9月16日

【干货书】深度不确定性条件下的决策:理论到实践，408页pdf

【干货书】深度不确定性条件下的决策:理论到实践，408页pdf

专知

17+阅读 · 2021年1月18日

【干货书-斯坦福】最优化算法，521页pdf，《Algorithms for Optimization》MIT出版社

【干货书-斯坦福】最优化算法，521页pdf，《Algorithms for Optimization》MIT出版社

专知

58+阅读 · 2020年7月2日

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

AINLP

19+阅读 · 2020年6月14日

(普林斯顿讲义)：高维概率论，326页pdf《Probability in High Dimension》

(普林斯顿讲义)：高维概率论，326页pdf《Probability in High Dimension》

专知

21+阅读 · 2020年5月30日

稀疏性的3个优势 -《稀疏统计学习及其应用》

稀疏性的3个优势 -《稀疏统计学习及其应用》

遇见数学

15+阅读 · 2018年10月24日

【学科发展报告】自适应动态规划

【学科发展报告】自适应动态规划

中国自动化学会

25+阅读 · 2018年9月14日

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

机器学习研究会

19+阅读 · 2018年3月11日

相关论文

Partial Optimality in the Preordering Problem

Arxiv

0+阅读 · 2月19日

Optimization under uncertainty: understanding orders and testing programs with specifications

Arxiv

0+阅读 · 2月13日

Tight Efficiency Bounds for the Probabilistic Serial and Related Mechanisms

Arxiv

0+阅读 · 2月12日

Rate-Reliability Tradeoff for Deterministic Identification over Gaussian Channels

Arxiv

0+阅读 · 2月12日

It's all In the (Exponential) Family: An Equivalence between Maximum Likelihood Estimation and Control Variates for Sketching Algorithms

Arxiv

0+阅读 · 2月4日

Bias-Optimal Bounds for SGD: A Computer-Aided Lyapunov Analysis

Arxiv

0+阅读 · 1月30日

It's all the (Exponential) Family: An Equivalence between Maximum Likelihood Estimation and Control Variates for Sketching Algorithms

Arxiv

0+阅读 · 1月29日

On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization

Arxiv

0+阅读 · 1月29日

Derandomizing Simultaneous Confidence Regions for Band-Limited Functions by Improved Norm Bounds and Majority-Voting Schemes

Arxiv

0+阅读 · 1月23日

On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization

Arxiv

0+阅读 · 1月21日

相关基金

逻辑等价算子在不确定性推理中的应用

国家自然科学基金

1+阅读 · 2015年12月31日

基于非凸控制区域的倒向重随机控制系统最优控制必要条件的研究

国家自然科学基金

0+阅读 · 2015年12月31日

若干偏微分方程控制系统的适定正则性及稳定性分析

国家自然科学基金

0+阅读 · 2015年12月31日

有限范围随机最优控制系统的数值方法与均场倒向随机系统的最优控制问题研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于扩展状态观测器的不确定分数阶系统镇定设计

国家自然科学基金

0+阅读 · 2015年12月31日

非线性不确定系统的齐次控制理论及应用研究

国家自然科学基金

0+阅读 · 2015年12月31日

随机递归最优控制及其在金融中的应用研究

国家自然科学基金

0+阅读 · 2014年12月31日

随机动态系统的风险分析及其最优控制问题

国家自然科学基金

1+阅读 · 2014年12月31日

具摩擦非线性系统随机振动分析与最优控制

国家自然科学基金

0+阅读 · 2014年12月31日

基于动态规划粘性解及特征正交分解降维方法的偏微分方程最优控制

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员