基于Wasserstein与Kalman-Wasserstein KL散度的适定KL正则化控制 (Well-Posed KL-Regularized Control via Wasserstein and Kalman-Wasserstein KL Divergences) - 专知论文

会员服务 ·

0

正则化 · 散度 · 噪声 · KL散度 · 退化 ·

Well-Posed KL-Regularized Control via Wasserstein and Kalman-Wasserstein KL Divergences

翻译：基于Wasserstein与Kalman-Wasserstein KL散度的适定KL正则化控制

Viktor Stein,Adwait Datar,Nihat Ay

from arxiv, 37 pages, 9 figures, comments welcome

Kullback-Leibler divergence (KL) regularization is widely used in reinforcement learning, but it becomes infinite under support mismatch and can degenerate in low-noise limits. Utilizing a unified information-geometric framework, we introduce (Kalman)-Wasserstein-based KL analogues by replacing the Fisher-Rao geometry in the dynamical formulation of the KL with transport-based geometries, and we derive closed-form values for common distribution families. These divergences remain finite under support mismatch and yield a geometric interpretation of regularization heuristics used in Kalman ensemble methods. We demonstrate the utility of these divergences in KL-regularized optimal control. In the fully tractable setting of linear time-invariant systems with Gaussian process noise, the classical KL reduces to a quadratic control penalty that becomes singular as process noise vanishes. Our variants remove this singularity, yielding well-posed problems. On a double integrator and a cart-pole example, the resulting controls outperform KL-based regularization.

翻译：Kullback-Leibler散度（KL正则化）在强化学习中被广泛使用，但在支撑集不匹配时会变为无穷大，且在低噪声极限下可能退化。利用统一的信息几何框架，我们通过将KL动态表述中的Fisher-Rao几何替换为基于传输的几何，引入了（Kalman）-Wasserstein基KL类比，并推导了常见分布族的闭式值。这些散度在支撑集不匹配时保持有限，并为Kalman集成方法中使用的正则化启发式提供了几何解释。我们展示了这些散度在KL正则化最优控制中的实用性。在具有高斯过程噪声的线性时不变系统的完全可处理设定中，经典KL退化为二次控制惩罚项，并随着过程噪声消失而变得奇异。我们的变体消除了这一奇异性，从而产生适定问题。在双积分器和倒立摆示例中，所得控制性能优于基于KL的正则化方法。

0

相关内容

正则化

在数学，统计学和计算机科学中，尤其是在机器学习和逆问题中，正则化是添加信息以解决不适定问题或防止过度拟合的过程。正则化适用于不适定的优化问题中的目标函数。

扩散模型如何做好可控生成？基于奖励引导的控制生成用于扩散模型中的推理时对齐：教程与综述

扩散模型如何做好可控生成？基于奖励引导的控制生成用于扩散模型中的推理时对齐：教程与综述

专知会员服务

21+阅读 · 2025年1月20日

【ICML2024】基于正则化的持续学习的统计理论

【ICML2024】基于正则化的持续学习的统计理论

专知会员服务

21+阅读 · 2024年6月11日

【博士论文】机器学习中的熵最优传输:在分布回归、重心估计和概率匹配中的应用，209页pdf

【博士论文】机器学习中的熵最优传输:在分布回归、重心估计和概率匹配中的应用，209页pdf

专知会员服务

37+阅读 · 2022年5月23日

【ICML2021】张量分解的隐式正则化

专知会员服务

21+阅读 · 2021年8月24日

【ICML2021】在线与非随机控制，普林斯顿等教程，82页ppt

专知会员服务

21+阅读 · 2021年7月28日

【深度学习中的隐式正则化】从矩阵和张量分解中得到的教训，141页ppt

【深度学习中的隐式正则化】从矩阵和张量分解中得到的教训，141页ppt

专知会员服务

59+阅读 · 2021年4月5日

图机器学习-图拉普拉斯算子的离散正则性，141页ppt，Discrete regularity graph Laplacians

专知会员服务

29+阅读 · 2020年6月4日

【MIT】对抗鲁棒性的流形正则化，Manifold Regularization for Adversarial Robustness

【MIT】对抗鲁棒性的流形正则化，Manifold Regularization for Adversarial Robustness

专知会员服务

28+阅读 · 2020年3月11日

【Nature论文】深度网络中的梯度下降复杂度控制

【Nature论文】深度网络中的梯度下降复杂度控制

专知会员服务

41+阅读 · 2020年3月9日

【斯坦福大学】Dropout的隐性和显性正则化效应，Regularization Effects

【斯坦福大学】Dropout的隐性和显性正则化效应，Regularization Effects

专知会员服务

34+阅读 · 2020年3月4日

强化学习如何可解释？浙大最新《可解释强化学习》综述，37页pdf1阐述XRL概念、算法、挑战

强化学习如何可解释？浙大最新《可解释强化学习》综述，37页pdf1阐述XRL概念、算法、挑战

专知

10+阅读 · 2022年11月17日

基于模型的强化学习综述

基于模型的强化学习综述

专知

42+阅读 · 2022年7月13日

注意力机制 | 图卷积多跳注意力机制 | Direct multi-hop Attention based GNN

注意力机制 | 图卷积多跳注意力机制 | Direct multi-hop Attention based GNN

AINLP

22+阅读 · 2020年11月29日

【ICML2020】拉普拉斯正则化小样本学习，Laplacian Regularized Few-Shot Learning

【ICML2020】拉普拉斯正则化小样本学习，Laplacian Regularized Few-Shot Learning

专知

27+阅读 · 2020年7月3日

从泰勒展开来看梯度下降算法

从泰勒展开来看梯度下降算法

深度学习每日摘要

13+阅读 · 2019年4月9日

详解GAN的谱归一化（Spectral Normalization）

详解GAN的谱归一化（Spectral Normalization）

PaperWeekly

11+阅读 · 2019年2月13日

如何用Keras来构建LSTM模型，并且调参

如何用Keras来构建LSTM模型，并且调参

AI研习社

19+阅读 · 2019年2月8日

从香农熵到手推KL散度：一文带你纵览机器学习中的信息论

从香农熵到手推KL散度：一文带你纵览机器学习中的信息论

算法与数学之美

10+阅读 · 2018年1月14日

最新｜深度离散哈希算法，可用于图像检索！

最新｜深度离散哈希算法，可用于图像检索！

全球人工智能

14+阅读 · 2017年12月15日

EKF常用于目标跟踪系统的扩展卡尔曼滤波器

EKF常用于目标跟踪系统的扩展卡尔曼滤波器

无人机

10+阅读 · 2017年7月25日

液晶动力学系统部分正则性和适定性的研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于Lowrank分解的谱方法和有限差分地震正演模拟

国家自然科学基金

0+阅读 · 2015年12月31日

一类稳态Schödinger-Poisson-Slater方程标准化解的研究

国家自然科学基金

1+阅读 · 2015年12月31日

退化抛物型方程的熵解适定性研究

国家自然科学基金

0+阅读 · 2015年12月31日

若干偏微分方程控制系统的适定正则性及稳定性分析

国家自然科学基金

0+阅读 · 2015年12月31日

关于全空间上一类Kirchhoff型方程正解的存在性和多重性的研究

国家自然科学基金

0+阅读 · 2015年12月31日

退化耗散型双曲系统的整体适定性与稳定性研究

国家自然科学基金

0+阅读 · 2014年12月31日

带跳非耦合正倒向随机微分方程的Crank-Nicolson数值解法研究

国家自然科学基金

0+阅读 · 2014年12月31日

分数阶扩散方程反向问题的正则化理论与算法研究

国家自然科学基金

0+阅读 · 2014年12月31日

Kahler 曲面中特殊曲面的研究

国家自然科学基金

0+阅读 · 2014年12月31日

On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning

Arxiv

0+阅读 · 2月19日

Universal Asymptotics for Jensen--Shannon Divergence under Shuffling

Arxiv

0+阅读 · 2月16日

Sequential Monte Carlo approximations of Wasserstein--Fisher--Rao gradient flows

Arxiv

0+阅读 · 2月10日

Radon--Wasserstein Gradient Flows for Interacting-Particle Sampling in High Dimensions

Arxiv

0+阅读 · 2月6日

Generalized Pinsker Inequality for Bregman Divergences of Negative Tsallis Entropies

Arxiv

0+阅读 · 2月5日

Radon--Wasserstein Gradient Flows for Interacting-Particle Sampling in High Dimensions

Arxiv

0+阅读 · 2月5日

Achieving Logarithmic Regret in KL-Regularized Zero-Sum Markov Games

Arxiv

0+阅读 · 2月4日

Improved Stochastic Optimization of LogSumExp

Arxiv

0+阅读 · 2月3日

Relaxed Triangle Inequality for Kullback-Leibler Divergence Between Multivariate Gaussian Distributions

Arxiv

0+阅读 · 1月31日

Calibrating Generative Models to Distributional Constraints

Arxiv

0+阅读 · 1月14日

VIP会员

文章信息

相关主题

相关VIP内容

扩散模型如何做好可控生成？基于奖励引导的控制生成用于扩散模型中的推理时对齐：教程与综述

扩散模型如何做好可控生成？基于奖励引导的控制生成用于扩散模型中的推理时对齐：教程与综述

专知会员服务

21+阅读 · 2025年1月20日

【ICML2024】基于正则化的持续学习的统计理论

【ICML2024】基于正则化的持续学习的统计理论

专知会员服务

21+阅读 · 2024年6月11日

【博士论文】机器学习中的熵最优传输:在分布回归、重心估计和概率匹配中的应用，209页pdf

【博士论文】机器学习中的熵最优传输:在分布回归、重心估计和概率匹配中的应用，209页pdf

专知会员服务

37+阅读 · 2022年5月23日

【ICML2021】张量分解的隐式正则化

专知会员服务

21+阅读 · 2021年8月24日

【ICML2021】在线与非随机控制，普林斯顿等教程，82页ppt

专知会员服务

21+阅读 · 2021年7月28日

【深度学习中的隐式正则化】从矩阵和张量分解中得到的教训，141页ppt

【深度学习中的隐式正则化】从矩阵和张量分解中得到的教训，141页ppt

专知会员服务

59+阅读 · 2021年4月5日

图机器学习-图拉普拉斯算子的离散正则性，141页ppt，Discrete regularity graph Laplacians

专知会员服务

29+阅读 · 2020年6月4日

【MIT】对抗鲁棒性的流形正则化，Manifold Regularization for Adversarial Robustness

【MIT】对抗鲁棒性的流形正则化，Manifold Regularization for Adversarial Robustness

专知会员服务

28+阅读 · 2020年3月11日

【Nature论文】深度网络中的梯度下降复杂度控制

【Nature论文】深度网络中的梯度下降复杂度控制

专知会员服务

41+阅读 · 2020年3月9日

【斯坦福大学】Dropout的隐性和显性正则化效应，Regularization Effects

【斯坦福大学】Dropout的隐性和显性正则化效应，Regularization Effects

专知会员服务

34+阅读 · 2020年3月4日

热门VIP内容

开通专知VIP会员享更多权益服务

《可信人工智能赋能系统的支柱》

《从经典神经网络到不确定性下的拓扑神经网络：军事应用》2026最新40页报告

人工智能赋能边缘与自主系统：美陆军现代化进程聚焦威胁探测与战术边缘情报

《人工智能：对战略与力量的影响》slides

相关资讯

强化学习如何可解释？浙大最新《可解释强化学习》综述，37页pdf1阐述XRL概念、算法、挑战

强化学习如何可解释？浙大最新《可解释强化学习》综述，37页pdf1阐述XRL概念、算法、挑战

专知

10+阅读 · 2022年11月17日

基于模型的强化学习综述

基于模型的强化学习综述

专知

42+阅读 · 2022年7月13日

注意力机制 | 图卷积多跳注意力机制 | Direct multi-hop Attention based GNN

注意力机制 | 图卷积多跳注意力机制 | Direct multi-hop Attention based GNN

AINLP

22+阅读 · 2020年11月29日

【ICML2020】拉普拉斯正则化小样本学习，Laplacian Regularized Few-Shot Learning

【ICML2020】拉普拉斯正则化小样本学习，Laplacian Regularized Few-Shot Learning

专知

27+阅读 · 2020年7月3日

从泰勒展开来看梯度下降算法

从泰勒展开来看梯度下降算法

深度学习每日摘要

13+阅读 · 2019年4月9日

详解GAN的谱归一化（Spectral Normalization）

详解GAN的谱归一化（Spectral Normalization）

PaperWeekly

11+阅读 · 2019年2月13日

如何用Keras来构建LSTM模型，并且调参

如何用Keras来构建LSTM模型，并且调参

AI研习社

19+阅读 · 2019年2月8日

从香农熵到手推KL散度：一文带你纵览机器学习中的信息论

从香农熵到手推KL散度：一文带你纵览机器学习中的信息论

算法与数学之美

10+阅读 · 2018年1月14日

最新｜深度离散哈希算法，可用于图像检索！

最新｜深度离散哈希算法，可用于图像检索！

全球人工智能

14+阅读 · 2017年12月15日

EKF常用于目标跟踪系统的扩展卡尔曼滤波器

EKF常用于目标跟踪系统的扩展卡尔曼滤波器

无人机

10+阅读 · 2017年7月25日

相关论文

On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning

Arxiv

0+阅读 · 2月19日

Universal Asymptotics for Jensen--Shannon Divergence under Shuffling

Arxiv

0+阅读 · 2月16日

Sequential Monte Carlo approximations of Wasserstein--Fisher--Rao gradient flows

Arxiv

0+阅读 · 2月10日

Radon--Wasserstein Gradient Flows for Interacting-Particle Sampling in High Dimensions

Arxiv

0+阅读 · 2月6日

Generalized Pinsker Inequality for Bregman Divergences of Negative Tsallis Entropies

Arxiv

0+阅读 · 2月5日

Radon--Wasserstein Gradient Flows for Interacting-Particle Sampling in High Dimensions

Arxiv

0+阅读 · 2月5日

Achieving Logarithmic Regret in KL-Regularized Zero-Sum Markov Games

Arxiv

0+阅读 · 2月4日

Improved Stochastic Optimization of LogSumExp

Arxiv

0+阅读 · 2月3日

Relaxed Triangle Inequality for Kullback-Leibler Divergence Between Multivariate Gaussian Distributions

Arxiv

0+阅读 · 1月31日

Calibrating Generative Models to Distributional Constraints

Arxiv

0+阅读 · 1月14日

相关基金

液晶动力学系统部分正则性和适定性的研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于Lowrank分解的谱方法和有限差分地震正演模拟

国家自然科学基金

0+阅读 · 2015年12月31日

一类稳态Schödinger-Poisson-Slater方程标准化解的研究

国家自然科学基金

1+阅读 · 2015年12月31日

退化抛物型方程的熵解适定性研究

国家自然科学基金

0+阅读 · 2015年12月31日

若干偏微分方程控制系统的适定正则性及稳定性分析

国家自然科学基金

0+阅读 · 2015年12月31日

关于全空间上一类Kirchhoff型方程正解的存在性和多重性的研究

国家自然科学基金

0+阅读 · 2015年12月31日

退化耗散型双曲系统的整体适定性与稳定性研究

国家自然科学基金

0+阅读 · 2014年12月31日

带跳非耦合正倒向随机微分方程的Crank-Nicolson数值解法研究

国家自然科学基金

0+阅读 · 2014年12月31日

分数阶扩散方程反向问题的正则化理论与算法研究

国家自然科学基金

0+阅读 · 2014年12月31日

Kahler 曲面中特殊曲面的研究

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员