Exploration via linearly perturbed loss minimisation - 专知论文

会员服务 ·

0

扰动 · 赌博机 · 损失 · 广义 · 结构 ·

Exploration via linearly perturbed loss minimisation

翻译：通过线性扰动损失最小化进行探索

David Janz,Shuai Liu,Alex Ayoub,Csaba Szepesvári

from arxiv, Updated with erratum note: Appendix I contains a gap in the proof; all main-paper claims remain valid via the corrected argument of Perneczky, Abeille & Janz (2026, arXiv:2606.00431)

We introduce exploration via linear loss perturbations (EVILL), a randomised exploration method for structured stochastic bandit problems that works by solving for the minimiser of a linearly perturbed regularised negative log-likelihood function. We show that, for the case of generalised linear bandits, EVILL reduces to perturbed history exploration (PHE), a method where exploration is done by training on randomly perturbed rewards. In doing so, we provide a simple and clean explanation of when and why random reward perturbations give rise to good bandit algorithms. We propose data-dependent perturbations not present in previous PHE-type methods that allow EVILL to match the performance of Thompson-sampling-style parameter-perturbation methods, both in theory and in practice. Moreover, we show an example outside generalised linear bandits where PHE leads to inconsistent estimates, and thus linear regret, while EVILL remains performant. Like PHE, EVILL can be implemented in just a few lines of code.

翻译：我们提出了通过线性损失扰动进行探索的方法（EVILL），这是一种适用于结构化随机赌博机问题的随机化探索方法，其原理是求解线性扰动正则化负对数似然函数的最小化器。我们证明，对于广义线性赌博机的情况，EVILL可简化为扰动历史探索（PHE）——一种通过对随机扰动奖励进行训练来实现探索的方法。在此过程中，我们清晰简洁地解释了随机奖励扰动何时及为何能产生良好的赌博机算法。我们提出了基于数据依赖的扰动机制（此为先前PHE类方法所不具备的），使EVILL在理论和实践上均能达到汤普森采样类参数扰动方法的性能。此外，我们展示了广义线性赌博机之外的一个实例：在该实例中PHE会导致估计不一致并产生线性遗憾，而EVILL仍能保持良好性能。与PHE相同，EVILL仅需数行代码即可实现。

0

相关内容

【CVPR2025】在去噪扩散模型中优化最短路径

【CVPR2025】在去噪扩散模型中优化最短路径

专知会员服务

16+阅读 · 2025年3月10日

《利用近端策略优化估计最佳飞行轨迹》最新140页

《利用近端策略优化估计最佳飞行轨迹》最新140页

专知会员服务

22+阅读 · 2024年11月14日

【AAAI2023】对抗性权重扰动提高图神经网络的泛化能力

【AAAI2023】对抗性权重扰动提高图神经网络的泛化能力

专知会员服务

19+阅读 · 2022年12月12日

长综述《用于随机控制和博弈的机器学习方法最新发展》2022最新76页长论文，加州大学、上海纽约大学等

长综述《用于随机控制和博弈的机器学习方法最新发展》2022最新76页长论文，加州大学、上海纽约大学等

专知会员服务

47+阅读 · 2022年9月29日

机器学习损失函数概述，Loss Functions in Machine Learning

机器学习损失函数概述，Loss Functions in Machine Learning

专知会员服务

85+阅读 · 2022年3月19日

【NeurIPS 2021 】为目标检测搜索参数化平均准确率损失函数

【NeurIPS 2021 】为目标检测搜索参数化平均准确率损失函数

专知会员服务

19+阅读 · 2021年12月12日

【ICML2021】异质风险最小化，Heterogeneous Risk Minimization

专知会员服务

16+阅读 · 2021年5月21日

【经典书】应用随机微分方程，324页pdf，Applied Stochastic Differential Equations

【经典书】应用随机微分方程，324页pdf，Applied Stochastic Differential Equations

专知会员服务

60+阅读 · 2020年11月21日

【独立研究者I-Sheng Yang论文】因果机器学习损失函数（A Loss-Function for Causal Machine-Learning）

【独立研究者I-Sheng Yang论文】因果机器学习损失函数（A Loss-Function for Causal Machine-Learning）

专知会员服务

20+阅读 · 2020年1月7日

【论文推荐】深度学习中贝叶斯不确定性简单基线（A simple baseline for bayesian uncertainty in deep learning）

【论文推荐】深度学习中贝叶斯不确定性简单基线（A simple baseline for bayesian uncertainty in deep learning）

专知会员服务

46+阅读 · 2019年12月25日

(普林斯顿讲义)：高维概率论，326页pdf《Probability in High Dimension》

(普林斯顿讲义)：高维概率论，326页pdf《Probability in High Dimension》

专知

21+阅读 · 2020年5月30日

一文读懂线性回归、岭回归和Lasso回归

一文读懂线性回归、岭回归和Lasso回归

CSDN

34+阅读 · 2019年10月13日

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

专知

363+阅读 · 2019年4月12日

从信息论的角度来理解损失函数

从信息论的角度来理解损失函数

深度学习每日摘要

17+阅读 · 2019年4月7日

机器学习中的最优化算法总结

机器学习中的最优化算法总结

人工智能前沿讲习班

22+阅读 · 2019年3月22日

DeepMind研究员Tor2019著作《赌博机算法》，555页带你学习专治选择困难症技术

DeepMind研究员Tor2019著作《赌博机算法》，555页带你学习专治选择困难症技术

专知

11+阅读 · 2019年1月6日

换个角度看GAN：另一种损失函数

换个角度看GAN：另一种损失函数

机器之心

16+阅读 · 2019年1月1日

详解常见的损失函数

详解常见的损失函数

七月在线实验室

20+阅读 · 2018年7月12日

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

机器学习研究会

19+阅读 · 2018年3月11日

【干货】Lossless Triplet Loss: 一种高效的Siamese网络损失函数

【干货】Lossless Triplet Loss: 一种高效的Siamese网络损失函数

机器学习研究会

29+阅读 · 2018年2月21日

非线性差分方程的最小周期解与边值问题研究

国家自然科学基金

0+阅读 · 2015年12月31日

非对称扰动下的拟线性椭圆方程解的多重性研究

国家自然科学基金

0+阅读 · 2015年12月31日

非线性分析方法与奇异摄动理论在力学中的若干应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于近似对称的扰动方程的若干研究

国家自然科学基金

0+阅读 · 2014年12月31日

几类高阶非线性行波方程的精确解,分支和复杂动力学研究

国家自然科学基金

0+阅读 · 2014年12月31日

具摩擦非线性系统随机振动分析与最优控制

国家自然科学基金

0+阅读 · 2014年12月31日

非线性动力系统的最简正规形及其相关问题的研究

国家自然科学基金

0+阅读 · 2014年12月31日

非零边界条件下扰动导数非线性薛定谔方程的解析和数值研究

国家自然科学基金

0+阅读 · 2014年12月31日

非线性约束全局优化的新方法研究

国家自然科学基金

1+阅读 · 2014年12月31日

电能质量扰动沿输电线路传播机理研究

国家自然科学基金

1+阅读 · 2014年12月31日

Sharp analysis of linear ensemble sampling

Arxiv

0+阅读 · 6月13日

Minimum Distance Summaries for Robust Neural Posterior Estimation

Arxiv

0+阅读 · 6月12日

Mixing Makes Markovian Contexts Cheap for Linear Bandits

Arxiv

0+阅读 · 6月11日

Offline-to-Online Learning in Linear Bandits

Arxiv

0+阅读 · 6月3日

Optimality of Non-Adaptive Algorithms in Online Submodular Welfare Maximization with Stochastic Outcomes

Arxiv

0+阅读 · 5月30日

Sequential Least-Squares Estimators with Fast Randomized Sketching for Linear Statistical Models

Arxiv

0+阅读 · 5月29日

$p$-adic Linear Regression for Random Sampling with Digitwise Noise

Arxiv

0+阅读 · 5月15日

From Average Sensitivity to Small-Loss Regret Bounds under Random-Order Model

Arxiv

0+阅读 · 5月8日

A Unified Approach to Minimizing Symmetric Submodular Functions

Arxiv

0+阅读 · 5月2日

Discrepancy Minimization via Regularization

Arxiv

0+阅读 · 4月14日

VIP会员

文章信息

相关主题

最新内容

《美国空军B-2“幽灵”隐身轰炸机系统工程案例研究》117页

《美国空军B-2“幽灵”隐身轰炸机系统工程案例研究》117页

专知会员服务

5+阅读 · 今天4:35

隐身技术前沿综述：物理机理、工程实践与战略展望

隐身技术前沿综述：物理机理、工程实践与战略展望

专知会员服务

3+阅读 · 今天4:24

《多变海洋环境下无人水面艇与自主水下机器人对接的最优路径规划》

《多变海洋环境下无人水面艇与自主水下机器人对接的最优路径规划》

专知会员服务

3+阅读 · 今天4:18

《以机反机：基于无人机载麦克风的空中周界入侵检测》

《以机反机：基于无人机载麦克风的空中周界入侵检测》

专知会员服务

4+阅读 · 今天4:15

《无人机脆弱性利用：网络空间力量的新域》

《无人机脆弱性利用：网络空间力量的新域》

专知会员服务

2+阅读 · 今天4:08

美空军如何将人工智能从战场部署至后方机关

美空军如何将人工智能从战场部署至后方机关

专知会员服务

11+阅读 · 7月31日

《美战争部指令文件：网络空间效应与使能能力测试评估》

《美战争部指令文件：网络空间效应与使能能力测试评估》

专知会员服务

7+阅读 · 7月31日

《史诗怒火行动：多域前瞻评估》49页报告

《史诗怒火行动：多域前瞻评估》49页报告

专知会员服务

7+阅读 · 7月31日

《英国防部：未来空战系统数字化战略》33页

《英国防部：未来空战系统数字化战略》33页

专知会员服务

5+阅读 · 7月31日

《面向自主飞行网络的智能体人工智能架构》

《面向自主飞行网络的智能体人工智能架构》

专知会员服务

7+阅读 · 7月31日

“史诗怒火”行动：现代多域作战的重要节点

“史诗怒火”行动：现代多域作战的重要节点

专知会员服务

8+阅读 · 7月30日

《下一代无线网络中的多无人机通信资源管理》

《下一代无线网络中的多无人机通信资源管理》

专知会员服务

8+阅读 · 7月30日

《高分辨率模拟下的聚合战斗建模：以“会战交锋”场景为例》

《高分辨率模拟下的聚合战斗建模：以“会战交锋”场景为例》

专知会员服务

9+阅读 · 7月30日

《人机协同在安全关键型操作决策中的应用》120页

《人机协同在安全关键型操作决策中的应用》120页

专知会员服务

8+阅读 · 7月30日

网络防御与空中力量网络防护：21世纪空中力量历史与理论的启示

网络防御与空中力量网络防护：21世纪空中力量历史与理论的启示

专知会员服务

6+阅读 · 7月30日

相关VIP内容

【CVPR2025】在去噪扩散模型中优化最短路径

【CVPR2025】在去噪扩散模型中优化最短路径

专知会员服务

16+阅读 · 2025年3月10日

《利用近端策略优化估计最佳飞行轨迹》最新140页

《利用近端策略优化估计最佳飞行轨迹》最新140页

专知会员服务

22+阅读 · 2024年11月14日

【AAAI2023】对抗性权重扰动提高图神经网络的泛化能力

【AAAI2023】对抗性权重扰动提高图神经网络的泛化能力

专知会员服务

19+阅读 · 2022年12月12日

长综述《用于随机控制和博弈的机器学习方法最新发展》2022最新76页长论文，加州大学、上海纽约大学等

长综述《用于随机控制和博弈的机器学习方法最新发展》2022最新76页长论文，加州大学、上海纽约大学等

专知会员服务

47+阅读 · 2022年9月29日

机器学习损失函数概述，Loss Functions in Machine Learning

机器学习损失函数概述，Loss Functions in Machine Learning

专知会员服务

85+阅读 · 2022年3月19日

【NeurIPS 2021 】为目标检测搜索参数化平均准确率损失函数

【NeurIPS 2021 】为目标检测搜索参数化平均准确率损失函数

专知会员服务

19+阅读 · 2021年12月12日

【ICML2021】异质风险最小化，Heterogeneous Risk Minimization

专知会员服务

16+阅读 · 2021年5月21日

【经典书】应用随机微分方程，324页pdf，Applied Stochastic Differential Equations

【经典书】应用随机微分方程，324页pdf，Applied Stochastic Differential Equations

专知会员服务

60+阅读 · 2020年11月21日

【独立研究者I-Sheng Yang论文】因果机器学习损失函数（A Loss-Function for Causal Machine-Learning）

【独立研究者I-Sheng Yang论文】因果机器学习损失函数（A Loss-Function for Causal Machine-Learning）

专知会员服务

20+阅读 · 2020年1月7日

【论文推荐】深度学习中贝叶斯不确定性简单基线（A simple baseline for bayesian uncertainty in deep learning）

【论文推荐】深度学习中贝叶斯不确定性简单基线（A simple baseline for bayesian uncertainty in deep learning）

专知会员服务

46+阅读 · 2019年12月25日

热门VIP内容

开通专知VIP会员享更多权益服务

隐身技术前沿综述：物理机理、工程实践与战略展望

《以机反机：基于无人机载麦克风的空中周界入侵检测》

《美国空军B-2“幽灵”隐身轰炸机系统工程案例研究》117页

《多变海洋环境下无人水面艇与自主水下机器人对接的最优路径规划》

相关资讯

(普林斯顿讲义)：高维概率论，326页pdf《Probability in High Dimension》

(普林斯顿讲义)：高维概率论，326页pdf《Probability in High Dimension》

专知

21+阅读 · 2020年5月30日

一文读懂线性回归、岭回归和Lasso回归

一文读懂线性回归、岭回归和Lasso回归

CSDN

34+阅读 · 2019年10月13日

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

专知

363+阅读 · 2019年4月12日

从信息论的角度来理解损失函数

从信息论的角度来理解损失函数

深度学习每日摘要

17+阅读 · 2019年4月7日

机器学习中的最优化算法总结

机器学习中的最优化算法总结

人工智能前沿讲习班

22+阅读 · 2019年3月22日

DeepMind研究员Tor2019著作《赌博机算法》，555页带你学习专治选择困难症技术

DeepMind研究员Tor2019著作《赌博机算法》，555页带你学习专治选择困难症技术

专知

11+阅读 · 2019年1月6日

换个角度看GAN：另一种损失函数

换个角度看GAN：另一种损失函数

机器之心

16+阅读 · 2019年1月1日

详解常见的损失函数

详解常见的损失函数

七月在线实验室

20+阅读 · 2018年7月12日

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

机器学习研究会

19+阅读 · 2018年3月11日

【干货】Lossless Triplet Loss: 一种高效的Siamese网络损失函数

【干货】Lossless Triplet Loss: 一种高效的Siamese网络损失函数

机器学习研究会

29+阅读 · 2018年2月21日

相关论文

Sharp analysis of linear ensemble sampling

Arxiv

0+阅读 · 6月13日

Minimum Distance Summaries for Robust Neural Posterior Estimation

Arxiv

0+阅读 · 6月12日

Mixing Makes Markovian Contexts Cheap for Linear Bandits

Arxiv

0+阅读 · 6月11日

Offline-to-Online Learning in Linear Bandits

Arxiv

0+阅读 · 6月3日

Optimality of Non-Adaptive Algorithms in Online Submodular Welfare Maximization with Stochastic Outcomes

Arxiv

0+阅读 · 5月30日

Sequential Least-Squares Estimators with Fast Randomized Sketching for Linear Statistical Models

Arxiv

0+阅读 · 5月29日

$p$-adic Linear Regression for Random Sampling with Digitwise Noise

Arxiv

0+阅读 · 5月15日

From Average Sensitivity to Small-Loss Regret Bounds under Random-Order Model

Arxiv

0+阅读 · 5月8日

A Unified Approach to Minimizing Symmetric Submodular Functions

Arxiv

0+阅读 · 5月2日

Discrepancy Minimization via Regularization

Arxiv

0+阅读 · 4月14日

相关基金

非线性差分方程的最小周期解与边值问题研究

国家自然科学基金

0+阅读 · 2015年12月31日

非对称扰动下的拟线性椭圆方程解的多重性研究

国家自然科学基金

0+阅读 · 2015年12月31日

非线性分析方法与奇异摄动理论在力学中的若干应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于近似对称的扰动方程的若干研究

国家自然科学基金

0+阅读 · 2014年12月31日

几类高阶非线性行波方程的精确解,分支和复杂动力学研究

国家自然科学基金

0+阅读 · 2014年12月31日

具摩擦非线性系统随机振动分析与最优控制

国家自然科学基金

0+阅读 · 2014年12月31日

非线性动力系统的最简正规形及其相关问题的研究

国家自然科学基金

0+阅读 · 2014年12月31日

非零边界条件下扰动导数非线性薛定谔方程的解析和数值研究

国家自然科学基金

0+阅读 · 2014年12月31日

非线性约束全局优化的新方法研究

国家自然科学基金

1+阅读 · 2014年12月31日

电能质量扰动沿输电线路传播机理研究

国家自然科学基金

1+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员