贝叶斯子空间梯度估计用于大语言模型的零阶优化 (Bayesian Subspace Gradient Estimation for Zeroth-Order Optimization of Large Language Models) - 专知论文

会员服务 ·

0

梯度 · 贝叶斯 · 子空间 · 梯度估计 · 扰动 ·

Bayesian Subspace Gradient Estimation for Zeroth-Order Optimization of Large Language Models

翻译：贝叶斯子空间梯度估计用于大语言模型的零阶优化

Jian Feng,Zhihong Huang

from arxiv, 19 pages, 1 figures, 4 tables

Fine-tuning large language models (LLMs) with zeroth-order (ZO) optimization reduces memory by approximating gradients through function evaluations, but existing methods rely on one-step gradient estimates from random perturbations. We introduce Bayesian Subspace Zeroth-Order optimization (BSZO), a ZO optimizer that applies Kalman filtering to combine finite-difference information across multiple perturbation directions. By treating each finite-difference measurement as a noisy observation, BSZO builds a posterior distribution over the projected gradient and updates it through Bayesian inference, with a residual-based adaptive mechanism to adjust perturbation scales. Theoretical analysis shows that BSZO improves the convergence rate by a factor of $k/γ$ compared to standard ZO methods. Experiments on RoBERTa, Mistral, and OPT models show that BSZO outperforms MeZO, MeZO-Adam, and HiZOO across various tasks, achieving up to 6.67\% absolute average improvement on OPT-13B while keeping memory usage close to inference-only baselines (1.00$\times$--1.08$\times$ of MeZO).

翻译：通过零阶优化对大语言模型进行微调，可利用函数评估近似梯度以降低内存需求，但现有方法依赖于随机扰动产生的一步梯度估计。本文提出贝叶斯子空间零阶优化方法，这是一种应用卡尔曼滤波融合多个扰动方向有限差分信息的零阶优化器。BSZO将每个有限差分测量视为含噪观测，通过贝叶斯推断构建投影梯度的后验分布并进行更新，同时采用基于残差的自适应机制调整扰动尺度。理论分析表明，与标准零阶方法相比，BSZO将收敛速度提升了$k/γ$倍。在RoBERTa、Mistral和OPT模型上的实验表明，BSZO在多项任务中均优于MeZO、MeZO-Adam和HiZOO方法，在OPT-13B模型上实现了最高6.67%的绝对平均性能提升，同时保持内存使用量接近纯推理基线水平（为MeZO的1.00$\times$--1.08$\times$）。

0

相关内容

梯度的本意是一个向量（矢量），表示某一函数在该点处的方向导数沿着该方向取得最大值，即函数在该点处沿着该方向（此梯度的方向）变化最快，变化率最大（为该梯度的模）。

【牛津大学】贝叶斯优化用于自动化机器学习，321页pdf

【牛津大学】贝叶斯优化用于自动化机器学习，321页pdf

专知会员服务

31+阅读 · 2024年5月17日

【牛津大学博士论文】在不利情境下的贝叶斯优化，269页pdf

【牛津大学博士论文】在不利情境下的贝叶斯优化，269页pdf

专知会员服务

45+阅读 · 2024年3月17日

【2023新书】贝叶斯优化:使用Python的理论和实践，243页pdf

【2023新书】贝叶斯优化:使用Python的理论和实践，243页pdf

专知会员服务

100+阅读 · 2023年4月7日

AAAI2023最新「贝叶斯优化」教程报告，220+页PPT阐述BO基础到高级主题

AAAI2023最新「贝叶斯优化」教程报告，220+页PPT阐述BO基础到高级主题

专知会员服务

50+阅读 · 2023年2月17日

【ICML2021】全局思考，局部行动:高维分类和混合搜索空间上的贝叶斯优化

专知会员服务

28+阅读 · 2021年5月11日

最大均方差正则化贝叶斯神经网络，Bayesian Neural Networks With Maximum Mean Discrepancy Regularization

最大均方差正则化贝叶斯神经网络，Bayesian Neural Networks With Maximum Mean Discrepancy Regularization

专知会员服务

54+阅读 · 2020年3月5日

【AAAI2020】拓扑贝叶斯优化与持久性图：Topological Bayesian Optimization with Persistence Diagrams

【AAAI2020】拓扑贝叶斯优化与持久性图：Topological Bayesian Optimization with Persistence Diagrams

专知会员服务

11+阅读 · 2020年1月17日

【贝叶斯深度学习：一种基于模型的可解释方法】Bayesian deep learning: A model-based interpretable approach

【贝叶斯深度学习：一种基于模型的可解释方法】Bayesian deep learning: A model-based interpretable approach

专知会员服务

49+阅读 · 2020年1月1日

【论文推荐】深度学习中贝叶斯不确定性简单基线（A simple baseline for bayesian uncertainty in deep learning）

【论文推荐】深度学习中贝叶斯不确定性简单基线（A simple baseline for bayesian uncertainty in deep learning）

专知会员服务

46+阅读 · 2019年12月25日

【变分推断课件】Lectures on Variational Inference： Approximate Bayesian Inference in Machine Learning（附带pdf）

【变分推断课件】Lectures on Variational Inference： Approximate Bayesian Inference in Machine Learning（附带pdf）

专知会员服务

35+阅读 · 2019年11月30日

【ETH博士论文】贝叶斯深度学习，241页pdf

【ETH博士论文】贝叶斯深度学习，241页pdf

专知

10+阅读 · 2022年1月16日

【干货书】贝叶斯推断随机过程，449页pdf

【干货书】贝叶斯推断随机过程，449页pdf

专知

30+阅读 · 2020年8月27日

【纽约大学】贝叶斯深度学习和泛化性的概率观点，附27页PPT下载

【纽约大学】贝叶斯深度学习和泛化性的概率观点，附27页PPT下载

专知

27+阅读 · 2020年2月25日

一文读懂机器学习中的贝叶斯统计学

一文读懂机器学习中的贝叶斯统计学

数据分析

26+阅读 · 2019年5月8日

Github项目推荐 | Dragonfly：可扩展贝叶斯优化库（Python）

Github项目推荐 | Dragonfly：可扩展贝叶斯优化库（Python）

AI研习社

11+阅读 · 2019年3月22日

深度学习贝叶斯，这是一份密集的6天速成课程（附视频与PPT）

深度学习贝叶斯，这是一份密集的6天速成课程（附视频与PPT）

数据派THU

17+阅读 · 2018年9月23日

【深度】让DL可解释？这一份66页贝叶斯深度学习教程告诉你

【深度】让DL可解释？这一份66页贝叶斯深度学习教程告诉你

GAN生成式对抗网络

15+阅读 · 2018年8月11日

让DL可解释？这一份66页贝叶斯深度学习教程告诉你

让DL可解释？这一份66页贝叶斯深度学习教程告诉你

专知

19+阅读 · 2018年8月4日

贝叶斯机器学习前沿进展

贝叶斯机器学习前沿进展

机器学习研究会

21+阅读 · 2018年1月21日

概率论之概念解析：用贝叶斯推断进行参数估计

概率论之概念解析：用贝叶斯推断进行参数估计

专知

14+阅读 · 2018年1月8日

贝叶斯网分解理论及其应用

国家自然科学基金

16+阅读 · 2017年12月31日

面向海量高维数据的可深度结合的贝叶斯网学习与推理新方法研究

国家自然科学基金

6+阅读 · 2015年12月31日

基于伴随方法、改进文化基因算法和kriging代理模型的涡扇发动机短舱减噪优化方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

贝叶斯柔性密度方法及其在高维金融数据中的应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于对称识别方法的贝叶斯probit模型稳健性研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于贝叶斯观点的分数阶扩散方程反问题研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于贝叶斯网络的城市公交动态调度决策方法

国家自然科学基金

3+阅读 · 2015年12月31日

基于贝叶斯稀疏理论的合成孔径声纳成像技术研究

国家自然科学基金

2+阅读 · 2015年12月31日

空间贝叶斯方法及在空气质量及其健康效果评估中的运用

国家自然科学基金

0+阅读 · 2014年12月31日

基于贝叶斯推理的模糊逻辑强化学习模型研究

国家自然科学基金

18+阅读 · 2012年12月31日

An Efficient Bayesian Framework for Inverse Problems via Optimization and Inversion: Surrogate Modeling, Parameter Inference, and Uncertainty Quantification

Arxiv

0+阅读 · 2月4日

Bayesian Methods for the Navier-Stokes Equations

Arxiv

0+阅读 · 2月3日

Maximizing Reliability with Bayesian Optimization

Arxiv

0+阅读 · 2月2日

Zeroth-order parallel sampling

Arxiv

0+阅读 · 1月27日

Dimensional Peeking for Low-Variance Gradients in Zeroth-Order Discrete Optimization via Simulation

Arxiv

0+阅读 · 1月21日

Bayesian Time-Varying Meta-Analysis via Hierarchical Mean-Variance Random-effects Models

Arxiv

0+阅读 · 1月16日

Robust and Efficient Zeroth-Order LLM Fine-Tuning via Adaptive Bayesian Subspace Optimizer

Arxiv

0+阅读 · 1月15日

VBO-MI: A Fully Gradient-Based Bayesian Optimization Framework Using Variational Mutual Information Estimation

Arxiv

0+阅读 · 1月13日

Bayesian Optimization of Noisy Log-Likelihoods Evaluated by Particle Filters -- One Parameter Case --

Arxiv

0+阅读 · 1月10日

Gradient-free ensemble transform methods for generalized Bayesian inference in generative models

Arxiv

0+阅读 · 1月2日

VIP会员

文章信息

相关主题

相关VIP内容

【牛津大学】贝叶斯优化用于自动化机器学习，321页pdf

【牛津大学】贝叶斯优化用于自动化机器学习，321页pdf

专知会员服务

31+阅读 · 2024年5月17日

【牛津大学博士论文】在不利情境下的贝叶斯优化，269页pdf

【牛津大学博士论文】在不利情境下的贝叶斯优化，269页pdf

专知会员服务

45+阅读 · 2024年3月17日

【2023新书】贝叶斯优化:使用Python的理论和实践，243页pdf

【2023新书】贝叶斯优化:使用Python的理论和实践，243页pdf

专知会员服务

100+阅读 · 2023年4月7日

AAAI2023最新「贝叶斯优化」教程报告，220+页PPT阐述BO基础到高级主题

AAAI2023最新「贝叶斯优化」教程报告，220+页PPT阐述BO基础到高级主题

专知会员服务

50+阅读 · 2023年2月17日

【ICML2021】全局思考，局部行动:高维分类和混合搜索空间上的贝叶斯优化

专知会员服务

28+阅读 · 2021年5月11日

最大均方差正则化贝叶斯神经网络，Bayesian Neural Networks With Maximum Mean Discrepancy Regularization

最大均方差正则化贝叶斯神经网络，Bayesian Neural Networks With Maximum Mean Discrepancy Regularization

专知会员服务

54+阅读 · 2020年3月5日

【AAAI2020】拓扑贝叶斯优化与持久性图：Topological Bayesian Optimization with Persistence Diagrams

【AAAI2020】拓扑贝叶斯优化与持久性图：Topological Bayesian Optimization with Persistence Diagrams

专知会员服务

11+阅读 · 2020年1月17日

【贝叶斯深度学习：一种基于模型的可解释方法】Bayesian deep learning: A model-based interpretable approach

【贝叶斯深度学习：一种基于模型的可解释方法】Bayesian deep learning: A model-based interpretable approach

专知会员服务

49+阅读 · 2020年1月1日

【论文推荐】深度学习中贝叶斯不确定性简单基线（A simple baseline for bayesian uncertainty in deep learning）

【论文推荐】深度学习中贝叶斯不确定性简单基线（A simple baseline for bayesian uncertainty in deep learning）

专知会员服务

46+阅读 · 2019年12月25日

【变分推断课件】Lectures on Variational Inference： Approximate Bayesian Inference in Machine Learning（附带pdf）

【变分推断课件】Lectures on Variational Inference： Approximate Bayesian Inference in Machine Learning（附带pdf）

专知会员服务

35+阅读 · 2019年11月30日

热门VIP内容

开通专知VIP会员享更多权益服务

【CMU博士论文】基于自适应表征的高效视觉建模

《多域作战中融合网络、电子战与动能机动》

AI智能体时代大模型安全风险与攻防新挑战

迈向个性化大语言模型驱动的智能体：基础、评估与未来方向

相关资讯

【ETH博士论文】贝叶斯深度学习，241页pdf

【ETH博士论文】贝叶斯深度学习，241页pdf

专知

10+阅读 · 2022年1月16日

【干货书】贝叶斯推断随机过程，449页pdf

【干货书】贝叶斯推断随机过程，449页pdf

专知

30+阅读 · 2020年8月27日

【纽约大学】贝叶斯深度学习和泛化性的概率观点，附27页PPT下载

【纽约大学】贝叶斯深度学习和泛化性的概率观点，附27页PPT下载

专知

27+阅读 · 2020年2月25日

一文读懂机器学习中的贝叶斯统计学

一文读懂机器学习中的贝叶斯统计学

数据分析

26+阅读 · 2019年5月8日

Github项目推荐 | Dragonfly：可扩展贝叶斯优化库（Python）

Github项目推荐 | Dragonfly：可扩展贝叶斯优化库（Python）

AI研习社

11+阅读 · 2019年3月22日

深度学习贝叶斯，这是一份密集的6天速成课程（附视频与PPT）

深度学习贝叶斯，这是一份密集的6天速成课程（附视频与PPT）

数据派THU

17+阅读 · 2018年9月23日

【深度】让DL可解释？这一份66页贝叶斯深度学习教程告诉你

【深度】让DL可解释？这一份66页贝叶斯深度学习教程告诉你

GAN生成式对抗网络

15+阅读 · 2018年8月11日

让DL可解释？这一份66页贝叶斯深度学习教程告诉你

让DL可解释？这一份66页贝叶斯深度学习教程告诉你

专知

19+阅读 · 2018年8月4日

贝叶斯机器学习前沿进展

贝叶斯机器学习前沿进展

机器学习研究会

21+阅读 · 2018年1月21日

概率论之概念解析：用贝叶斯推断进行参数估计

概率论之概念解析：用贝叶斯推断进行参数估计

专知

14+阅读 · 2018年1月8日

相关论文

An Efficient Bayesian Framework for Inverse Problems via Optimization and Inversion: Surrogate Modeling, Parameter Inference, and Uncertainty Quantification

Arxiv

0+阅读 · 2月4日

Bayesian Methods for the Navier-Stokes Equations

Arxiv

0+阅读 · 2月3日

Maximizing Reliability with Bayesian Optimization

Arxiv

0+阅读 · 2月2日

Zeroth-order parallel sampling

Arxiv

0+阅读 · 1月27日

Dimensional Peeking for Low-Variance Gradients in Zeroth-Order Discrete Optimization via Simulation

Arxiv

0+阅读 · 1月21日

Bayesian Time-Varying Meta-Analysis via Hierarchical Mean-Variance Random-effects Models

Arxiv

0+阅读 · 1月16日

Robust and Efficient Zeroth-Order LLM Fine-Tuning via Adaptive Bayesian Subspace Optimizer

Arxiv

0+阅读 · 1月15日

VBO-MI: A Fully Gradient-Based Bayesian Optimization Framework Using Variational Mutual Information Estimation

Arxiv

0+阅读 · 1月13日

Bayesian Optimization of Noisy Log-Likelihoods Evaluated by Particle Filters -- One Parameter Case --

Arxiv

0+阅读 · 1月10日

Gradient-free ensemble transform methods for generalized Bayesian inference in generative models

Arxiv

0+阅读 · 1月2日

相关基金

贝叶斯网分解理论及其应用

国家自然科学基金

16+阅读 · 2017年12月31日

面向海量高维数据的可深度结合的贝叶斯网学习与推理新方法研究

国家自然科学基金

6+阅读 · 2015年12月31日

基于伴随方法、改进文化基因算法和kriging代理模型的涡扇发动机短舱减噪优化方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

贝叶斯柔性密度方法及其在高维金融数据中的应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于对称识别方法的贝叶斯probit模型稳健性研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于贝叶斯观点的分数阶扩散方程反问题研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于贝叶斯网络的城市公交动态调度决策方法

国家自然科学基金

3+阅读 · 2015年12月31日

基于贝叶斯稀疏理论的合成孔径声纳成像技术研究

国家自然科学基金

2+阅读 · 2015年12月31日

空间贝叶斯方法及在空气质量及其健康效果评估中的运用

国家自然科学基金

0+阅读 · 2014年12月31日

基于贝叶斯推理的模糊逻辑强化学习模型研究

国家自然科学基金

18+阅读 · 2012年12月31日

微信扫码咨询专知VIP会员