深度学习训练不稳定性遵循低维动力学原理 (Training instability in deep learning follows low-dimensional dynamical principles) - 专知论文

会员服务 ·

0

系统 · 扰动 · 不稳定 · 属性 · 深度学习训练 ·

Training instability in deep learning follows low-dimensional dynamical principles

翻译：深度学习训练不稳定性遵循低维动力学原理

Zhipeng Zhang,Zhenjie Yao,Kai Li,Lei Yang

Deep learning systems achieve remarkable empirical performance, yet the stability of the training process itself remains poorly understood. Training unfolds as a high-dimensional dynamical system in which small perturbations to optimization, data, parameters, or learning signals can induce abrupt and irreversible collapse, undermining reproducibility and scalability. We propose a unified dynamical perspective that characterizes training stability as an intrinsic property of learning systems, organized along four interacting dimensions: optimization, environmental/data, parametric, and learning-signal stability. We operationalize this perspective through controlled perturbation auditing of training trajectories, probing how learning dynamics respond to structured disturbances without modifying learning algorithms. Across reinforcement learning and large language model training, we identify three recurring regularities: high final performance is frequently decoupled from training stability; controlled stochasticity consistently buffers learning dynamics across paradigms; and deviations in low-dimensional latent meta-states systematically precede observable performance collapse. Together, these findings establish training stability as a measurable and comparable dynamical property of learning systems, providing a descriptive foundation for studying learning dynamics beyond final performance outcomes.

翻译：深度学习系统取得了卓越的实证性能，然而训练过程本身的稳定性仍未被充分理解。训练过程表现为一个高维动力系统，其中对优化、数据、参数或学习信号的微小扰动都可能引发突然且不可逆的崩溃，从而损害可复现性和可扩展性。我们提出一个统一的动力学视角，将训练稳定性刻画为学习系统的内在属性，并沿着四个相互作用的维度进行组织：优化稳定性、环境/数据稳定性、参数稳定性以及学习信号稳定性。我们通过对训练轨迹进行受控扰动审计来具体化这一视角，探究学习动力学如何响应结构化扰动，而无需修改学习算法。在强化学习和大型语言模型训练中，我们识别出三个反复出现的规律：最终高性能常与训练稳定性脱钩；受控随机性在不同范式中持续缓冲学习动力学；低维潜在元状态的偏差系统地先于可观测的性能崩溃出现。这些发现共同确立了训练稳定性作为学习系统可测量、可比较的动力学属性，为超越最终性能结果研究学习动力学提供了描述性基础。

0

相关内容

【EPFL博士论文】现代深度学习中的不确定性建模，169页pdf

【EPFL博士论文】现代深度学习中的不确定性建模，169页pdf

专知会员服务

26+阅读 · 2025年5月15日

【博士论文】深度学习中的推理不一致性及其缓解方法

【博士论文】深度学习中的推理不一致性及其缓解方法

专知会员服务

25+阅读 · 2025年4月5日

【ETH博士论文】维数灾难与神经网络的基于梯度训练：缩小理论与应用之间的鸿沟，123页pdf

【ETH博士论文】维数灾难与神经网络的基于梯度训练：缩小理论与应用之间的鸿沟，123页pdf

专知会员服务

35+阅读 · 2023年5月31日

【CVPR2023】基于梯度不确定性归因的可解释贝叶斯深度学习

【CVPR2023】基于梯度不确定性归因的可解释贝叶斯深度学习

专知会员服务

42+阅读 · 2023年4月14日

【牛津大学博士论文】深度学习中的结构与不确定性，205页pdf

【牛津大学博士论文】深度学习中的结构与不确定性，205页pdf

专知会员服务

78+阅读 · 2022年11月9日

美国空军研究实验室《探索深度学习系统的脆弱性和稳健性》2022年最新85页技术报告

美国空军研究实验室《探索深度学习系统的脆弱性和稳健性》2022年最新85页技术报告

专知会员服务

110+阅读 · 2022年7月5日

多伦多大学2021《机器学习》课程，讲述深度学习理论中的神经网络训练动力学

多伦多大学2021《机器学习》课程，讲述深度学习理论中的神经网络训练动力学

专知会员服务

59+阅读 · 2021年1月29日

【斯坦福大学-PNAS2020】人工智能中深度学习的不合理有效性unreasonable effectiveness of DL

专知会员服务

14+阅读 · 2020年2月23日

【新墨西哥大学】深度学习的局限性和缺陷，10页pdf，Deep Learning Limitations and Flaws

【新墨西哥大学】深度学习的局限性和缺陷，10页pdf，Deep Learning Limitations and Flaws

专知会员服务

54+阅读 · 2020年2月5日

【干货】深度学习的深度思考，49页pdf，Deep Thoughts on Deep Learning

【干货】深度学习的深度思考，49页pdf，Deep Thoughts on Deep Learning

专知会员服务

30+阅读 · 2019年11月14日

ChatGPT背后大模型如何高效训练？京东探索研究院等最新《大规模深度学习模型高效训练研究》综述，60页pdf详述五大类训练方法

ChatGPT背后大模型如何高效训练？京东探索研究院等最新《大规模深度学习模型高效训练研究》综述，60页pdf详述五大类训练方法

专知

29+阅读 · 2023年4月11日

最新最全《深度元学习》2021综述论文，68页pdf，A Survey of Deep Meta-Learning

最新最全《深度元学习》2021综述论文，68页pdf，A Survey of Deep Meta-Learning

专知

11+阅读 · 2021年4月23日

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

AI100

14+阅读 · 2019年9月1日

「PPT」深度学习中的不确定性估计

「PPT」深度学习中的不确定性估计

专知

27+阅读 · 2019年7月20日

最新49页《深度学习异常检测综述》论文，带你全面了解深度学习异常检测方法

最新49页《深度学习异常检测综述》论文，带你全面了解深度学习异常检测方法

专知

137+阅读 · 2019年1月14日

深度强化学习简介

深度强化学习简介

专知

30+阅读 · 2018年12月3日

<好书推荐> -《Pro Deep Learning with TensorFlow》分享

<好书推荐> -《Pro Deep Learning with TensorFlow》分享

深度学习与NLP

12+阅读 · 2018年9月13日

【深度学习】大牛的《深度学习》笔记，Deep Learning速成教程

【深度学习】大牛的《深度学习》笔记，Deep Learning速成教程

产业智能官

12+阅读 · 2018年4月6日

【深度学习】深度学习的核心：掌握训练数据的方法

【深度学习】深度学习的核心：掌握训练数据的方法

产业智能官

12+阅读 · 2018年1月14日

【下载】最新TensorFlow深度学习教程指引《Learning TensorFlow，构建深度学习系统指引》

【下载】最新TensorFlow深度学习教程指引《Learning TensorFlow，构建深度学习系统指引》

专知

28+阅读 · 2017年12月6日

计及多重-复合不确定性的电力系统稳定约束优化调度研究

国家自然科学基金

1+阅读 · 2016年12月31日

复杂环境下机器学习的理论研究

国家自然科学基金

21+阅读 · 2015年12月31日

高维回归模型的预测稳定性研究

国家自然科学基金

3+阅读 · 2015年12月31日

考虑不确定性的结构动力学响应模型可信度确认方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

高维不平衡数据的集成学习算法研究

国家自然科学基金

16+阅读 · 2015年12月31日

基于相依数据的梯度学习理论研究

国家自然科学基金

1+阅读 · 2015年12月31日

故障机理的不确定传播及系统故障自动推演建模方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于深度学习的三维模型检索技术

国家自然科学基金

13+阅读 · 2014年12月31日

开放动态环境下在线机器学习理论与方法

国家自然科学基金

11+阅读 · 2013年12月31日

不确定环境下强化学习和决策的神经机制

国家自然科学基金

11+阅读 · 2012年12月31日

On the Stability of Nonlinear Dynamics in GD and SGD: Beyond Quadratic Potentials

Arxiv

0+阅读 · 2月16日

Compressible Dynamics in Deep Overparameterized Low-Rank Learning & Adaptation

Arxiv

0+阅读 · 2月13日

Scaling Laws for Uncertainty in Deep Learning

Arxiv

0+阅读 · 2月9日

Degradation of Feature Space in Continual Learning

Arxiv

0+阅读 · 2月6日

Training in reverse: How iteration order influences convergence and stability in deep learning

Arxiv

0+阅读 · 2月6日

An Overview of Low-Rank Structures in the Training and Adaptation of Large Models

Arxiv

0+阅读 · 2月3日

Beyond Precision: Training-Inference Mismatch is an Optimization Problem and Simple LR Scheduling Fixes It

Arxiv

0+阅读 · 2月2日

An Overview of Low-Rank Structures in the Training and Adaptation of Large Models

Arxiv

0+阅读 · 2月1日

Training Large Neural Networks With Low-Dimensional Error Feedback

Arxiv

0+阅读 · 1月14日

Deep learning: a statistical viewpoint

Arxiv

18+阅读 · 2021年3月16日

VIP会员

文章信息

相关主题

深度学习训练

最新内容

（中文万字长文）美智库：针对伊朗的防空作战分析（报告）

（中文万字长文）美智库：针对伊朗的防空作战分析（报告）

专知会员服务

6+阅读 · 今天7:12

无人机与反无人机系统（书籍）

无人机与反无人机系统（书籍）

专知会员服务

4+阅读 · 今天6:45

（中文万字长文）2025-2026年乌克兰无人机拦截技术演进：反无人机技术、项目、效果、西方援助

（中文万字长文）2025-2026年乌克兰无人机拦截技术演进：反无人机技术、项目、效果、西方援助

专知会员服务

4+阅读 · 今天6:12

乌克兰2026年军用无人机：现代战争如何被改变

乌克兰2026年军用无人机：现代战争如何被改变

专知会员服务

3+阅读 · 今天5:53

美陆军2026条令：安全与机动支援

美陆军2026条令：安全与机动支援

专知会员服务

1+阅读 · 今天5:49

【牛津博士论文】以语言为接口的医学影像表示学习

【牛津博士论文】以语言为接口的医学影像表示学习

专知会员服务

7+阅读 · 4月13日

基于大语言模型的医疗推理研究：综述与 MR-Bench 基准测试

基于大语言模型的医疗推理研究：综述与 MR-Bench 基准测试

专知会员服务

6+阅读 · 4月13日

从原型到实战：扩展美陆军下一代指挥控制能力（试验进展）

从原型到实战：扩展美陆军下一代指挥控制能力（试验进展）

专知会员服务

12+阅读 · 4月13日

技术、多域威慑与海上战争（报告）

技术、多域威慑与海上战争（报告）

专知会员服务

7+阅读 · 4月13日

随机网络效用最大化在战略排队系统中的博弈论方法

随机网络效用最大化在战略排队系统中的博弈论方法

专知会员服务

4+阅读 · 4月13日

“在云端防御”：提升北约数据韧性（报告）

“在云端防御”：提升北约数据韧性（报告）

专知会员服务

4+阅读 · 4月13日

从炒作到现实：人工智能在军事应用中的实战经验与建议（综述）

从炒作到现实：人工智能在军事应用中的实战经验与建议（综述）

专知会员服务

9+阅读 · 4月13日

2026年伊朗战争对美国通胀的影响：情景分析（报告）

2026年伊朗战争对美国通胀的影响：情景分析（报告）

专知会员服务

2+阅读 · 4月13日

人工智能及其在海军行动中的整合（综述）

人工智能及其在海军行动中的整合（综述）

专知会员服务

6+阅读 · 4月13日

美以伊冲突：无人机主导的第三次海湾战争反防空作战

美以伊冲突：无人机主导的第三次海湾战争反防空作战

专知会员服务

4+阅读 · 4月13日

相关VIP内容

【EPFL博士论文】现代深度学习中的不确定性建模，169页pdf

【EPFL博士论文】现代深度学习中的不确定性建模，169页pdf

专知会员服务

26+阅读 · 2025年5月15日

【博士论文】深度学习中的推理不一致性及其缓解方法

【博士论文】深度学习中的推理不一致性及其缓解方法

专知会员服务

25+阅读 · 2025年4月5日

【ETH博士论文】维数灾难与神经网络的基于梯度训练：缩小理论与应用之间的鸿沟，123页pdf

【ETH博士论文】维数灾难与神经网络的基于梯度训练：缩小理论与应用之间的鸿沟，123页pdf

专知会员服务

35+阅读 · 2023年5月31日

【CVPR2023】基于梯度不确定性归因的可解释贝叶斯深度学习

【CVPR2023】基于梯度不确定性归因的可解释贝叶斯深度学习

专知会员服务

42+阅读 · 2023年4月14日

【牛津大学博士论文】深度学习中的结构与不确定性，205页pdf

【牛津大学博士论文】深度学习中的结构与不确定性，205页pdf

专知会员服务

78+阅读 · 2022年11月9日

美国空军研究实验室《探索深度学习系统的脆弱性和稳健性》2022年最新85页技术报告

美国空军研究实验室《探索深度学习系统的脆弱性和稳健性》2022年最新85页技术报告

专知会员服务

110+阅读 · 2022年7月5日

多伦多大学2021《机器学习》课程，讲述深度学习理论中的神经网络训练动力学

多伦多大学2021《机器学习》课程，讲述深度学习理论中的神经网络训练动力学

专知会员服务

59+阅读 · 2021年1月29日

【斯坦福大学-PNAS2020】人工智能中深度学习的不合理有效性unreasonable effectiveness of DL

专知会员服务

14+阅读 · 2020年2月23日

【新墨西哥大学】深度学习的局限性和缺陷，10页pdf，Deep Learning Limitations and Flaws

【新墨西哥大学】深度学习的局限性和缺陷，10页pdf，Deep Learning Limitations and Flaws

专知会员服务

54+阅读 · 2020年2月5日

【干货】深度学习的深度思考，49页pdf，Deep Thoughts on Deep Learning

【干货】深度学习的深度思考，49页pdf，Deep Thoughts on Deep Learning

专知会员服务

30+阅读 · 2019年11月14日

热门VIP内容

开通专知VIP会员享更多权益服务

无人机与反无人机系统（书籍）

乌克兰2026年军用无人机：现代战争如何被改变

（中文万字长文）美智库：针对伊朗的防空作战分析（报告）

（中文万字长文）2025-2026年乌克兰无人机拦截技术演进：反无人机技术、项目、效果、西方援助

相关资讯

ChatGPT背后大模型如何高效训练？京东探索研究院等最新《大规模深度学习模型高效训练研究》综述，60页pdf详述五大类训练方法

ChatGPT背后大模型如何高效训练？京东探索研究院等最新《大规模深度学习模型高效训练研究》综述，60页pdf详述五大类训练方法

专知

29+阅读 · 2023年4月11日

最新最全《深度元学习》2021综述论文，68页pdf，A Survey of Deep Meta-Learning

最新最全《深度元学习》2021综述论文，68页pdf，A Survey of Deep Meta-Learning

专知

11+阅读 · 2021年4月23日

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

AI100

14+阅读 · 2019年9月1日

「PPT」深度学习中的不确定性估计

「PPT」深度学习中的不确定性估计

专知

27+阅读 · 2019年7月20日

最新49页《深度学习异常检测综述》论文，带你全面了解深度学习异常检测方法

最新49页《深度学习异常检测综述》论文，带你全面了解深度学习异常检测方法

专知

137+阅读 · 2019年1月14日

深度强化学习简介

深度强化学习简介

专知

30+阅读 · 2018年12月3日

<好书推荐> -《Pro Deep Learning with TensorFlow》分享

<好书推荐> -《Pro Deep Learning with TensorFlow》分享

深度学习与NLP

12+阅读 · 2018年9月13日

【深度学习】大牛的《深度学习》笔记，Deep Learning速成教程

【深度学习】大牛的《深度学习》笔记，Deep Learning速成教程

产业智能官

12+阅读 · 2018年4月6日

【深度学习】深度学习的核心：掌握训练数据的方法

【深度学习】深度学习的核心：掌握训练数据的方法

产业智能官

12+阅读 · 2018年1月14日

【下载】最新TensorFlow深度学习教程指引《Learning TensorFlow，构建深度学习系统指引》

【下载】最新TensorFlow深度学习教程指引《Learning TensorFlow，构建深度学习系统指引》

专知

28+阅读 · 2017年12月6日

相关论文

On the Stability of Nonlinear Dynamics in GD and SGD: Beyond Quadratic Potentials

Arxiv

0+阅读 · 2月16日

Compressible Dynamics in Deep Overparameterized Low-Rank Learning & Adaptation

Arxiv

0+阅读 · 2月13日

Scaling Laws for Uncertainty in Deep Learning

Arxiv

0+阅读 · 2月9日

Degradation of Feature Space in Continual Learning

Arxiv

0+阅读 · 2月6日

Training in reverse: How iteration order influences convergence and stability in deep learning

Arxiv

0+阅读 · 2月6日

An Overview of Low-Rank Structures in the Training and Adaptation of Large Models

Arxiv

0+阅读 · 2月3日

Beyond Precision: Training-Inference Mismatch is an Optimization Problem and Simple LR Scheduling Fixes It

Arxiv

0+阅读 · 2月2日

An Overview of Low-Rank Structures in the Training and Adaptation of Large Models

Arxiv

0+阅读 · 2月1日

Training Large Neural Networks With Low-Dimensional Error Feedback

Arxiv

0+阅读 · 1月14日

Deep learning: a statistical viewpoint

Arxiv

18+阅读 · 2021年3月16日

相关基金

计及多重-复合不确定性的电力系统稳定约束优化调度研究

国家自然科学基金

1+阅读 · 2016年12月31日

复杂环境下机器学习的理论研究

国家自然科学基金

21+阅读 · 2015年12月31日

高维回归模型的预测稳定性研究

国家自然科学基金

3+阅读 · 2015年12月31日

考虑不确定性的结构动力学响应模型可信度确认方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

高维不平衡数据的集成学习算法研究

国家自然科学基金

16+阅读 · 2015年12月31日

基于相依数据的梯度学习理论研究

国家自然科学基金

1+阅读 · 2015年12月31日

故障机理的不确定传播及系统故障自动推演建模方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于深度学习的三维模型检索技术

国家自然科学基金

13+阅读 · 2014年12月31日

开放动态环境下在线机器学习理论与方法

国家自然科学基金

11+阅读 · 2013年12月31日

不确定环境下强化学习和决策的神经机制

国家自然科学基金

11+阅读 · 2012年12月31日

微信扫码咨询专知VIP会员