Hamiltonian Mechanics of Feature Learning: Bottleneck Structure in Leaky ResNets - 专知论文

会员服务 ·

0

表示 · 残差网络 · 结构 · 低维表示 · 特征学习 ·

Hamiltonian Mechanics of Feature Learning: Bottleneck Structure in Leaky ResNets

翻译：泄漏残差网络的特征学习哈密顿力学：瓶颈结构分析

Arthur Jacot,Alexandre Kaiser

We study Leaky ResNets, which interpolate between ResNets and Fully-Connected nets depending on an 'effective depth' hyper-parameter $\tilde{L}$. In the infinite depth limit, we study 'representation geodesics' $A_{p}$: continuous paths in representation space (similar to NeuralODEs) from input $p=0$ to output $p=1$ that minimize the parameter norm of the network. We give a Lagrangian and Hamiltonian reformulation, which highlight the importance of two terms: a kinetic energy which favors small layer derivatives $\partial_{p}A_{p}$ and a potential energy that favors low-dimensional representations, as measured by the 'Cost of Identity'. The balance between these two forces offers an intuitive understanding of feature learning in ResNets. We leverage this intuition to explain the emergence of a bottleneck structure, as observed in previous work: for large $\tilde{L}$ the potential energy dominates and leads to a separation of timescales, where the representation jumps rapidly from the high dimensional inputs to a low-dimensional representation, move slowly inside the space of low-dimensional representations, before jumping back to the potentially high-dimensional outputs. Inspired by this phenomenon, we train with an adaptive layer step-size to adapt to the separation of timescales.

翻译：我们研究泄漏残差网络（Leaky ResNets），该网络通过'有效深度'超参数$\tilde{L}$在残差网络（ResNets）与全连接网络之间插值。在无限深度极限下，我们研究'表示测地线'$A_{p}$：表示空间中从输入$p=0$到输出$p=1$的连续路径（类似于神经常微分方程），该路径最小化网络的参数范数。我们提出拉格朗日与哈密顿重构，突显两项关键作用：倾向于小层导数$\partial_{p}A_{p}$的动能，以及通过'恒等代价'衡量、倾向于低维表示势能。这两力平衡为残差网络中的特征学习提供了直观理解。我们利用该直觉解释先前研究中观察到的瓶颈结构涌现现象：当$\tilde{L}$较大时，势能主导并导致时间尺度分离——表示从高维输入快速跃迁至低维表示，在低维表示空间缓慢移动，再跳回可能的高维输出。受此现象启发，我们采用自适应层步长训练以适应时间尺度分离。

0

相关内容

【博士论文】理解神经网络的训练动态：从局部优化轨迹与特征学习视角

【博士论文】理解神经网络的训练动态：从局部优化轨迹与特征学习视角

专知会员服务

14+阅读 · 2025年8月15日

【普林斯顿博士论文】理解神经网络的训练动态：局部优化轨迹与特征学习视角

【普林斯顿博士论文】理解神经网络的训练动态：局部优化轨迹与特征学习视角

专知会员服务

22+阅读 · 2025年7月17日

【牛津大学博士论文】深度学习算法的渐近分析，186页pdf

【牛津大学博士论文】深度学习算法的渐近分析，186页pdf

专知会员服务

29+阅读 · 2024年6月27日

【哥伦比亚大学】复杂网络深度表示的几何和拓扑推理，Geometric and Topological Inference for Deep Representations of Complex Networks

【哥伦比亚大学】复杂网络深度表示的几何和拓扑推理，Geometric and Topological Inference for Deep Representations of Complex Networks

专知会员服务

23+阅读 · 2022年3月11日

【ICML2021】深度残差网络的可扩展特性

专知会员服务

20+阅读 · 2021年5月30日

神经网络的拓扑结构，TOPOLOGY OF DEEP NEURAL NETWORKS

神经网络的拓扑结构，TOPOLOGY OF DEEP NEURAL NETWORKS

专知会员服务

35+阅读 · 2020年4月15日

【论文推荐】深度学习中的异常实例检测:综述，Anomalous Instance Detection in Deep Learning: A Survey

【论文推荐】深度学习中的异常实例检测:综述，Anomalous Instance Detection in Deep Learning: A Survey

专知会员服务

97+阅读 · 2020年3月17日

【牛津大学】深度残差强化学习，Deep Residual Reinforcement Learning

【牛津大学】深度残差强化学习，Deep Residual Reinforcement Learning

专知会员服务

86+阅读 · 2020年2月18日

论深度学习的信息瓶颈理论（On the information bottleneck theory of deep learning）

论深度学习的信息瓶颈理论（On the information bottleneck theory of deep learning）

专知会员服务

66+阅读 · 2019年12月20日

Aspect-Oriented Syntax Network for Aspect-Based Sentiment Analysis，中山大学数据科学与计算机学院权小军教授，第八届全国社会媒体处理大会SMP2019

Aspect-Oriented Syntax Network for Aspect-Based Sentiment Analysis，中山大学数据科学与计算机学院权小军教授，第八届全国社会媒体处理大会SMP2019

专知会员服务

19+阅读 · 2019年10月22日

【WWW2020】结构深度聚类网络， Structural Deep Clustering Network，北京邮电大学

【WWW2020】结构深度聚类网络， Structural Deep Clustering Network，北京邮电大学

专知

31+阅读 · 2020年2月19日

【泡泡图灵智库】解释PointNet：PointNet网络内部到底学习到了什么？

【泡泡图灵智库】解释PointNet：PointNet网络内部到底学习到了什么？

泡泡机器人SLAM

13+阅读 · 2019年10月14日

连载▍AlexNet结构详解（引用MrGiovanni博士）

连载▍AlexNet结构详解（引用MrGiovanni博士）

36大数据

10+阅读 · 2019年3月28日

从信息瓶颈理论一瞥机器学习的“大一统理论”

从信息瓶颈理论一瞥机器学习的“大一统理论”

PaperWeekly

14+阅读 · 2019年1月4日

网络表示学习介绍

网络表示学习介绍

人工智能前沿讲习班

18+阅读 · 2018年11月26日

手把手教你构建ResNet残差网络

手把手教你构建ResNet残差网络

专知

38+阅读 · 2018年4月27日

【干货】Lossless Triplet Loss: 一种高效的Siamese网络损失函数

【干货】Lossless Triplet Loss: 一种高效的Siamese网络损失函数

机器学习研究会

29+阅读 · 2018年2月21日

【网络节点表示学习教程】在向量空间中启用网络分析和推理，清华大学崔鹏博士最新分享

【网络节点表示学习教程】在向量空间中启用网络分析和推理，清华大学崔鹏博士最新分享

专知

11+阅读 · 2018年2月9日

网络节点表示学习论文笔记01—AAAI2018超网络节点表示学习

网络节点表示学习论文笔记01—AAAI2018超网络节点表示学习

专知

15+阅读 · 2018年2月9日

图上的归纳表示学习

图上的归纳表示学习

科技创新与创业

23+阅读 · 2017年11月9日

基于学习的智能化漏洞挖掘关键技术研究

国家自然科学基金

6+阅读 · 2017年12月31日

面向动态演化的网构软件失效机理与测评方法

国家自然科学基金

1+阅读 · 2015年12月31日

基于磁荷分布反演算法的漏磁检测缺陷三维量化方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

井震联合数据驱动下，多智能技术融合的煤层气储层参数预测与评价

国家自然科学基金

2+阅读 · 2015年12月31日

动力学涨落对网络结构的影响

国家自然科学基金

0+阅读 · 2015年12月31日

低差分均匀度密码函数的构造与分析

国家自然科学基金

0+阅读 · 2015年12月31日

基于深度学习的海量截获卫星数据分析技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

故障互连网络中含经过指定边的无错误哈密顿圈问题研究

国家自然科学基金

0+阅读 · 2015年12月31日

任意网络中的可分数据处理研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于非线性动力学的复杂网络结构识别及其在力学系统中的应用

国家自然科学基金

0+阅读 · 2014年12月31日

Residual-loss Anomaly Analysis of Physics-Informed Neural Networks: An Inverse Method for Change-point Detection in Nonlinear Dynamical Systems with Regime Switching

Arxiv

0+阅读 · 4月28日

Space-Air-Ground-Integrated Networks: The BER vs. Residual Delay and Doppler Analysis

Arxiv

0+阅读 · 4月28日

Saddle-To-Saddle Dynamics in Deep ReLU Networks: Low-Rank Bias in the First Saddle Escape

Arxiv

0+阅读 · 4月20日

Modeling Sparse and Bursty Vulnerability Sightings: Forecasting Under Data Constraints

Arxiv

0+阅读 · 4月17日

bioLeak: Leakage-Aware Modeling and Diagnostics for Machine Learning in R

Arxiv

0+阅读 · 4月13日

Differentially Private and Federated Structure Learning in Bayesian Networks

Arxiv

0+阅读 · 4月10日

Universal Approximation Constraints of Narrow ResNets: The Tunnel Effect

Arxiv

0+阅读 · 3月30日

Learning to Localize Leakage of Cryptographic Sensitive Variables

Arxiv

0+阅读 · 3月25日

Unveiling Hidden Convexity in Deep Learning: a Sparse Signal Processing Perspective

Arxiv

0+阅读 · 3月25日

Better Neural Network Expressivity: Subdividing the Simplex

Arxiv

0+阅读 · 2月19日

VIP会员

文章信息

相关主题

最新内容

《面向指挥控制训练与实时北约兼容数据分发的战术模拟器》

《面向指挥控制训练与实时北约兼容数据分发的战术模拟器》

专知会员服务

2+阅读 · 今天5:21

《决策模型比较研究》

《决策模型比较研究》

专知会员服务

7+阅读 · 今天5:16

全球军事与武器工业中的人工智能：应用、方法与影响（万字长文）

全球军事与武器工业中的人工智能：应用、方法与影响（万字长文）

专知会员服务

3+阅读 · 今天4:37

《美军水下战与海床战概述及本地实施》

《美军水下战与海床战概述及本地实施》

专知会员服务

3+阅读 · 今天4:30

面向未来冲突推进陆军情报体制改革

面向未来冲突推进陆军情报体制改革

专知会员服务

3+阅读 · 今天4:12

人工智能赋能无人机：俄乌冲突案例及其深远影响（万字长文）

人工智能赋能无人机：俄乌冲突案例及其深远影响（万字长文）

专知会员服务

4+阅读 · 今天2:54

《反无人机蜂群：有人-无人协同防御场景下的编队重构分析》

《反无人机蜂群：有人-无人协同防御场景下的编队重构分析》

专知会员服务

8+阅读 · 7月24日

《史诗怒火/咆哮雄狮行动：针对伊朗空中战役的战略分析》68页智库报告

《史诗怒火/咆哮雄狮行动：针对伊朗空中战役的战略分析》68页智库报告

专知会员服务

7+阅读 · 7月24日

“愈演愈烈的欺骗与干扰博弈”：无人机与人工智能背景下俄乌强化以无人机为核心的电子战

“愈演愈烈的欺骗与干扰博弈”：无人机与人工智能背景下俄乌强化以无人机为核心的电子战

专知会员服务

5+阅读 · 7月24日

乌克兰纵深打击如何重塑俄罗斯的战略选择

乌克兰纵深打击如何重塑俄罗斯的战略选择

专知会员服务

3+阅读 · 7月24日

《分布式太空任务对比分析与综合建模及仿真环境》120页

《分布式太空任务对比分析与综合建模及仿真环境》120页

专知会员服务

3+阅读 · 7月24日

俄乌战争中关于中程打击无人机部署的经验启示

俄乌战争中关于中程打击无人机部署的经验启示

专知会员服务

4+阅读 · 7月24日

《远程自主系统可扩展态势感知的解决方案》32页2026最新报告

《远程自主系统可扩展态势感知的解决方案》32页2026最新报告

专知会员服务

5+阅读 · 7月23日

《基于强化学习的自动化红队测试》

《基于强化学习的自动化红队测试》

专知会员服务

5+阅读 · 7月23日

《下一代无人机-卫星通信：人工智能创新与未来展望》32页长综述

《下一代无人机-卫星通信：人工智能创新与未来展望》32页长综述

专知会员服务

8+阅读 · 7月23日

相关VIP内容

【博士论文】理解神经网络的训练动态：从局部优化轨迹与特征学习视角

【博士论文】理解神经网络的训练动态：从局部优化轨迹与特征学习视角

专知会员服务

14+阅读 · 2025年8月15日

【普林斯顿博士论文】理解神经网络的训练动态：局部优化轨迹与特征学习视角

【普林斯顿博士论文】理解神经网络的训练动态：局部优化轨迹与特征学习视角

专知会员服务

22+阅读 · 2025年7月17日

【牛津大学博士论文】深度学习算法的渐近分析，186页pdf

【牛津大学博士论文】深度学习算法的渐近分析，186页pdf

专知会员服务

29+阅读 · 2024年6月27日

【哥伦比亚大学】复杂网络深度表示的几何和拓扑推理，Geometric and Topological Inference for Deep Representations of Complex Networks

【哥伦比亚大学】复杂网络深度表示的几何和拓扑推理，Geometric and Topological Inference for Deep Representations of Complex Networks

专知会员服务

23+阅读 · 2022年3月11日

【ICML2021】深度残差网络的可扩展特性

专知会员服务

20+阅读 · 2021年5月30日

神经网络的拓扑结构，TOPOLOGY OF DEEP NEURAL NETWORKS

神经网络的拓扑结构，TOPOLOGY OF DEEP NEURAL NETWORKS

专知会员服务

35+阅读 · 2020年4月15日

【论文推荐】深度学习中的异常实例检测:综述，Anomalous Instance Detection in Deep Learning: A Survey

【论文推荐】深度学习中的异常实例检测:综述，Anomalous Instance Detection in Deep Learning: A Survey

专知会员服务

97+阅读 · 2020年3月17日

【牛津大学】深度残差强化学习，Deep Residual Reinforcement Learning

【牛津大学】深度残差强化学习，Deep Residual Reinforcement Learning

专知会员服务

86+阅读 · 2020年2月18日

论深度学习的信息瓶颈理论（On the information bottleneck theory of deep learning）

论深度学习的信息瓶颈理论（On the information bottleneck theory of deep learning）

专知会员服务

66+阅读 · 2019年12月20日

Aspect-Oriented Syntax Network for Aspect-Based Sentiment Analysis，中山大学数据科学与计算机学院权小军教授，第八届全国社会媒体处理大会SMP2019

Aspect-Oriented Syntax Network for Aspect-Based Sentiment Analysis，中山大学数据科学与计算机学院权小军教授，第八届全国社会媒体处理大会SMP2019

专知会员服务

19+阅读 · 2019年10月22日

热门VIP内容

开通专知VIP会员享更多权益服务

《决策模型比较研究》

《美军水下战与海床战概述及本地实施》

《面向指挥控制训练与实时北约兼容数据分发的战术模拟器》

全球军事与武器工业中的人工智能：应用、方法与影响（万字长文）

相关资讯

【WWW2020】结构深度聚类网络， Structural Deep Clustering Network，北京邮电大学

【WWW2020】结构深度聚类网络， Structural Deep Clustering Network，北京邮电大学

专知

31+阅读 · 2020年2月19日

【泡泡图灵智库】解释PointNet：PointNet网络内部到底学习到了什么？

【泡泡图灵智库】解释PointNet：PointNet网络内部到底学习到了什么？

泡泡机器人SLAM

13+阅读 · 2019年10月14日

连载▍AlexNet结构详解（引用MrGiovanni博士）

连载▍AlexNet结构详解（引用MrGiovanni博士）

36大数据

10+阅读 · 2019年3月28日

从信息瓶颈理论一瞥机器学习的“大一统理论”

从信息瓶颈理论一瞥机器学习的“大一统理论”

PaperWeekly

14+阅读 · 2019年1月4日

网络表示学习介绍

网络表示学习介绍

人工智能前沿讲习班

18+阅读 · 2018年11月26日

手把手教你构建ResNet残差网络

手把手教你构建ResNet残差网络

专知

38+阅读 · 2018年4月27日

【干货】Lossless Triplet Loss: 一种高效的Siamese网络损失函数

【干货】Lossless Triplet Loss: 一种高效的Siamese网络损失函数

机器学习研究会

29+阅读 · 2018年2月21日

【网络节点表示学习教程】在向量空间中启用网络分析和推理，清华大学崔鹏博士最新分享

【网络节点表示学习教程】在向量空间中启用网络分析和推理，清华大学崔鹏博士最新分享

专知

11+阅读 · 2018年2月9日

网络节点表示学习论文笔记01—AAAI2018超网络节点表示学习

网络节点表示学习论文笔记01—AAAI2018超网络节点表示学习

专知

15+阅读 · 2018年2月9日

图上的归纳表示学习

图上的归纳表示学习

科技创新与创业

23+阅读 · 2017年11月9日

相关论文

Residual-loss Anomaly Analysis of Physics-Informed Neural Networks: An Inverse Method for Change-point Detection in Nonlinear Dynamical Systems with Regime Switching

Arxiv

0+阅读 · 4月28日

Space-Air-Ground-Integrated Networks: The BER vs. Residual Delay and Doppler Analysis

Arxiv

0+阅读 · 4月28日

Saddle-To-Saddle Dynamics in Deep ReLU Networks: Low-Rank Bias in the First Saddle Escape

Arxiv

0+阅读 · 4月20日

Modeling Sparse and Bursty Vulnerability Sightings: Forecasting Under Data Constraints

Arxiv

0+阅读 · 4月17日

bioLeak: Leakage-Aware Modeling and Diagnostics for Machine Learning in R

Arxiv

0+阅读 · 4月13日

Differentially Private and Federated Structure Learning in Bayesian Networks

Arxiv

0+阅读 · 4月10日

Universal Approximation Constraints of Narrow ResNets: The Tunnel Effect

Arxiv

0+阅读 · 3月30日

Learning to Localize Leakage of Cryptographic Sensitive Variables

Arxiv

0+阅读 · 3月25日

Unveiling Hidden Convexity in Deep Learning: a Sparse Signal Processing Perspective

Arxiv

0+阅读 · 3月25日

Better Neural Network Expressivity: Subdividing the Simplex

Arxiv

0+阅读 · 2月19日

相关基金

基于学习的智能化漏洞挖掘关键技术研究

国家自然科学基金

6+阅读 · 2017年12月31日

面向动态演化的网构软件失效机理与测评方法

国家自然科学基金

1+阅读 · 2015年12月31日

基于磁荷分布反演算法的漏磁检测缺陷三维量化方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

井震联合数据驱动下，多智能技术融合的煤层气储层参数预测与评价

国家自然科学基金

2+阅读 · 2015年12月31日

动力学涨落对网络结构的影响

国家自然科学基金

0+阅读 · 2015年12月31日

低差分均匀度密码函数的构造与分析

国家自然科学基金

0+阅读 · 2015年12月31日

基于深度学习的海量截获卫星数据分析技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

故障互连网络中含经过指定边的无错误哈密顿圈问题研究

国家自然科学基金

0+阅读 · 2015年12月31日

任意网络中的可分数据处理研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于非线性动力学的复杂网络结构识别及其在力学系统中的应用

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员