On the geometry and topology of representations: the manifolds of modular addition - 专知论文

会员服务 ·

0

表示 · 加法 · 流形 · 神经元 · 结构 ·

2025 年 12 月 31 日

On the geometry and topology of representations: the manifolds of modular addition

翻译：论表示几何与拓扑：模加法的流形结构

Gabriela Moisescu-Pareja,Gavin McCracken,Harley Wiltzer,Vincent Létourneau,Colin Daniels,Doina Precup,Jonathan Love

The Clock and Pizza interpretations, associated with architectures differing in either uniform or learnable attention, were introduced to argue that different architectural designs can yield distinct circuits for modular addition. In this work, we show that this is not the case, and that both uniform attention and trainable attention architectures implement the same algorithm via topologically and geometrically equivalent representations. Our methodology goes beyond the interpretation of individual neurons and weights. Instead, we identify all of the neurons corresponding to each learned representation and then study the collective group of neurons as one entity. This method reveals that each learned representation is a manifold that we can study utilizing tools from topology. Based on this insight, we can statistically analyze the learned representations across hundreds of circuits to demonstrate the similarity between learned modular addition circuits that arise naturally from common deep learning paradigms.

翻译：针对具有均匀注意力与可学习注意力两种不同架构所提出的Clock与Pizza解释，曾被用于论证不同架构设计可产生不同的模加法计算回路。本研究表明事实并非如此：均匀注意力架构与可训练注意力架构实际上通过拓扑与几何等价的表示形式实现了相同的算法。我们的研究方法超越了对单个神经元与权重的解释，而是识别出每个习得表示对应的全部神经元，进而将神经元集合作为整体进行研究。该方法揭示每个习得表示均为一个流形，使我们能够运用拓扑学工具进行分析。基于这一洞见，我们通过对数百个计算回路中习得表示的统计分析，证明了从常见深度学习范式中自然产生的模加法习得回路具有高度相似性。

0

相关内容

【哥伦比亚大学】复杂网络深度表示的几何和拓扑推理，Geometric and Topological Inference for Deep Representations of Complex Networks

【哥伦比亚大学】复杂网络深度表示的几何和拓扑推理，Geometric and Topological Inference for Deep Representations of Complex Networks

专知会员服务

23+阅读 · 2022年3月11日

如何理解词嵌入几何结构？【Edinburgh博士论文】对词和关系表示的理论理解，97页pdf

如何理解词嵌入几何结构？【Edinburgh博士论文】对词和关系表示的理论理解，97页pdf

专知会员服务

41+阅读 · 2022年2月6日

重磅！《几何深度学习》课程发布！帝国理工/DeepMind等图ML大牛共同讲授: 从图几何到深度学习

重磅！《几何深度学习》课程发布！帝国理工/DeepMind等图ML大牛共同讲授: 从图几何到深度学习

专知会员服务

82+阅读 · 2021年8月9日

【硬核书】流形几何结构，358页pdf，Maryland大学WILLIAM教授编著

专知会员服务

44+阅读 · 2021年7月30日

《算法凸几何》简明书，Algorithmic Convex Geometry，50页pdf

专知会员服务

42+阅读 · 2021年4月2日

可解释高效异构图卷积网络，Interpretable and Efficient Heterogeneous Graph Convolutional Network

可解释高效异构图卷积网络，Interpretable and Efficient Heterogeneous Graph Convolutional Network

专知会员服务

63+阅读 · 2020年7月12日

【MIT】Yufei Zhao《图论与加法组合学》，177页pdf

【MIT】Yufei Zhao《图论与加法组合学》，177页pdf

专知会员服务

52+阅读 · 2020年4月27日

神经网络的拓扑结构，TOPOLOGY OF DEEP NEURAL NETWORKS

神经网络的拓扑结构，TOPOLOGY OF DEEP NEURAL NETWORKS

专知会员服务

35+阅读 · 2020年4月15日

【清华大学】自动微分蒙特卡洛，理论与应用，Automatic Differentiable Monte Carlo: Theory and Application (附pdf）

专知会员服务

28+阅读 · 2019年11月23日

【ACL 2019 Tutorials】基于图的含义表示:设计和处理（Graph-Based Meaning Representations: Design and Processing），Alexander Koller，Stephan Oepen，孙薇薇

【ACL 2019 Tutorials】基于图的含义表示:设计和处理（Graph-Based Meaning Representations: Design and Processing），Alexander Koller，Stephan Oepen，孙薇薇

专知会员服务

10+阅读 · 2019年11月16日

【MIT博士论文】深度学习几何表示，138页pdf

【MIT博士论文】深度学习几何表示，138页pdf

专知

18+阅读 · 2022年9月4日

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

专知

21+阅读 · 2019年11月14日

【Awesome】最全的机器学习可解释性资料（machine-learning-interpretability）

【Awesome】最全的机器学习可解释性资料（machine-learning-interpretability）

专知

29+阅读 · 2019年3月1日

高赞新书《可解释的机器学习》出版：理解黑盒必备，免费资源

高赞新书《可解释的机器学习》出版：理解黑盒必备，免费资源

量子位

23+阅读 · 2019年2月23日

【深度学习】深度学习的几何观点：流形分布定律、学习能力的上限、概率变换的几何观点

【深度学习】深度学习的几何观点：流形分布定律、学习能力的上限、概率变换的几何观点

产业智能官

10+阅读 · 2018年6月23日

深度丨顾险峰：深度学习的几何观点——流形分布定律

深度丨顾险峰：深度学习的几何观点——流形分布定律

德先生

17+阅读 · 2018年6月11日

【论文推荐】最新5篇知识图谱相关论文—强化学习、习知识图谱的表示、词义消除歧义、并行翻译嵌入、图数据库

【论文推荐】最新5篇知识图谱相关论文—强化学习、习知识图谱的表示、词义消除歧义、并行翻译嵌入、图数据库

专知

10+阅读 · 2018年1月24日

【推荐】ResNet, AlexNet, VGG, Inception：各种卷积网络架构的理解

【推荐】ResNet, AlexNet, VGG, Inception：各种卷积网络架构的理解

机器学习研究会

20+阅读 · 2017年12月17日

【论文】深度学习的数学解释

【论文】深度学习的数学解释

机器学习研究会

10+阅读 · 2017年12月15日

【论文】图上的表示学习综述

【论文】图上的表示学习综述

机器学习研究会

15+阅读 · 2017年9月24日

一类闭半黎曼流形的几何与拓扑性质

国家自然科学基金

0+阅读 · 2015年12月31日

度条件和连通度条件下任意可分图的研究

国家自然科学基金

0+阅读 · 2015年12月31日

图论中的整数流与圆流

国家自然科学基金

0+阅读 · 2015年12月31日

考虑材料分布不确定性的结构拓扑优化问题数学建模与求解方法

国家自然科学基金

0+阅读 · 2015年12月31日

不同加工层次和不同时空尺度下无意识加工之间的相互作用

国家自然科学基金

0+阅读 · 2015年12月31日

关于 Finsler 流形上调和映射与 Laplacian 的若干问题研究

国家自然科学基金

1+阅读 · 2014年12月31日

几类高阶非线性行波方程的精确解,分支和复杂动力学研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于quantaloid-加载范畴的quantale值收敛理论

国家自然科学基金

1+阅读 · 2014年12月31日

共形几何代数框架下时空拓扑关系的统一表达与计算方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

一般型代数曲面的自同构和模空间

国家自然科学基金

0+阅读 · 2014年12月31日

Thinking with Geometry: Active Geometry Integration for Spatial Reasoning

Arxiv

0+阅读 · 2月5日

GAMformer: Bridging Tabular Foundation Models and Interpretable Machine Learning

Arxiv

0+阅读 · 2月5日

On the Parallel Complexity of Identifying Groups and Quasigroups via Decompositions

Arxiv

0+阅读 · 2月3日

Spectral Superposition: A Theory of Feature Geometry

Arxiv

0+阅读 · 2月2日

The Geometric Mechanics of Contrastive Representation Learning: Alignment Potentials, Entropic Dispersion, and Cross-Modal Divergence

Arxiv

0+阅读 · 1月27日

The Geometry of Thought: How Scale Restructures Reasoning In Large Language Models

Arxiv

0+阅读 · 1月19日

CliffordNet: All You Need is Geometric Algebra

Arxiv

0+阅读 · 1月11日

More Power to the Particles: Analytic Geometry for Partial Optimal Transport-based Fluid simulation

Arxiv

0+阅读 · 1月9日

Geometry of Reason: Spectral Signatures of Valid Mathematical Reasoning

Arxiv

0+阅读 · 1月2日

Orchid: Flexible and Data-Dependent Convolution for Sequence Modeling

Arxiv

0+阅读 · 2025年12月30日

VIP会员

文章信息

相关主题

最新内容

MIT人机协同水下作业关键技术研究——集成适配至美国海军现役AUV

MIT人机协同水下作业关键技术研究——集成适配至美国海军现役AUV

专知会员服务

7+阅读 · 今天5:18

美海警海上态势感知无人系统

美海警海上态势感知无人系统

专知会员服务

4+阅读 · 今天5:10

安杜里尔Lattice平台的发展演变：美军多域自主作战的核心软件架构

安杜里尔Lattice平台的发展演变：美军多域自主作战的核心软件架构

专知会员服务

5+阅读 · 今天4:30

《释放自主力量：将人工智能驱动无人机融入现代军事战略》

《释放自主力量：将人工智能驱动无人机融入现代军事战略》

专知会员服务

10+阅读 · 今天3:44

《智能作战任务规划技术：实验流程与发现》50页报告

《智能作战任务规划技术：实验流程与发现》50页报告

专知会员服务

18+阅读 · 今天3:40

《复杂系统数据驱动预测建模的数值框架》报告

《复杂系统数据驱动预测建模的数值框架》报告

专知会员服务

7+阅读 · 今天3:37

从“会话式人工智能”角度看“Maven智能系统”

从“会话式人工智能”角度看“Maven智能系统”

专知会员服务

5+阅读 · 今天3:02

《仿真互操作性就绪水平（SIRL）标准用户指南：评估分布式仿真集成的互操作性风险》

《仿真互操作性就绪水平（SIRL）标准用户指南：评估分布式仿真集成的互操作性风险》

专知会员服务

9+阅读 · 今天2:57

《无人机母舰：一种新兴的海军平台》报告

《无人机母舰：一种新兴的海军平台》报告

专知会员服务

8+阅读 · 今天2:51

【ICLR2026】基于小型语言模型的终身智能体

【ICLR2026】基于小型语言模型的终身智能体

专知会员服务

13+阅读 · 4月27日

ICLR 2026获奖论文揭晓：两篇杰出论文，大神Alec Radford经典工作获时间检验奖

ICLR 2026获奖论文揭晓：两篇杰出论文，大神Alec Radford经典工作获时间检验奖

专知会员服务

9+阅读 · 4月27日

全面的反无人机系统培训计划

全面的反无人机系统培训计划

专知会员服务

4+阅读 · 4月27日

数字孪生在军事领域的应用综述：陆地、海上、空中、太空和网络空间多域赋能

数字孪生在军事领域的应用综述：陆地、海上、空中、太空和网络空间多域赋能

专知会员服务

9+阅读 · 4月27日

《美国首席数字与人工智能办公室（CDAO）人工智能治理与采办流程效能评估》报告

《美国首席数字与人工智能办公室（CDAO）人工智能治理与采办流程效能评估》报告

专知会员服务

13+阅读 · 4月27日

算法战加速推进：五角大楼项目、供应商生态体系与军事创新的战略重塑

算法战加速推进：五角大楼项目、供应商生态体系与军事创新的战略重塑

专知会员服务

7+阅读 · 4月27日

相关VIP内容

【哥伦比亚大学】复杂网络深度表示的几何和拓扑推理，Geometric and Topological Inference for Deep Representations of Complex Networks

【哥伦比亚大学】复杂网络深度表示的几何和拓扑推理，Geometric and Topological Inference for Deep Representations of Complex Networks

专知会员服务

23+阅读 · 2022年3月11日

如何理解词嵌入几何结构？【Edinburgh博士论文】对词和关系表示的理论理解，97页pdf

如何理解词嵌入几何结构？【Edinburgh博士论文】对词和关系表示的理论理解，97页pdf

专知会员服务

41+阅读 · 2022年2月6日

重磅！《几何深度学习》课程发布！帝国理工/DeepMind等图ML大牛共同讲授: 从图几何到深度学习

重磅！《几何深度学习》课程发布！帝国理工/DeepMind等图ML大牛共同讲授: 从图几何到深度学习

专知会员服务

82+阅读 · 2021年8月9日

【硬核书】流形几何结构，358页pdf，Maryland大学WILLIAM教授编著

专知会员服务

44+阅读 · 2021年7月30日

《算法凸几何》简明书，Algorithmic Convex Geometry，50页pdf

专知会员服务

42+阅读 · 2021年4月2日

可解释高效异构图卷积网络，Interpretable and Efficient Heterogeneous Graph Convolutional Network

可解释高效异构图卷积网络，Interpretable and Efficient Heterogeneous Graph Convolutional Network

专知会员服务

63+阅读 · 2020年7月12日

【MIT】Yufei Zhao《图论与加法组合学》，177页pdf

【MIT】Yufei Zhao《图论与加法组合学》，177页pdf

专知会员服务

52+阅读 · 2020年4月27日

神经网络的拓扑结构，TOPOLOGY OF DEEP NEURAL NETWORKS

神经网络的拓扑结构，TOPOLOGY OF DEEP NEURAL NETWORKS

专知会员服务

35+阅读 · 2020年4月15日

【清华大学】自动微分蒙特卡洛，理论与应用，Automatic Differentiable Monte Carlo: Theory and Application (附pdf）

专知会员服务

28+阅读 · 2019年11月23日

【ACL 2019 Tutorials】基于图的含义表示:设计和处理（Graph-Based Meaning Representations: Design and Processing），Alexander Koller，Stephan Oepen，孙薇薇

【ACL 2019 Tutorials】基于图的含义表示:设计和处理（Graph-Based Meaning Representations: Design and Processing），Alexander Koller，Stephan Oepen，孙薇薇

专知会员服务

10+阅读 · 2019年11月16日

热门VIP内容

开通专知VIP会员享更多权益服务

美海警海上态势感知无人系统

《释放自主力量：将人工智能驱动无人机融入现代军事战略》

MIT人机协同水下作业关键技术研究——集成适配至美国海军现役AUV

安杜里尔Lattice平台的发展演变：美军多域自主作战的核心软件架构

相关资讯

【MIT博士论文】深度学习几何表示，138页pdf

【MIT博士论文】深度学习几何表示，138页pdf

专知

18+阅读 · 2022年9月4日

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

专知

21+阅读 · 2019年11月14日

【Awesome】最全的机器学习可解释性资料（machine-learning-interpretability）

【Awesome】最全的机器学习可解释性资料（machine-learning-interpretability）

专知

29+阅读 · 2019年3月1日

高赞新书《可解释的机器学习》出版：理解黑盒必备，免费资源

高赞新书《可解释的机器学习》出版：理解黑盒必备，免费资源

量子位

23+阅读 · 2019年2月23日

【深度学习】深度学习的几何观点：流形分布定律、学习能力的上限、概率变换的几何观点

【深度学习】深度学习的几何观点：流形分布定律、学习能力的上限、概率变换的几何观点

产业智能官

10+阅读 · 2018年6月23日

深度丨顾险峰：深度学习的几何观点——流形分布定律

深度丨顾险峰：深度学习的几何观点——流形分布定律

德先生

17+阅读 · 2018年6月11日

【论文推荐】最新5篇知识图谱相关论文—强化学习、习知识图谱的表示、词义消除歧义、并行翻译嵌入、图数据库

【论文推荐】最新5篇知识图谱相关论文—强化学习、习知识图谱的表示、词义消除歧义、并行翻译嵌入、图数据库

专知

10+阅读 · 2018年1月24日

【推荐】ResNet, AlexNet, VGG, Inception：各种卷积网络架构的理解

【推荐】ResNet, AlexNet, VGG, Inception：各种卷积网络架构的理解

机器学习研究会

20+阅读 · 2017年12月17日

【论文】深度学习的数学解释

【论文】深度学习的数学解释

机器学习研究会

10+阅读 · 2017年12月15日

【论文】图上的表示学习综述

【论文】图上的表示学习综述

机器学习研究会

15+阅读 · 2017年9月24日

相关论文

Thinking with Geometry: Active Geometry Integration for Spatial Reasoning

Arxiv

0+阅读 · 2月5日

GAMformer: Bridging Tabular Foundation Models and Interpretable Machine Learning

Arxiv

0+阅读 · 2月5日

On the Parallel Complexity of Identifying Groups and Quasigroups via Decompositions

Arxiv

0+阅读 · 2月3日

Spectral Superposition: A Theory of Feature Geometry

Arxiv

0+阅读 · 2月2日

The Geometric Mechanics of Contrastive Representation Learning: Alignment Potentials, Entropic Dispersion, and Cross-Modal Divergence

Arxiv

0+阅读 · 1月27日

The Geometry of Thought: How Scale Restructures Reasoning In Large Language Models

Arxiv

0+阅读 · 1月19日

CliffordNet: All You Need is Geometric Algebra

Arxiv

0+阅读 · 1月11日

More Power to the Particles: Analytic Geometry for Partial Optimal Transport-based Fluid simulation

Arxiv

0+阅读 · 1月9日

Geometry of Reason: Spectral Signatures of Valid Mathematical Reasoning

Arxiv

0+阅读 · 1月2日

Orchid: Flexible and Data-Dependent Convolution for Sequence Modeling

Arxiv

0+阅读 · 2025年12月30日

相关基金

一类闭半黎曼流形的几何与拓扑性质

国家自然科学基金

0+阅读 · 2015年12月31日

度条件和连通度条件下任意可分图的研究

国家自然科学基金

0+阅读 · 2015年12月31日

图论中的整数流与圆流

国家自然科学基金

0+阅读 · 2015年12月31日

考虑材料分布不确定性的结构拓扑优化问题数学建模与求解方法

国家自然科学基金

0+阅读 · 2015年12月31日

不同加工层次和不同时空尺度下无意识加工之间的相互作用

国家自然科学基金

0+阅读 · 2015年12月31日

关于 Finsler 流形上调和映射与 Laplacian 的若干问题研究

国家自然科学基金

1+阅读 · 2014年12月31日

几类高阶非线性行波方程的精确解,分支和复杂动力学研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于quantaloid-加载范畴的quantale值收敛理论

国家自然科学基金

1+阅读 · 2014年12月31日

共形几何代数框架下时空拓扑关系的统一表达与计算方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

一般型代数曲面的自同构和模空间

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员