博士论文 | Riemannian Deep Learning:模块、网络与几何

导读

欧氏空间里的深度学习已经形成一整套成熟组件:归一化、全连接层、卷积、分类头、残差结构、优化器。问题在于,很多真实数据并不天然生活在欧氏空间里。协方差矩阵、相关矩阵、旋转矩阵、子空间、双曲层级结构、图和知识图谱中的关系,都更自然地位于黎曼流形或其他非欧几何空间中。如果仍然把它们摊平到欧氏空间中处理,往往会丢失结构、引入近似误差,甚至带来数值不稳定。 Ziheng Chen 的博士论文《Riemannian Deep Learning: Modules, Networks, and Geometries》围绕一个核心问题展开:如何把深度学习的基本模块、网络结构和底层几何统一地搬到黎曼空间中,同时保持理论可解释性、计算可 tractable、训练足够稳定。论文不是单篇方法的扩展版,而是围绕多年工作形成的一套体系化研究:包括 ICLR 2024 的 Lie Group Batch Normalization、ICLR 2025 的 Gyrogroup Batch Normalization、CVPR 2024 和 NeurIPS 2024 的黎曼多项逻辑回归、ICLR 2026 的 Proper Velocity Neural Networks、CVPR 2026 的 Hyperbolic Busemann Neural Networks、ICML 2026 的 full-rank correlation matrix 网络,以及 ICLR 2026 的 Cholesky Product Geometry。 这篇博士论文的清晰之处在于,它把黎曼深度学习分成三个互相连接的层次:第一,设计跨流形可复用的通用模块;第二,当通用构造不足以利用特定几何结构时,设计面向具体流形的网络;第三,反过来设计底层黎曼度量本身,让几何更灵活、更高效、更稳定。换句话说,它关心的不只是“在流形上做深度学习”,而是要建立一套从几何、算子、模块到网络的工程化与理论化框架。

论文信息

论文题目:Riemannian Deep Learning: Modules, Networks, and Geometries 作者:Ziheng Chen 博士培养单位:Universita di Trento,Doctoral School in Information and Communication Technology 导师:Prof. Nicu Sebe 联合导师:Prof. Bernhard Scholkopf 论文链接:https://arxiv.org/abs/2607.19305 arXiv 版本:2607.19305v2 发布时间:2026 年 7 月 22 日 关键词:黎曼深度学习、几何深度学习、黎曼流形、矩阵流形、李群、常曲率流形

研究背景:为什么深度学习需要黎曼几何

传统神经网络通常默认输入和隐表示位于欧氏空间:向量相加、标量乘法、均值方差、线性分类、卷积和反向传播都围绕平直空间展开。但很多机器学习对象具有内在几何约束。SPD 矩阵用于协方差、脑电、雷达和动作识别;旋转矩阵位于特殊正交群;Grassmann 流形描述子空间;双曲空间适合层级和树状结构;相关矩阵是比协方差更紧凑的统计表示。 如果直接把这些对象拉直成普通向量,模型可能破坏正定性、单位范数、旋转约束或曲率结构。更严重的是,很多黎曼算子本身会进入深度网络组件:测地距离影响分类边界,指数映射和对数映射影响残差与注意力,Fréchet 均值影响归一化与卷积,平行移动影响向量比较。也就是说,底层几何不是装饰性的“数学包装”,而是会改变网络公式、参数化方式、计算成本和训练稳定性的基础设施。 论文指出,现有黎曼深度学习面临三类瓶颈。第一,很多基础模块仍绑定在单一流形或单一度量上,缺少统一设计原则。第二,在某些流形上,通用构造虽然存在,但不能充分利用特定结构,导致效率或稳定性不理想。第三,许多方法默认使用固定黎曼度量,而度量本身可能并不适配数据或网络动态;同时,一些经典度量在深层网络中反复调用时计算昂贵、数值脆弱。

总体框架:三层贡献

论文的主体章节可以概括为三条主线。 第一条主线是跨流形的统一模块设计。第 3 章和第 4 章分别研究归一化和分类:前者把批归一化推广到李群和更一般的 gyrogroup 结构,后者把欧氏多项逻辑回归推广到 SPD 流形和一般黎曼流形。目标是找到足够抽象的几何结构,使同一个模块原则可以在多类流形上实例化。 第二条主线是流形专用网络设计。第 5 章承认一个现实问题:完全通用的方法不一定最好。当特定流形具有额外结构时,应该把这种结构直接用于网络设计。论文因此分别研究 Proper Velocity 双曲模型、Busemann 函数与 horosphere、full-rank correlation matrix 等对象,构造更适合稳定训练和高效推理的网络层。 第三条主线是底层几何设计。第 6 章不再假定黎曼度量已经给定,而是研究如何学习或构造更适合深度网络的 SPD 度量。Adaptive Log-Euclidean Metrics 让度量可学习,Product Cholesky Metrics 和 Bures-Wasserstein-Cholesky Metrics 则利用 Cholesky 因子的乘积结构获得闭式算子、更快计算和更强数值稳定性。 这三个层次构成一个完整闭环:先把欧氏模块迁移到黎曼空间,再为特殊流形设计专用网络,最后改造几何本身以服务学习。

数学基础:从空间、度量到可微计算

第 2 章为整篇论文搭建数学工具箱,涵盖拓扑、微分几何、黎曼几何、度量几何、流形上的代数结构、黎曼优化和矩阵函数。对公众号读者来说,可以把这一章理解为回答三个问题。 第一,数据对象在哪里。不同数据类型位于不同空间:SPD 矩阵形成正定矩阵流形,相关矩阵形成 full-rank correlation manifold,Grassmann 流形表示子空间,SO(n) 表示旋转,双曲和球面等常曲率空间表示层级或方向结构。 第二,在这个空间里如何计算。欧氏空间里常用的加法、减法、均值、距离和线性层,在流形上需要替换为测地线、指数映射、对数映射、Fréchet 均值、群运算或 gyrovector 运算。很多网络层能否成立,取决于这些算子是否有闭式表达、是否可微、是否数值稳定。 第三,如何反向传播。矩阵函数的微分、黎曼梯度、切空间映射和流形优化会直接影响端到端训练。论文后续所有模块都建立在这一层之上,因此第 2 章不是纯背景,而是整个方法体系的接口规范。

黎曼批归一化:从李群到广义结构

第 3 章研究黎曼批归一化。普通 BN 的思想是在欧氏空间中对 batch 的均值和方差进行控制,从而稳定训练。但在流形上,均值、平移和缩放并不天然等价于欧氏操作。若直接在切空间近似,可能破坏流形结构;若为每个流形单独推导,又难以形成通用模块。 论文首先提出 Lie Group Batch Normalization。其核心做法是利用李群结构:用群平移完成居中和偏置,用单位元处切空间的缩放控制方差,从而在保持流形结构的同时复刻欧氏 BN 的关键功能。作者在 SPD、旋转和相关矩阵等李群结构上给出具体实例,并分析 Riemannian sample mean 与 variance 的理论控制。

不过,很多重要流形并不天然具备合适的李群结构。为此,论文进一步提出 pseudo-reductive gyrogroups,将经典 gyrogroup 与李群统一到更宽的代数框架中,并基于这一结构构造 Gyrogroup Batch Normalization。GyroBN 可以看作把“居中、偏置、缩放”从欧氏向量空间迁移到曲率空间后的更一般版本,适用于 Grassmann、常曲率、相关矩阵等更广泛对象。

这一章的贡献不只是给出一个新归一化层,而是提供了一种模块设计范式:先识别流形上能替代欧氏加减和缩放的代数结构,再在该结构上重写神经网络组件。

黎曼分类层:把线性分类推广到弯曲空间

第 4 章研究分类头。欧氏神经网络中的多项逻辑回归,本质上是全连接层加 softmax;其决策边界是超平面。但在黎曼流形中,输入点和决策边界不再处于平直空间,分类器需要重新定义“点到超平面的 margin”。 论文先在 SPD 流形上研究这一问题。作者通过 SPD 输入与决策超平面之间的测地 margin 构造分类器,并在若干 flat pullback metrics 下得到闭式形式。这为常用的 LogEig MLR 提供了内在几何解释:它不仅是把 SPD 矩阵取对数后做欧氏分类,也可以理解为特定黎曼几何下的分类边界。

随后,论文把分类器扩展到更一般的黎曼流形。由于直接求点到超平面的 infimum 往往不可 tractable,作者用黎曼三角学改写分类公式,使最终的 RMLR 只需要显式 Riemannian logarithmic map 就能工作。这一点很重要:许多流形都有可用的对数映射,但未必能方便地计算复杂的点到超平面距离。RMLR 因而把一批已有流形分类器统一为特例,并能生成新的 SPD 和 SO(n) 分类器。 从工程角度看,这一章回答了一个基础问题:如果深度网络最后一层的输入是流形值特征,是否必须先摊平成向量?论文给出的答案是否定的。只要几何结构清楚,分类头本身也可以是内在的。

流形专用网络:利用双曲与相关矩阵的特殊结构

第 5 章进一步走向流形专用网络设计。作者认为,当通用构造不能充分利用流形特性时,应该针对具体空间重新设计网络层。 第一类是 Proper Velocity Neural Networks。双曲空间适合层级数据,但常见 Poincare ball 或 Lorentz model 的实现可能遇到边界约束、数值稳定和参数化复杂度问题。Proper Velocity 模型提供一种无约束表示,使双曲点可以通过更稳定的参数化参与计算。基于这一几何,论文构造了 MLR、全连接、卷积、激活和归一化层,用于稳定的双曲深度学习。 第二类是 Hyperbolic Busemann Neural Networks。Busemann 函数和 horosphere 在双曲几何中刻画“朝向无穷远边界的距离结构”。论文用它们构造 Busemann MLR 和 Busemann FC,把分类 logit 解释为点到 horosphere 的几何关系。这比单纯在切空间中做线性分类更贴近双曲空间的内在结构,也具有较好的计算效率。 第三类是 full-rank correlation networks。相关矩阵相比协方差矩阵更紧凑,天然出现在统计建模、信号处理和多变量数据中,但在深度学习里长期没有得到 SPD 矩阵那样充分的网络化处理。论文基于五种 correlation geometries 构造 MLR、FC 和卷积层,并推导准确的黎曼反向传播,使相关矩阵可以作为一等表示进入端到端网络。

这一章展示了论文的第二个关键观点:黎曼深度学习不能只追求“最大通用性”。在很多任务中,真正的性能、稳定性和可解释性来自对具体几何结构的尊重。

底层几何设计:让度量可学习、可计算、可稳定

第 6 章把问题再往下推进:如果网络模块依赖黎曼度量,那么度量本身是否也可以为深度学习而设计? 首先是 Adaptive Log-Euclidean Metrics。传统 SPD 度量往往固定不变,可能限制模型表达能力。论文通过参数化矩阵 logarithm,在 pullback framework 中学习度量,使几何能够适配数据和网络动态,同时保留闭式黎曼算子和兼容的阿贝尔李群结构。这样,度量不再只是预先给定的背景假设,而成为可学习的建模组件。 其次是 Product Cholesky Geometries。很多 SPD 度量需要反复计算矩阵函数,深层训练中会带来显著开销和数值风险。作者利用 Cholesky 因子的乘积结构构造 Power-Cholesky Metric 和 Bures-Wasserstein-Cholesky Metric,避免某些标量对数和指数操作,获得快速稳定的闭式黎曼与 gyro 算子。这些几何被用于 SPD 分类、残差学习和张量插值,并通过实验验证效率、可扩展性和数值鲁棒性。

这一章的意义在于,它把几何本身变成深度学习设计变量。过去我们常问“在给定流形上怎么搭网络”,而这篇论文进一步问“什么样的几何更适合网络训练”。这也是黎曼深度学习走向实用系统必须面对的问题。

实验覆盖:从视觉、信号到图与基因组

论文的实验覆盖面很广,贯穿视觉、动作识别、雷达、脑电、图学习、图像分类和基因组序列建模等任务。由于每章方法不同,实验目标也各有侧重。 在归一化章节,实验主要验证 LieBN 和 GyroBN 是否能在不同流形和不同网络骨干上稳定训练,并改善性能。结果表明,将均值和方差控制放回合适的几何结构中,通常优于简单切空间近似或几何专用但不可扩展的归一化方法。 在分类章节,实验重点比较 LogEig、SPD MLR、RMLR 等分类头在 SPDNet、RResNet、图网络和 LieNet 等架构中的表现。核心结论是,内在分类边界可以在保持几何一致性的同时带来更强表达能力,并且一些常用分类器可以被统一解释为特定度量下的特例。 在流形专用网络章节,双曲网络被用于图学习、图像和基因组任务,相关矩阵网络被用于基于相关结构的分类任务。结果强调了两个方面:一是合适的双曲表示可以提升层级结构建模;二是相关矩阵不只是 SPD 的简化替代,而是可以通过专门几何网络成为有效表示。 在 SPD 几何章节,实验不仅看准确率,还关注效率、失败概率、测地插值的 swelling effect、矩阵函数调用次数和训练步耗时。这种评估方式非常重要,因为黎曼网络的瓶颈经常不是“能不能写出公式”,而是“公式能不能稳定、快速、反复地用于深度训练”。

结论与未来方向

论文最后把贡献总结为三层。第一,提出跨流形统一模块:LieBN、GyroBN 和 RMLR 为归一化与分类提供了更一般的几何基础。第二,提出流形专用网络:PVNN、HBNN 和 CorNet 分别利用双曲模型、Busemann 函数、horosphere 与相关矩阵几何。第三,提出底层几何设计:ALEM、PCM 和 BWCM 让 SPD 流形上的度量更灵活、更高效、更稳定。 未来方向主要有两条。第一是面向复杂关系结构的新几何表示学习。现实系统常同时包含层级、周期、群结构、矩阵统计和多模态关系,单一欧氏或双曲空间未必足够,未来可能需要混合曲率、矩阵流形和更复杂几何的组合。第二是几何感知生成模型。几何既存在于 latent representation,也存在于概率分布空间;变分自编码器、连续 normalizing flow、score-based model、flow matching、信息几何和最优传输都可能与黎曼结构结合。关键问题是如何同时平衡潜空间几何和分布演化几何。

总结

《Riemannian Deep Learning: Modules, Networks, and Geometries》是一篇体系感很强的博士论文。它没有把黎曼深度学习停留在“把欧氏方法搬到流形上”的层面,而是围绕模块、网络和几何三层展开:哪些欧氏模块可以统一泛化,哪些流形需要专用结构,哪些底层度量应当重新设计以适配深度训练。 对几何深度学习研究者来说,这篇论文提供了一套从理论到实现的路线图;对大模型和表征学习研究者来说,它也提示了一个更大的趋势:未来的深度学习不一定只在平直向量空间里扩张,结构化数据、层级关系、分布空间和矩阵表示都可能要求模型真正理解并利用几何。

成为VIP会员查看完整内容
0
VIP会员
最新内容
博士论文 | Riemannian Deep Learning:模块、网络与几何
《同步多无人机系统中的故障与通信》
专知会员服务
2+阅读 · 今天6:23
面向国防作战的最佳自主与蜂群无人机技术
专知会员服务
7+阅读 · 7月28日
《异构人类团队的协作决策过程混合建模研究》
博士论文 | 面向大模型推理的内存高效算法
专知会员服务
6+阅读 · 7月27日
微信扫码咨询专知VIP会员