基于Opus的机器学习数据中心光子轨道 (Photonic Rails in ML Datacenters with Opus) - 专知论文

会员服务 ·

0

轨道 · 并行 · 机器学习 · 机器学习训练 · 光交换 ·

Photonic Rails in ML Datacenters with Opus

翻译：基于Opus的机器学习数据中心光子轨道

Eric Ding,Barry Lyu,Bhaskar Kataria,Rachee Singh

from arxiv, 17 pages, 14 figures. arXiv admin note: text overlap with arXiv:2507.08119

Rail-optimized network fabrics have become the de facto datacenter scale-out fabric for large-scale ML training. However, the use of high-radix electrical switches to provide all-to-all connectivity in rails imposes massive power and cost. We propose a rethinking of the rail abstraction by retaining its communication semantics, but realizing it using optical circuit switches. The key challenge is that optical switches support one-to-one connectivity at a time, limiting the fan-out of traffic in ML workloads using hybrid parallelisms. We overcome this through \emph{parallelism-driven rail reconfiguration}, which exploits the non-overlapping communication phases of different parallelism dimensions. This time-multiplexes a single set of physical ports across circuit configurations tailored to each phase within a training iteration. We design and implement Opus, a control plane that orchestrates this in-job reconfiguration of photonic rails at parallelism phase boundaries, and evaluate it on a physical OCS testbed, the Perlmutter supercomputer, and in simulation at up to 2,048 GPUs. Our results show that photonic rails can achieve over $23\times$ network power reduction and $4\times$ cost savings while incurring less than $6\%$ training overhead at production-relevant OCS reconfiguration latencies.

翻译：轨道优化网络架构已成为大规模机器学习训练事实上的数据中心横向扩展架构。然而，在轨道中使用高基数电交换机提供全连接会带来巨大的功耗和成本。我们提出重新思考轨道抽象：保留其通信语义，但通过光路交换机实现。关键挑战在于光交换机每次仅支持一对一连接，限制了采用混合并行策略的机器学习工作负载的流量扇出。我们通过"并行性驱动的轨道重配置"克服这一限制，该方法利用不同并行维度间非重叠的通信阶段。该技术将单组物理端口在训练迭代内各阶段定制的电路配置间进行时分复用。我们设计并实现了Opus——一个在并行阶段边界协调光子轨道作业内重配置的控制平面，并在物理光路交换机测试平台、Perlmutter超级计算机以及高达2,048个GPU的模拟环境中进行评估。结果表明，在生产级光路交换机重配置延迟下，光子轨道可实现超过23倍的网络功耗降低和4倍的成本节约，同时产生低于6%的训练开销。

0

相关内容

【斯坦福博士论文】可扩展、高效且安全的机器学习数据系统

【斯坦福博士论文】可扩展、高效且安全的机器学习数据系统

专知会员服务

21+阅读 · 2025年6月9日

以数据为中心的图机器学习

以数据为中心的图机器学习

专知会员服务

37+阅读 · 2023年9月25日

南洋理工北大等首篇《GPU数据中心中深度学习工作负载调度》综述论文，35页pdf全面阐述DL训练与推理GPU调度技术进展

南洋理工北大等首篇《GPU数据中心中深度学习工作负载调度》综述论文，35页pdf全面阐述DL训练与推理GPU调度技术进展

专知会员服务

45+阅读 · 2022年5月27日

【干货书】《Transformers 机器学习:深度探究》，Transformers for Machine Learning A Deep Dive

【干货书】《Transformers 机器学习:深度探究》，Transformers for Machine Learning A Deep Dive

专知会员服务

473+阅读 · 2022年4月21日

基于物理信息的机器学习

专知会员服务

140+阅读 · 2021年11月21日

机器学习在信道建模中的应用综述

机器学习在信道建模中的应用综述

专知会员服务

29+阅读 · 2021年3月16日

具有组合核的图神经网络，Graph Neural Networks with Composite Kernels

具有组合核的图神经网络，Graph Neural Networks with Composite Kernels

专知会员服务

59+阅读 · 2020年5月20日

最新《机器学习最优化》课程笔记，36页pdf，Optimization for Machine Learning

专知会员服务

171+阅读 · 2020年5月10日

【机器学习最优化课程笔记】Optimization for Machine Learning，36页pdf

【机器学习最优化课程笔记】Optimization for Machine Learning，36页pdf

专知会员服务

117+阅读 · 2020年3月25日

【谷歌大脑新论文】利用可微摄动优化器进行学习，Learning with Differentiable Perturbed Optimizers

【谷歌大脑新论文】利用可微摄动优化器进行学习，Learning with Differentiable Perturbed Optimizers

专知会员服务

29+阅读 · 2020年2月22日

推荐！《基于多智能体学习的任务分配动态邻域优化》2022最新41页综述论文，伦敦国王学院

推荐！《基于多智能体学习的任务分配动态邻域优化》2022最新41页综述论文，伦敦国王学院

专知

17+阅读 · 2022年11月15日

【干货书】《Transformers 机器学习:深度探究》，284页pdf

【干货书】《Transformers 机器学习:深度探究》，284页pdf

专知

72+阅读 · 2022年4月21日

图机器学习 2.2-2.4 Properties of Networks, Random Graph

图机器学习 2.2-2.4 Properties of Networks, Random Graph

图与推荐

10+阅读 · 2020年3月28日

Transformers就是图神经网络？NTU-Chaitanya Joshi论述: 是GNN的一个特例

Transformers就是图神经网络？NTU-Chaitanya Joshi论述: 是GNN的一个特例

专知

20+阅读 · 2020年3月1日

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

专知

14+阅读 · 2019年10月9日

KGCN：使用TensorFlow进行知识图谱的机器学习

KGCN：使用TensorFlow进行知识图谱的机器学习

专知

16+阅读 · 2019年8月4日

【深度学习】深度学习的核心：掌握训练数据的方法

【深度学习】深度学习的核心：掌握训练数据的方法

产业智能官

12+阅读 · 2018年1月14日

学界 | 深度学习在单图像超分辨率上的应用：SRCNN、Perceptual loss、SRResNet

学界 | 深度学习在单图像超分辨率上的应用：SRCNN、Perceptual loss、SRResNet

机器之心

12+阅读 · 2017年11月7日

【深度学习基础】4. Recurrent Neural Networks

【深度学习基础】4. Recurrent Neural Networks

微信AI

16+阅读 · 2017年7月19日

孪生网络实现小数据学习！看神经网络如何找出两张图片的相似点

孪生网络实现小数据学习！看神经网络如何找出两张图片的相似点

机器人圈

35+阅读 · 2017年7月18日

软件定义网络（SDN）环境下基于机器学习的路由预规划研究

国家自然科学基金

6+阅读 · 2015年12月31日

基于空分复用的全光互联数据中心网络关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

数据中心网络中延时敏感的传输控制协议

国家自然科学基金

0+阅读 · 2015年12月31日

InP基单片集成少模光发射芯片的研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于深度学习的海量截获卫星数据分析技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

高维不平衡数据的集成学习算法研究

国家自然科学基金

16+阅读 · 2015年12月31日

支持软件定义的可变带宽光网络节点关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

多数据中心环境中科学大数据应用的数据布局与执行优化研究

国家自然科学基金

0+阅读 · 2015年12月31日

原子、分子中电子轨道成像的一种新方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

极限学习机拓展研究及其在近红外光谱分析中的应用

国家自然科学基金

1+阅读 · 2014年12月31日

Direct Kernel Optimization: Efficient Design for Opto-Electronic Convolutional Neural Networks

Arxiv

0+阅读 · 2月13日

Spectral-Spatial Contrastive Learning Framework for Regression on Hyperspectral Data

Arxiv

0+阅读 · 2月11日

Harvest: Adaptive Photonic Switching Schedules for Collective Communication in Scale-up Domains

Arxiv

0+阅读 · 2月9日

All-Optical Segmentation via Diffractive Neural Networks for Autonomous Driving

Arxiv

0+阅读 · 2月7日

Image deblurring based on lightweight multi-information fusion network

Arxiv

0+阅读 · 1月27日

Lightspeed Data Compute for the Space Era

Arxiv

0+阅读 · 1月24日

Analog-to-Stochastic Converter Using Magnetic Tunnel Junction Devices for Vision Chips

Arxiv

0+阅读 · 1月21日

VCSEL-based CPO for Scale-Up in A.I. Datacenter. Status and Perspectives

Arxiv

0+阅读 · 1月20日

Optimal Power Allocation and Sub-Optimal Channel Assignment for Downlink NOMA Systems Using Deep Reinforcement Learning

Arxiv

0+阅读 · 1月18日

Online Rack Placement in Large-Scale Data Centers: Online Sampling Optimization and Deployment

Arxiv

0+阅读 · 1月16日

VIP会员

文章信息

相关主题

机器学习训练

相关VIP内容

【斯坦福博士论文】可扩展、高效且安全的机器学习数据系统

【斯坦福博士论文】可扩展、高效且安全的机器学习数据系统

专知会员服务

21+阅读 · 2025年6月9日

以数据为中心的图机器学习

以数据为中心的图机器学习

专知会员服务

37+阅读 · 2023年9月25日

南洋理工北大等首篇《GPU数据中心中深度学习工作负载调度》综述论文，35页pdf全面阐述DL训练与推理GPU调度技术进展

南洋理工北大等首篇《GPU数据中心中深度学习工作负载调度》综述论文，35页pdf全面阐述DL训练与推理GPU调度技术进展

专知会员服务

45+阅读 · 2022年5月27日

【干货书】《Transformers 机器学习:深度探究》，Transformers for Machine Learning A Deep Dive

【干货书】《Transformers 机器学习:深度探究》，Transformers for Machine Learning A Deep Dive

专知会员服务

473+阅读 · 2022年4月21日

基于物理信息的机器学习

专知会员服务

140+阅读 · 2021年11月21日

机器学习在信道建模中的应用综述

机器学习在信道建模中的应用综述

专知会员服务

29+阅读 · 2021年3月16日

具有组合核的图神经网络，Graph Neural Networks with Composite Kernels

具有组合核的图神经网络，Graph Neural Networks with Composite Kernels

专知会员服务

59+阅读 · 2020年5月20日

最新《机器学习最优化》课程笔记，36页pdf，Optimization for Machine Learning

专知会员服务

171+阅读 · 2020年5月10日

【机器学习最优化课程笔记】Optimization for Machine Learning，36页pdf

【机器学习最优化课程笔记】Optimization for Machine Learning，36页pdf

专知会员服务

117+阅读 · 2020年3月25日

【谷歌大脑新论文】利用可微摄动优化器进行学习，Learning with Differentiable Perturbed Optimizers

【谷歌大脑新论文】利用可微摄动优化器进行学习，Learning with Differentiable Perturbed Optimizers

专知会员服务

29+阅读 · 2020年2月22日

热门VIP内容

开通专知VIP会员享更多权益服务

智能体记忆深度剖析：评价指标与系统局限性的分类体系及实证分析

《可信人工智能赋能系统的支柱》

【CMU博士论文】可靠轨迹预测的分层基石：数据、评估与方法

人工智能赋能边缘与自主系统：美陆军现代化进程聚焦威胁探测与战术边缘情报

相关资讯

推荐！《基于多智能体学习的任务分配动态邻域优化》2022最新41页综述论文，伦敦国王学院

推荐！《基于多智能体学习的任务分配动态邻域优化》2022最新41页综述论文，伦敦国王学院

专知

17+阅读 · 2022年11月15日

【干货书】《Transformers 机器学习:深度探究》，284页pdf

【干货书】《Transformers 机器学习:深度探究》，284页pdf

专知

72+阅读 · 2022年4月21日

图机器学习 2.2-2.4 Properties of Networks, Random Graph

图机器学习 2.2-2.4 Properties of Networks, Random Graph

图与推荐

10+阅读 · 2020年3月28日

Transformers就是图神经网络？NTU-Chaitanya Joshi论述: 是GNN的一个特例

Transformers就是图神经网络？NTU-Chaitanya Joshi论述: 是GNN的一个特例

专知

20+阅读 · 2020年3月1日

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

专知

14+阅读 · 2019年10月9日

KGCN：使用TensorFlow进行知识图谱的机器学习

KGCN：使用TensorFlow进行知识图谱的机器学习

专知

16+阅读 · 2019年8月4日

【深度学习】深度学习的核心：掌握训练数据的方法

【深度学习】深度学习的核心：掌握训练数据的方法

产业智能官

12+阅读 · 2018年1月14日

学界 | 深度学习在单图像超分辨率上的应用：SRCNN、Perceptual loss、SRResNet

学界 | 深度学习在单图像超分辨率上的应用：SRCNN、Perceptual loss、SRResNet

机器之心

12+阅读 · 2017年11月7日

【深度学习基础】4. Recurrent Neural Networks

【深度学习基础】4. Recurrent Neural Networks

微信AI

16+阅读 · 2017年7月19日

孪生网络实现小数据学习！看神经网络如何找出两张图片的相似点

孪生网络实现小数据学习！看神经网络如何找出两张图片的相似点

机器人圈

35+阅读 · 2017年7月18日

相关论文

Direct Kernel Optimization: Efficient Design for Opto-Electronic Convolutional Neural Networks

Arxiv

0+阅读 · 2月13日

Spectral-Spatial Contrastive Learning Framework for Regression on Hyperspectral Data

Arxiv

0+阅读 · 2月11日

Harvest: Adaptive Photonic Switching Schedules for Collective Communication in Scale-up Domains

Arxiv

0+阅读 · 2月9日

All-Optical Segmentation via Diffractive Neural Networks for Autonomous Driving

Arxiv

0+阅读 · 2月7日

Image deblurring based on lightweight multi-information fusion network

Arxiv

0+阅读 · 1月27日

Lightspeed Data Compute for the Space Era

Arxiv

0+阅读 · 1月24日

Analog-to-Stochastic Converter Using Magnetic Tunnel Junction Devices for Vision Chips

Arxiv

0+阅读 · 1月21日

VCSEL-based CPO for Scale-Up in A.I. Datacenter. Status and Perspectives

Arxiv

0+阅读 · 1月20日

Optimal Power Allocation and Sub-Optimal Channel Assignment for Downlink NOMA Systems Using Deep Reinforcement Learning

Arxiv

0+阅读 · 1月18日

Online Rack Placement in Large-Scale Data Centers: Online Sampling Optimization and Deployment

Arxiv

0+阅读 · 1月16日

相关基金

软件定义网络（SDN）环境下基于机器学习的路由预规划研究

国家自然科学基金

6+阅读 · 2015年12月31日

基于空分复用的全光互联数据中心网络关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

数据中心网络中延时敏感的传输控制协议

国家自然科学基金

0+阅读 · 2015年12月31日

InP基单片集成少模光发射芯片的研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于深度学习的海量截获卫星数据分析技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

高维不平衡数据的集成学习算法研究

国家自然科学基金

16+阅读 · 2015年12月31日

支持软件定义的可变带宽光网络节点关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

多数据中心环境中科学大数据应用的数据布局与执行优化研究

国家自然科学基金

0+阅读 · 2015年12月31日

原子、分子中电子轨道成像的一种新方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

极限学习机拓展研究及其在近红外光谱分析中的应用

国家自然科学基金

1+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员