DiT-HC：在面向高性能计算的CPU集群上实现视觉生成模型DiT的高效训练 (DiT-HC: Enabling Efficient Training of Visual Generation Model DiT on HPC-oriented CPU Cluster) - 专知论文

会员服务 ·

0

中央处理器 (CPU) · 内存 · 生成模型 · 单元 · 系统 ·

DiT-HC: Enabling Efficient Training of Visual Generation Model DiT on HPC-oriented CPU Cluster

翻译：DiT-HC：在面向高性能计算的CPU集群上实现视觉生成模型DiT的高效训练

Jinxiao Zhang,Yunpu Xu,Xiyong Wu,Runmin Dong,Shenggan Cheng,Yi Zhao,Mengxuan Chen,Qinrui Zheng,Jianting Liu,Haohuan Fu

Generative foundation models have become an important tool for data reconstruction and simulation in scientific computing, showing a tight integration with traditional numerical simulations. At the same time, with the development of new hardware features, such as matrix acceleration units and high-bandwidth memory, CPU-based clusters offer promising opportunities to accelerate and scale such models, facilitating the unification of artificial intelligence and scientific computing. We present DiT-HC, the first system to train and scale the generative model DiT on a next-generation HPC CPU cluster. DiT-HC introduces three key techniques: (1) communication-free tensor parallelism (CFTP) with AutoMem for automated memory-aware dataflow, (2) HCOps, a suite of optimized GEMM and operator kernels leveraging vector and matrix acceleration units, and (3) a custom MPI backend that overlaps computation, communication, and memory movement. Experiments show 8.2 to 87.7 times speedups over native or public CPU libraries and 90.6% weak scaling efficiency on 256 nodes. These results demonstrate the feasibility of large-scale generative model training on CPU clusters and provide new insights for future HPC-AI co-design.

翻译：生成式基础模型已成为科学计算中数据重建与模拟的重要工具，显示出与传统数值模拟的紧密结合。与此同时，随着矩阵加速单元和高带宽内存等新型硬件特性的发展，基于CPU的集群为加速和扩展此类模型提供了广阔前景，促进了人工智能与科学计算的融合。我们提出了DiT-HC，这是首个在下一代高性能计算CPU集群上训练并扩展生成模型DiT的系统。DiT-HC引入了三项关键技术：(1) 结合AutoMem实现自动化内存感知数据流的无通信张量并行，(2) HCOps，一套利用向量和矩阵加速单元优化的通用矩阵乘法及算子内核，以及(3) 一个定制化的MPI后端，可重叠计算、通信与内存移动。实验表明，相较于原生或公开的CPU库，该系统实现了8.2至87.7倍的加速，并在256个节点上达到了90.6%的弱扩展效率。这些结果证明了在CPU集群上进行大规模生成模型训练的可行性，并为未来高性能计算与人工智能的协同设计提供了新的见解。

0

相关内容

中央处理器 (CPU)

中央处理器 (CPU)

中央处理器（CPU，Central Processing Unit），电子计算机的主要设备之一。其功能主要是解释计算机指令以及处理计算机软件中的数据。

CMU《生成式人工智能》最新课程

CMU《生成式人工智能》最新课程

专知会员服务

29+阅读 · 2025年10月3日

面向计算机视觉的数据生成与应用研究进展

面向计算机视觉的数据生成与应用研究进展

专知会员服务

14+阅读 · 2025年5月10日

不可错过！CMU最新《生成式人工智能大模型》课程：从文本、图像到多模态大模型

不可错过！CMU最新《生成式人工智能大模型》课程：从文本、图像到多模态大模型

专知会员服务

58+阅读 · 2024年9月29日

【MIT博士论文】高效深度学习计算的模型加速

【MIT博士论文】高效深度学习计算的模型加速

专知会员服务

34+阅读 · 2024年8月23日

CMU最新《生成式人工智能》课程，涵盖大模型最新技术

CMU最新《生成式人工智能》课程，涵盖大模型最新技术

专知会员服务

101+阅读 · 2024年4月4日

生成式AI时代的模型压缩与加速，韩松主讲MIT课程，资料全公开

生成式AI时代的模型压缩与加速，韩松主讲MIT课程，资料全公开

专知会员服务

35+阅读 · 2023年9月25日

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

专知会员服务

47+阅读 · 2022年10月31日

Jakub Tomczak- 《深度生成建模》讲座报告与视频，84页ppt，Deep Generative Modeling is a key to unlocking AI potential

Jakub Tomczak- 《深度生成建模》讲座报告与视频，84页ppt，Deep Generative Modeling is a key to unlocking AI potential

专知会员服务

61+阅读 · 2022年3月11日

最新《深度生成式模型进展》视频报告，43页ppt，斯坦福Aditya Grover

最新《深度生成式模型进展》视频报告，43页ppt，斯坦福Aditya Grover

专知会员服务

46+阅读 · 2020年8月9日

【CCF优秀博士学位论文奖-2019】面向多种学习任务的深度生成模型，清华大学李崇轩

【CCF优秀博士学位论文奖-2019】面向多种学习任务的深度生成模型，清华大学李崇轩

专知会员服务

49+阅读 · 2019年11月8日

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

专知

12+阅读 · 2022年10月31日

最新《深度生成式模型进展》视频报告，43页ppt，斯坦福Aditya Grover

最新《深度生成式模型进展》视频报告，43页ppt，斯坦福Aditya Grover

专知

13+阅读 · 2020年8月9日

清华大学《高级机器学习》课程

清华大学《高级机器学习》课程

专知

40+阅读 · 2020年7月21日

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

专知

14+阅读 · 2019年10月9日

【课程】斯坦福大学CS236：深度生成模型，附课程材料下载

【课程】斯坦福大学CS236：深度生成模型，附课程材料下载

专知

30+阅读 · 2019年9月25日

斯坦福CS236-深度生成模型2019-全套课程资料分享

斯坦福CS236-深度生成模型2019-全套课程资料分享

深度学习与NLP

20+阅读 · 2019年8月20日

【学科发展报告】计算机视觉

【学科发展报告】计算机视觉

中国自动化学会

43+阅读 · 2018年10月12日

展望：模型驱动的深度学习

展望：模型驱动的深度学习

人工智能学家

12+阅读 · 2018年1月23日

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

专知

12+阅读 · 2017年12月21日

MATLAB计算机视觉与深度学习实战

MATLAB计算机视觉与深度学习实战

炼数成金订阅号

21+阅读 · 2017年8月4日

模拟人眼视觉特性的高性能矢量多边形叠加分析算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

集成电路中电热耦合建模理论及高效数值方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

众核集群上基于MPI的模型扩展及性能优化研究

国家自然科学基金

1+阅读 · 2015年12月31日

斜模式高光谱成像的超分辨率重建方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向高性能异构众核架构的大规模CFD并行算法与应用

国家自然科学基金

0+阅读 · 2015年12月31日

面向存储受限应用的GPU性能预测模型和通信优化关键技术研究

国家自然科学基金

2+阅读 · 2015年12月31日

面向大数据的高时效并行计算机系统结构与技术

国家自然科学基金

0+阅读 · 2014年12月31日

超分辨率中的矩阵值算子学习问题

国家自然科学基金

1+阅读 · 2014年12月31日

CPU和GPU混合体系结构上生物网络比对并行算法研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向类脑计算存储器的调制编码理论及方法研究

国家自然科学基金

1+阅读 · 2014年12月31日

Dr. Kernel: Reinforcement Learning Done Right for Triton Kernel Generations

Arxiv

0+阅读 · 2月5日

Generative quantum machine learning via denoising diffusion probabilistic models

Arxiv

0+阅读 · 1月30日

HetCCL: Accelerating LLM Training with Heterogeneous GPUs

Arxiv

0+阅读 · 1月30日

SysMoBench: Evaluating AI on Formally Modeling Complex Real-World Systems

Arxiv

0+阅读 · 1月28日

Confidential Computing on Heterogeneous CPU-GPU Systems: Survey and Future Directions

Arxiv

0+阅读 · 1月26日

TetriServe: Efficient DiT Serving for Heterogeneous Image Generation

Arxiv

0+阅读 · 1月15日

HP2C-DT: High-Precision High-Performance Computer-enabled Digital Twin

Arxiv

0+阅读 · 1月15日

DiT-JSCC: Rethinking Deep JSCC with Diffusion Transformers and Semantic Representations

Arxiv

0+阅读 · 1月6日

BusterX++: Towards Unified Cross-Modal AI-Generated Content Detection and Explanation with MLLM

Arxiv

0+阅读 · 1月6日

EMLoC: Emulator-based Memory-efficient Fine-tuning with LoRA Correction

Arxiv

0+阅读 · 1月4日

VIP会员

文章信息

相关主题

中央处理器 (CPU)

相关VIP内容

CMU《生成式人工智能》最新课程

CMU《生成式人工智能》最新课程

专知会员服务

29+阅读 · 2025年10月3日

面向计算机视觉的数据生成与应用研究进展

面向计算机视觉的数据生成与应用研究进展

专知会员服务

14+阅读 · 2025年5月10日

不可错过！CMU最新《生成式人工智能大模型》课程：从文本、图像到多模态大模型

不可错过！CMU最新《生成式人工智能大模型》课程：从文本、图像到多模态大模型

专知会员服务

58+阅读 · 2024年9月29日

【MIT博士论文】高效深度学习计算的模型加速

【MIT博士论文】高效深度学习计算的模型加速

专知会员服务

34+阅读 · 2024年8月23日

CMU最新《生成式人工智能》课程，涵盖大模型最新技术

CMU最新《生成式人工智能》课程，涵盖大模型最新技术

专知会员服务

101+阅读 · 2024年4月4日

生成式AI时代的模型压缩与加速，韩松主讲MIT课程，资料全公开

生成式AI时代的模型压缩与加速，韩松主讲MIT课程，资料全公开

专知会员服务

35+阅读 · 2023年9月25日

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

专知会员服务

47+阅读 · 2022年10月31日

Jakub Tomczak- 《深度生成建模》讲座报告与视频，84页ppt，Deep Generative Modeling is a key to unlocking AI potential

Jakub Tomczak- 《深度生成建模》讲座报告与视频，84页ppt，Deep Generative Modeling is a key to unlocking AI potential

专知会员服务

61+阅读 · 2022年3月11日

最新《深度生成式模型进展》视频报告，43页ppt，斯坦福Aditya Grover

最新《深度生成式模型进展》视频报告，43页ppt，斯坦福Aditya Grover

专知会员服务

46+阅读 · 2020年8月9日

【CCF优秀博士学位论文奖-2019】面向多种学习任务的深度生成模型，清华大学李崇轩

【CCF优秀博士学位论文奖-2019】面向多种学习任务的深度生成模型，清华大学李崇轩

专知会员服务

49+阅读 · 2019年11月8日

热门VIP内容

开通专知VIP会员享更多权益服务

智能体记忆深度剖析：评价指标与系统局限性的分类体系及实证分析

《可信人工智能赋能系统的支柱》

【CMU博士论文】可靠轨迹预测的分层基石：数据、评估与方法

人工智能赋能边缘与自主系统：美陆军现代化进程聚焦威胁探测与战术边缘情报

相关资讯

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

专知

12+阅读 · 2022年10月31日

最新《深度生成式模型进展》视频报告，43页ppt，斯坦福Aditya Grover

最新《深度生成式模型进展》视频报告，43页ppt，斯坦福Aditya Grover

专知

13+阅读 · 2020年8月9日

清华大学《高级机器学习》课程

清华大学《高级机器学习》课程

专知

40+阅读 · 2020年7月21日

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

专知

14+阅读 · 2019年10月9日

【课程】斯坦福大学CS236：深度生成模型，附课程材料下载

【课程】斯坦福大学CS236：深度生成模型，附课程材料下载

专知

30+阅读 · 2019年9月25日

斯坦福CS236-深度生成模型2019-全套课程资料分享

斯坦福CS236-深度生成模型2019-全套课程资料分享

深度学习与NLP

20+阅读 · 2019年8月20日

【学科发展报告】计算机视觉

【学科发展报告】计算机视觉

中国自动化学会

43+阅读 · 2018年10月12日

展望：模型驱动的深度学习

展望：模型驱动的深度学习

人工智能学家

12+阅读 · 2018年1月23日

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

专知

12+阅读 · 2017年12月21日

MATLAB计算机视觉与深度学习实战

MATLAB计算机视觉与深度学习实战

炼数成金订阅号

21+阅读 · 2017年8月4日

相关论文

Dr. Kernel: Reinforcement Learning Done Right for Triton Kernel Generations

Arxiv

0+阅读 · 2月5日

Generative quantum machine learning via denoising diffusion probabilistic models

Arxiv

0+阅读 · 1月30日

HetCCL: Accelerating LLM Training with Heterogeneous GPUs

Arxiv

0+阅读 · 1月30日

SysMoBench: Evaluating AI on Formally Modeling Complex Real-World Systems

Arxiv

0+阅读 · 1月28日

Confidential Computing on Heterogeneous CPU-GPU Systems: Survey and Future Directions

Arxiv

0+阅读 · 1月26日

TetriServe: Efficient DiT Serving for Heterogeneous Image Generation

Arxiv

0+阅读 · 1月15日

HP2C-DT: High-Precision High-Performance Computer-enabled Digital Twin

Arxiv

0+阅读 · 1月15日

DiT-JSCC: Rethinking Deep JSCC with Diffusion Transformers and Semantic Representations

Arxiv

0+阅读 · 1月6日

BusterX++: Towards Unified Cross-Modal AI-Generated Content Detection and Explanation with MLLM

Arxiv

0+阅读 · 1月6日

EMLoC: Emulator-based Memory-efficient Fine-tuning with LoRA Correction

Arxiv

0+阅读 · 1月4日

相关基金

模拟人眼视觉特性的高性能矢量多边形叠加分析算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

集成电路中电热耦合建模理论及高效数值方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

众核集群上基于MPI的模型扩展及性能优化研究

国家自然科学基金

1+阅读 · 2015年12月31日

斜模式高光谱成像的超分辨率重建方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向高性能异构众核架构的大规模CFD并行算法与应用

国家自然科学基金

0+阅读 · 2015年12月31日

面向存储受限应用的GPU性能预测模型和通信优化关键技术研究

国家自然科学基金

2+阅读 · 2015年12月31日

面向大数据的高时效并行计算机系统结构与技术

国家自然科学基金

0+阅读 · 2014年12月31日

超分辨率中的矩阵值算子学习问题

国家自然科学基金

1+阅读 · 2014年12月31日

CPU和GPU混合体系结构上生物网络比对并行算法研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向类脑计算存储器的调制编码理论及方法研究

国家自然科学基金

1+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员