The xPU-athalon: Quantifying the Competition of AI Acceleration - 专知论文

会员服务 ·

0

分析 · AI · 量化分析 · GPU · AMD ·

The xPU-athalon: Quantifying the Competition of AI Acceleration

翻译：xPU-athalon：AI加速竞争量化分析

Alicia Golden,Carole-Jean Wu,Gu-Yeon Wei,David Brooks

from arxiv, Accepted to ISPASS 2026

The push for greater efficiency in AI computation has given rise to an array of accelerator architectures that increasingly challenge the GPU's long-standing dominance. In this work, we provide a quantitative view of this evolving landscape of AI accelerators, including the Cerebras CS-3, SambaNova SN-40, Groq, Gaudi, and TPUv5e platforms, and compare against both NVIDIA (A100, H100) and AMD (MI-300X) GPUs. We evaluate key trade-offs in latency, throughput, power consumption, and energy-efficiency across both (i) end-to-end workloads and (ii) benchmarks of individual computational primitives. Notably, we find the optimal hardware platform varies across batch size, sequence length, and model size, revealing a large underlying optimization space. Our analysis includes detailed power measurements across the prefill and decode phases of LLM inference, as well as quantification of the energy cost of communication. We additionally find that Cerebras, SambaNova, and Gaudi have 10-60% higher idle power than NVIDIA and AMD GPUs, emphasizing the importance of high utilization in order to realize promised efficiency gains. Finally, we assess programmability across platforms based on our experiments with real profiled workloads, comparing the compilation times and software stack maturity required to achieve promised performance.

翻译：人工智能计算追求更高效率的推动催生了大量加速器架构，这些架构日益挑战GPU长期以来的主导地位。本文对AI加速器的演化格局进行了量化分析，涵盖Cerebras CS-3、SambaNova SN-40、Groq、Gaudi和TPUv5e平台，并与NVIDIA（A100、H100）及AMD（MI-300X）GPU进行对比。我们评估了（i）端到端工作负载与（ii）单个计算原语基准测试中延迟、吞吐量、功耗和能效的关键权衡。值得注意的是，我们发现最优硬件平台随批处理大小、序列长度和模型规模而变化，揭示了巨大的底层优化空间。分析包含LLM推理预填充和解码阶段的详细功耗测量，以及通信能量成本的量化。此外，我们发现Cerebras、SambaNova和Gaudi的空闲功耗比NVIDIA和AMD GPU高10-60%，凸显了高利用率对于实现预期效率提升的重要性。最后，基于真实剖析工作负载的实验，我们评估了各平台的可编程性，比较了实现预期性能所需的编译时间和软件栈成熟度。

0

相关内容

《人工智能暗战：SaaS与边缘计算架构之争》

《人工智能暗战：SaaS与边缘计算架构之争》

专知会员服务

14+阅读 · 2025年7月23日

DeepSeek专题研究：“低成本、高性能、强推理”三位一体，DeepSeek驱动高质量模型平价化

DeepSeek专题研究：“低成本、高性能、强推理”三位一体，DeepSeek驱动高质量模型平价化

专知会员服务

80+阅读 · 2025年2月14日

生成式人工智能行业专题研究：海外大模型篇：生成式AI加速创新，行业迎历史性机遇

生成式人工智能行业专题研究：海外大模型篇：生成式AI加速创新，行业迎历史性机遇

专知会员服务

67+阅读 · 2024年3月29日

可解释AI《增加自主智能体透明度的用户直观解释》论文，雷神技术研究中心

可解释AI《增加自主智能体透明度的用户直观解释》论文，雷神技术研究中心

专知会员服务

48+阅读 · 2023年3月20日

【ChatGPT系列报告】AIGC行业深度报告：ChatGPT：加速计算服务器时代到来，36页ppt

【ChatGPT系列报告】AIGC行业深度报告：ChatGPT：加速计算服务器时代到来，36页ppt

专知会员服务

86+阅读 · 2023年3月10日

MIT发布《人工智能加速器》2022年度综述论文，详解80+类AI芯片性能优劣

MIT发布《人工智能加速器》2022年度综述论文，详解80+类AI芯片性能优劣

专知会员服务

78+阅读 · 2022年10月12日

希伯来大学最新《自然语言处理（NLP）领域的高效方法》综述论文，阐述资源受限如何提高模型效率

希伯来大学最新《自然语言处理（NLP）领域的高效方法》综述论文，阐述资源受限如何提高模型效率

专知会员服务

34+阅读 · 2022年9月17日

MIT发布《人工智能加速器》2021年度综述论文，详解80+类AI芯片性能优劣

专知会员服务

65+阅读 · 2021年9月21日

【BAAI 北京智源大会】类脑神经形态智能芯片，蔡一茂 / 北京大学教授，智源研究员

【BAAI 北京智源大会】类脑神经形态智能芯片，蔡一茂 / 北京大学教授，智源研究员

专知会员服务

17+阅读 · 2019年11月19日

【O'Reilly TensorFlow Conference 2019】HARP：高效的GPU共享系统（HARP: An efficient and elastic GPU-sharing system），Alibaba | Pengfei Fan，Lingling Jin

【O'Reilly TensorFlow Conference 2019】HARP：高效的GPU共享系统（HARP: An efficient and elastic GPU-sharing system），Alibaba | Pengfei Fan，Lingling Jin

专知会员服务

10+阅读 · 2019年11月13日

【干货书】《Transformers 机器学习:深度探究》，284页pdf

【干货书】《Transformers 机器学习:深度探究》，284页pdf

专知

72+阅读 · 2022年4月21日

【Science最新论文】XAI—可解释人工智能简述，机遇与挑战

【Science最新论文】XAI—可解释人工智能简述，机遇与挑战

专知

10+阅读 · 2019年12月21日

完备的 AI 学习路线，最详细的资源整理！

完备的 AI 学习路线，最详细的资源整理！

新智元

18+阅读 · 2019年5月4日

【边缘智能】边缘计算驱动的深度学习加速技术

【边缘智能】边缘计算驱动的深度学习加速技术

产业智能官

20+阅读 · 2019年2月8日

硬件加速神经网络综述

硬件加速神经网络综述

计算机研究与发展

26+阅读 · 2019年2月1日

最新基于FPGA的深度学习加速器综述论文（附下载）

最新基于FPGA的深度学习加速器综述论文（附下载）

专知

23+阅读 · 2019年1月17日

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

人工智能前沿讲习班

21+阅读 · 2018年12月21日

【强化学习】叶志豪：介绍强化学习及其在 NLP 上的应用｜分享总结

【强化学习】叶志豪：介绍强化学习及其在 NLP 上的应用｜分享总结

产业智能官

20+阅读 · 2018年7月24日

从0到1，这篇深度学习综述送给你！

从0到1，这篇深度学习综述送给你！

机器学习算法与Python学习

27+阅读 · 2018年6月13日

超全总结：神经网络加速之量化模型 | 附带代码

超全总结：神经网络加速之量化模型 | 附带代码

PaperWeekly

12+阅读 · 2018年6月1日

近似计算中基于概率图模型的软错误量化方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于GPU的几类分数阶微分方程的并行算法研究及其实现

国家自然科学基金

0+阅读 · 2015年12月31日

量子算法加速性差异研究及其应用

国家自然科学基金

0+阅读 · 2015年12月31日

面向安全关键系统的时间可预测多核代码生成方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

大功率柔顺驱动器的设计方法及能量优化和交互安全机理研究

国家自然科学基金

1+阅读 · 2015年12月31日

模糊认知集群优化的聚类算法

国家自然科学基金

9+阅读 · 2015年12月31日

面向存储受限应用的GPU性能预测模型和通信优化关键技术研究

国家自然科学基金

2+阅读 · 2015年12月31日

带有通信量化和延时的多智能体系统一致性研究

国家自然科学基金

0+阅读 · 2014年12月31日

CPU和GPU混合体系结构上生物网络比对并行算法研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向类脑计算存储器的调制编码理论及方法研究

国家自然科学基金

1+阅读 · 2014年12月31日

SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters

Arxiv

0+阅读 · 5月1日

Exploring Sparse Matrix Multiplication Kernels on the Cerebras CS-3

Arxiv

0+阅读 · 4月30日

PipeWeave: Synergizing Analytical and Learning Models for Unified GPU Performance Prediction

Arxiv

0+阅读 · 4月28日

Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment

Arxiv

0+阅读 · 4月27日

The Landscape of GPU-Centric Communication

Arxiv

0+阅读 · 4月23日

ENEC: A Lossless AI Model Compression Method Enabling Fast Inference on Ascend NPUs

Arxiv

0+阅读 · 4月7日

Democratizing AI: A Comparative Study in Deep Learning Efficiency and Future Trends in Computational Processing

Arxiv

0+阅读 · 4月2日

Democratizing AI: A Comparative Study in Deep Learning Efficiency and Future Trends in Computational Processing

Arxiv

0+阅读 · 3月21日

cuGenOpt: A GPU-Accelerated General-Purpose Metaheuristic Framework for Combinatorial Optimization

Arxiv

0+阅读 · 3月19日

HyperParallel: A Supernode-Affinity AI Framework

Arxiv

0+阅读 · 3月4日

VIP会员

文章信息

相关主题

最新内容

深入解读 Palantir AIP：全球最具争议的人工智能平台究竟如何运作

深入解读 Palantir AIP：全球最具争议的人工智能平台究竟如何运作

专知会员服务

3+阅读 · 今天14:49

ICML 2026 | 多任务贝叶斯上下文学习：让 Transformer 在测试时显式适应新先验

ICML 2026 | 多任务贝叶斯上下文学习：让 Transformer 在测试时显式适应新先验

专知会员服务

3+阅读 · 6月19日

ACL 2026综述 | 大规模手语数据集：资源、基准与标注标准

ACL 2026综述 | 大规模手语数据集：资源、基准与标注标准

专知会员服务

5+阅读 · 6月19日

ICML 2026 Spotlight | SmoothSMoE：解析稀疏 MoE 路由不连续

ICML 2026 Spotlight | SmoothSMoE：解析稀疏 MoE 路由不连续

专知会员服务

6+阅读 · 6月18日

综述 | 周期表视角下的大模型推理：范式、方法与失败模式

综述 | 周期表视角下的大模型推理：范式、方法与失败模式

专知会员服务

7+阅读 · 6月18日

《廉价自杀式无人机战争的军事战略影响：乌克兰和伊朗案例研究》

《廉价自杀式无人机战争的军事战略影响：乌克兰和伊朗案例研究》

专知会员服务

11+阅读 · 6月18日

《面向反无人机作战的联邦式可解释射频–光电/红外情报融合：边缘人工智能优化、电子战韧性及分布式监视验证》

《面向反无人机作战的联邦式可解释射频–光电/红外情报融合：边缘人工智能优化、电子战韧性及分布式监视验证》

专知会员服务

10+阅读 · 6月18日

ICML 2026 | FR3D：解耦自车运动的未来动态三维重建世界模型

ICML 2026 | FR3D：解耦自车运动的未来动态三维重建世界模型

专知会员服务

7+阅读 · 6月17日

【伯克利博士论文】迈向可扩展与自我演进的大语言模型智能体

【伯克利博士论文】迈向可扩展与自我演进的大语言模型智能体

专知会员服务

11+阅读 · 6月17日

学习数据的几何：形状空间分析数学综述

学习数据的几何：形状空间分析数学综述

专知会员服务

7+阅读 · 6月17日

《现代防空系统综述：架构、传感器、拦截器及新兴威胁环境对基础设施受限防御环境的影响》2026最新长综述

《现代防空系统综述：架构、传感器、拦截器及新兴威胁环境对基础设施受限防御环境的影响》2026最新长综述

专知会员服务

15+阅读 · 6月17日

定向能反无人机系统最新发展动态

定向能反无人机系统最新发展动态

专知会员服务

8+阅读 · 6月17日

从燃煤战舰到算法战争：水面指挥的永恒要求

从燃煤战舰到算法战争：水面指挥的永恒要求

专知会员服务

6+阅读 · 6月17日

《短程弹道再入飞行器拦截时间中的一项异常现象》

《短程弹道再入飞行器拦截时间中的一项异常现象》

专知会员服务

8+阅读 · 6月17日

《基于回归方法与任务上下文的对抗环境动态战术网络报文优先级排序》

《基于回归方法与任务上下文的对抗环境动态战术网络报文优先级排序》

专知会员服务

8+阅读 · 6月17日

相关VIP内容

《人工智能暗战：SaaS与边缘计算架构之争》

《人工智能暗战：SaaS与边缘计算架构之争》

专知会员服务

14+阅读 · 2025年7月23日

DeepSeek专题研究：“低成本、高性能、强推理”三位一体，DeepSeek驱动高质量模型平价化

DeepSeek专题研究：“低成本、高性能、强推理”三位一体，DeepSeek驱动高质量模型平价化

专知会员服务

80+阅读 · 2025年2月14日

生成式人工智能行业专题研究：海外大模型篇：生成式AI加速创新，行业迎历史性机遇

生成式人工智能行业专题研究：海外大模型篇：生成式AI加速创新，行业迎历史性机遇

专知会员服务

67+阅读 · 2024年3月29日

可解释AI《增加自主智能体透明度的用户直观解释》论文，雷神技术研究中心

可解释AI《增加自主智能体透明度的用户直观解释》论文，雷神技术研究中心

专知会员服务

48+阅读 · 2023年3月20日

【ChatGPT系列报告】AIGC行业深度报告：ChatGPT：加速计算服务器时代到来，36页ppt

【ChatGPT系列报告】AIGC行业深度报告：ChatGPT：加速计算服务器时代到来，36页ppt

专知会员服务

86+阅读 · 2023年3月10日

MIT发布《人工智能加速器》2022年度综述论文，详解80+类AI芯片性能优劣

MIT发布《人工智能加速器》2022年度综述论文，详解80+类AI芯片性能优劣

专知会员服务

78+阅读 · 2022年10月12日

希伯来大学最新《自然语言处理（NLP）领域的高效方法》综述论文，阐述资源受限如何提高模型效率

希伯来大学最新《自然语言处理（NLP）领域的高效方法》综述论文，阐述资源受限如何提高模型效率

专知会员服务

34+阅读 · 2022年9月17日

MIT发布《人工智能加速器》2021年度综述论文，详解80+类AI芯片性能优劣

专知会员服务

65+阅读 · 2021年9月21日

【BAAI 北京智源大会】类脑神经形态智能芯片，蔡一茂 / 北京大学教授，智源研究员

【BAAI 北京智源大会】类脑神经形态智能芯片，蔡一茂 / 北京大学教授，智源研究员

专知会员服务

17+阅读 · 2019年11月19日

【O'Reilly TensorFlow Conference 2019】HARP：高效的GPU共享系统（HARP: An efficient and elastic GPU-sharing system），Alibaba | Pengfei Fan，Lingling Jin

【O'Reilly TensorFlow Conference 2019】HARP：高效的GPU共享系统（HARP: An efficient and elastic GPU-sharing system），Alibaba | Pengfei Fan，Lingling Jin

专知会员服务

10+阅读 · 2019年11月13日

热门VIP内容

开通专知VIP会员享更多权益服务

深入解读 Palantir AIP：全球最具争议的人工智能平台究竟如何运作

ICML 2026 | 多任务贝叶斯上下文学习：让 Transformer 在测试时显式适应新先验

ACL 2026综述 | 大规模手语数据集：资源、基准与标注标准

相关资讯

【干货书】《Transformers 机器学习:深度探究》，284页pdf

【干货书】《Transformers 机器学习:深度探究》，284页pdf

专知

72+阅读 · 2022年4月21日

【Science最新论文】XAI—可解释人工智能简述，机遇与挑战

【Science最新论文】XAI—可解释人工智能简述，机遇与挑战

专知

10+阅读 · 2019年12月21日

完备的 AI 学习路线，最详细的资源整理！

完备的 AI 学习路线，最详细的资源整理！

新智元

18+阅读 · 2019年5月4日

【边缘智能】边缘计算驱动的深度学习加速技术

【边缘智能】边缘计算驱动的深度学习加速技术

产业智能官

20+阅读 · 2019年2月8日

硬件加速神经网络综述

硬件加速神经网络综述

计算机研究与发展

26+阅读 · 2019年2月1日

最新基于FPGA的深度学习加速器综述论文（附下载）

最新基于FPGA的深度学习加速器综述论文（附下载）

专知

23+阅读 · 2019年1月17日

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

人工智能前沿讲习班

21+阅读 · 2018年12月21日

【强化学习】叶志豪：介绍强化学习及其在 NLP 上的应用｜分享总结

【强化学习】叶志豪：介绍强化学习及其在 NLP 上的应用｜分享总结

产业智能官

20+阅读 · 2018年7月24日

从0到1，这篇深度学习综述送给你！

从0到1，这篇深度学习综述送给你！

机器学习算法与Python学习

27+阅读 · 2018年6月13日

超全总结：神经网络加速之量化模型 | 附带代码

超全总结：神经网络加速之量化模型 | 附带代码

PaperWeekly

12+阅读 · 2018年6月1日

相关论文

SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters

Arxiv

0+阅读 · 5月1日

Exploring Sparse Matrix Multiplication Kernels on the Cerebras CS-3

Arxiv

0+阅读 · 4月30日

PipeWeave: Synergizing Analytical and Learning Models for Unified GPU Performance Prediction

Arxiv

0+阅读 · 4月28日

Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment

Arxiv

0+阅读 · 4月27日

The Landscape of GPU-Centric Communication

Arxiv

0+阅读 · 4月23日

ENEC: A Lossless AI Model Compression Method Enabling Fast Inference on Ascend NPUs

Arxiv

0+阅读 · 4月7日

Democratizing AI: A Comparative Study in Deep Learning Efficiency and Future Trends in Computational Processing

Arxiv

0+阅读 · 4月2日

Democratizing AI: A Comparative Study in Deep Learning Efficiency and Future Trends in Computational Processing

Arxiv

0+阅读 · 3月21日

cuGenOpt: A GPU-Accelerated General-Purpose Metaheuristic Framework for Combinatorial Optimization

Arxiv

0+阅读 · 3月19日

HyperParallel: A Supernode-Affinity AI Framework

Arxiv

0+阅读 · 3月4日

相关基金

近似计算中基于概率图模型的软错误量化方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于GPU的几类分数阶微分方程的并行算法研究及其实现

国家自然科学基金

0+阅读 · 2015年12月31日

量子算法加速性差异研究及其应用

国家自然科学基金

0+阅读 · 2015年12月31日

面向安全关键系统的时间可预测多核代码生成方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

大功率柔顺驱动器的设计方法及能量优化和交互安全机理研究

国家自然科学基金

1+阅读 · 2015年12月31日

模糊认知集群优化的聚类算法

国家自然科学基金

9+阅读 · 2015年12月31日

面向存储受限应用的GPU性能预测模型和通信优化关键技术研究

国家自然科学基金

2+阅读 · 2015年12月31日

带有通信量化和延时的多智能体系统一致性研究

国家自然科学基金

0+阅读 · 2014年12月31日

CPU和GPU混合体系结构上生物网络比对并行算法研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向类脑计算存储器的调制编码理论及方法研究

国家自然科学基金

1+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员