Heterogeneous Computing: The Key to Powering the Future of AI Agent Inference - 专知论文

会员服务 ·

0

内存 · AI · 异构 · CF · 智能体推理 ·

Heterogeneous Computing: The Key to Powering the Future of AI Agent Inference

翻译：异构计算：驱动未来AI智能体推理的关键

Yiren Zhao,Junyi Liu

AI agent inference is driving an inference heavy datacenter future and exposes bottlenecks beyond compute - especially memory capacity, memory bandwidth and high-speed interconnect. We introduce two metrics - Operational Intensity (OI) and Capacity Footprint (CF) - that jointly explain regimes the classic roofline analysis misses, including the memory capacity wall. Across agentic workflows (chat, coding, web use, computer use) and base model choices (GQA/MLA, MoE, quantization), OI/CF can shift dramatically, with long context KV cache making decode highly memory bound. These observations motivate disaggregated serving and system level heterogeneity: specialized prefill and decode accelerators, broader scale up networking, and decoupled compute-memory enabled by optical I/O. We further hypothesize agent-hardware co design, multiple inference accelerators within one system, and high bandwidth, large capacity memory disaggregation as foundations for adaptation to evolving OI/CF. Together, these directions chart a path to sustain efficiency and capability for large scale agentic AI inference.

翻译：AI智能体推理正在推动数据中心向推理密集型未来演进，并暴露出超越计算能力之外的瓶颈——尤其是内存容量、内存带宽与高速互连。我们引入两个度量指标——操作强度（OI）与容量足迹（CF）——二者共同解释了经典屋顶线分析所遗漏的运行状态，包括内存容量墙问题。在不同智能体工作流（对话、编程、网页使用、计算机操作）与基础模型选择（GQA/MLA、MoE、量化）中，OI/CF可能发生剧烈变化，其中长上下文KV缓存会使得解码过程高度受限于内存。这些观察催生了分解式服务与系统级异构化需求：专用预填充与解码加速器、更广泛的纵向扩展网络，以及通过光I/O实现的解耦计算-内存架构。我们进一步提出智能体-硬件协同设计、单系统内多推理加速器集成，以及高带宽大容量内存解耦等设想，将其作为适应动态OI/CF演进的基础。这些方向共同为大规模智能体AI推理的持续效能与能力提升指明了发展路径。

0

相关内容

智能体 AI (Agentic AI) 的新进展：回归初心，预见未来

智能体 AI (Agentic AI) 的新进展：回归初心，预见未来

专知会员服务

29+阅读 · 1月2日

智能体工程（Agent Engineering）

智能体工程（Agent Engineering）

专知会员服务

35+阅读 · 2025年12月31日

最新新Agent综述！76页327篇论文梳理，北交大桑基韬教授团队发布《迈向模型原生智能体式人工智能的范式转变综述》

最新新Agent综述！76页327篇论文梳理，北交大桑基韬教授团队发布《迈向模型原生智能体式人工智能的范式转变综述》

专知会员服务

40+阅读 · 2025年10月17日

AI行业专题报告：国产Agent不断演进，通用协议推进系统性应用

AI行业专题报告：国产Agent不断演进，通用协议推进系统性应用

专知会员服务

19+阅读 · 2025年6月9日

AI专题·Agent：智能体基建厚积薄发，商业化应用曙光乍现

AI专题·Agent：智能体基建厚积薄发，商业化应用曙光乍现

专知会员服务

34+阅读 · 2025年4月24日

DeepSeek推出后，移动端AI风向要变《AI变革正在推动终端侧推理创新》技术报告

DeepSeek推出后，移动端AI风向要变《AI变革正在推动终端侧推理创新》技术报告

专知会员服务

23+阅读 · 2025年3月3日

如何提升大模型通用推理能力？DeepSeek最新论文《CODEI/O：通过代码输入输出预测凝练推理模式》

如何提升大模型通用推理能力？DeepSeek最新论文《CODEI/O：通过代码输入输出预测凝练推理模式》

专知会员服务

42+阅读 · 2025年2月16日

DeepSeek专题研究：“低成本、高性能、强推理”三位一体，DeepSeek驱动高质量模型平价化

DeepSeek专题研究：“低成本、高性能、强推理”三位一体，DeepSeek驱动高质量模型平价化

专知会员服务

80+阅读 · 2025年2月14日

paper速读：人工智能中的量子数学，Quantum Mathematics in Artificial Intelligence

paper速读：人工智能中的量子数学，Quantum Mathematics in Artificial Intelligence

专知会员服务

36+阅读 · 2022年3月18日

【清华大学】《人工智能之学术搜索》报告重磅发布：呈现知识和算法双引擎驱动的未来发展趋势 | 附报告PDF下载

【清华大学】《人工智能之学术搜索》报告重磅发布：呈现知识和算法双引擎驱动的未来发展趋势 | 附报告PDF下载

专知会员服务

71+阅读 · 2020年5月22日

【ChatGPT系列报告】ChatGPT：存算一体，算力的下一极，47页ppt

【ChatGPT系列报告】ChatGPT：存算一体，算力的下一极，47页ppt

专知

14+阅读 · 2023年4月6日

推荐！《关于美国海军陆战队情报工作的人工智能（AI）战略和设计》美国海军研究生院131页报告

推荐！《关于美国海军陆战队情报工作的人工智能（AI）战略和设计》美国海军研究生院131页报告

专知

62+阅读 · 2022年9月7日

通过集成 XNNPACK 实现推理速度飞跃

通过集成 XNNPACK 实现推理速度飞跃

TensorFlow

26+阅读 · 2020年7月30日

浅谈群体智能——新一代AI的重要方向

浅谈群体智能——新一代AI的重要方向

中国科学院自动化研究所

44+阅读 · 2019年10月16日

AIoT重磅报告：四大关键助力，AI+IoT重新定义未来的可能性【附下载】

AIoT重磅报告：四大关键助力，AI+IoT重新定义未来的可能性【附下载】

物联网智库

13+阅读 · 2019年5月8日

让智能体主动交互，DeepMind提出用元强化学习实现因果推理

让智能体主动交互，DeepMind提出用元强化学习实现因果推理

机器之心

17+阅读 · 2019年2月11日

【边缘智能】边缘计算驱动的深度学习加速技术

【边缘智能】边缘计算驱动的深度学习加速技术

产业智能官

20+阅读 · 2019年2月8日

类脑计算的前沿论文，看我们推荐的这7篇

类脑计算的前沿论文，看我们推荐的这7篇

人工智能前沿讲习班

21+阅读 · 2019年1月7日

图深度学习(GraphDL)，下一个人工智能算法热点？一文了解最新GDL相关文章

图深度学习(GraphDL)，下一个人工智能算法热点？一文了解最新GDL相关文章

专知

18+阅读 · 2018年6月10日

群体智能：新一代人工智能的重要方向

群体智能：新一代人工智能的重要方向

走向智能论坛

12+阅读 · 2017年8月16日

基于学习的智能化漏洞挖掘关键技术研究

国家自然科学基金

6+阅读 · 2017年12月31日

逻辑等价算子在不确定性推理中的应用

国家自然科学基金

1+阅读 · 2015年12月31日

面向安全关键系统的时间可预测多核代码生成方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向物联网搜索的群智感知关键技术研究

国家自然科学基金

3+阅读 · 2015年12月31日

面向大数据的知识表示、推理、在线学习理论及应用研究

国家自然科学基金

12+阅读 · 2014年12月31日

线性时序关系下推理的概率计量化模型

国家自然科学基金

0+阅读 · 2014年12月31日

CPU和GPU混合体系结构上生物网络比对并行算法研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向大数据计算的高吞吐量众核处理器关键技术研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于人眼关注度与情感分析的电子商务智能推荐计算

国家自然科学基金

0+阅读 · 2014年12月31日

面向大数据的粒计算理论与方法

国家自然科学基金

4+阅读 · 2014年12月31日

Accelerating Mobile Inference through Fine-Grained CPU-GPU Co-Execution

Arxiv

0+阅读 · 2月18日

Towards a Science of AI Agent Reliability

Arxiv

0+阅读 · 2月18日

Prompt-Driven Low-Altitude Edge Intelligence: Modular Agents and Generative Reasoning

Arxiv

0+阅读 · 2月15日

AgentCrypt: Advancing Privacy and (Secure) Computation in AI Agent Collaboration

Arxiv

1+阅读 · 2月11日

AgentSkiller: Scaling Generalist Agent Intelligence through Semantically Integrated Cross-Domain Data Synthesis

Arxiv

1+阅读 · 2月10日

Agentic AI Reasoning for Mobile Edge General Intelligence: Fundamentals, Approaches, and Directions

Arxiv

0+阅读 · 2月9日

Multi-Agentic AI for Fairness-Aware and Accelerated Multi-modal Large Model Inference in Real-world Mobile Edge Networks

Arxiv

0+阅读 · 2月6日

Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesis

Arxiv

0+阅读 · 2月3日

Confidential Computing on Heterogeneous CPU-GPU Systems: Survey and Future Directions

Arxiv

0+阅读 · 1月26日

Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core Concepts

Arxiv

0+阅读 · 1月23日

VIP会员

文章信息

相关主题

智能体推理

最新内容

BES：让语言模型通过双向进化搜索自我改进

BES：让语言模型通过双向进化搜索自我改进

专知会员服务

3+阅读 · 5月30日

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

专知会员服务

3+阅读 · 5月30日

以色列-美国-伊朗战争中的无人机：关键要点

以色列-美国-伊朗战争中的无人机：关键要点

专知会员服务

4+阅读 · 5月30日

美以伊战争：首次人工智能战争——军事自主性困境

美以伊战争：首次人工智能战争——军事自主性困境

专知会员服务

4+阅读 · 5月30日

《Palantir任务保障性软件安全标准（MA-S2）》

《Palantir任务保障性软件安全标准（MA-S2）》

专知会员服务

10+阅读 · 5月30日

《美海军利用扩展现实增强知识流动研究》300页报告

《美海军利用扩展现实增强知识流动研究》300页报告

专知会员服务

6+阅读 · 5月30日

基于声学的无人机检测技术综述

基于声学的无人机检测技术综述

专知会员服务

7+阅读 · 5月30日

《当代混合战争分析框架：俄乌战争经验教训》

《当代混合战争分析框架：俄乌战争经验教训》

专知会员服务

8+阅读 · 5月30日

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

专知会员服务

11+阅读 · 5月29日

AutoScientists：自组织智能体团队驱动长期科学实验

AutoScientists：自组织智能体团队驱动长期科学实验

专知会员服务

6+阅读 · 5月29日

《阿利·伯克级驱逐舰的战损修理：桌面推演结果》报告

《阿利·伯克级驱逐舰的战损修理：桌面推演结果》报告

专知会员服务

6+阅读 · 5月29日

战略前沿人工智能的再思考（中文）

战略前沿人工智能的再思考（中文）

专知会员服务

8+阅读 · 5月29日

《量化地基防空系统间接效应的博弈论方法》

《量化地基防空系统间接效应的博弈论方法》

专知会员服务

6+阅读 · 5月29日

传感器网络：美国如何探测来自伊朗的导弹与无人机

传感器网络：美国如何探测来自伊朗的导弹与无人机

专知会员服务

6+阅读 · 5月29日

《无人机战争中的经济不对称：伊朗“沙赫德-136”对抗以色列“铁穹”防御系统的案例研究》

《无人机战争中的经济不对称：伊朗“沙赫德-136”对抗以色列“铁穹”防御系统的案例研究》

专知会员服务

9+阅读 · 5月29日

相关VIP内容

智能体 AI (Agentic AI) 的新进展：回归初心，预见未来

智能体 AI (Agentic AI) 的新进展：回归初心，预见未来

专知会员服务

29+阅读 · 1月2日

智能体工程（Agent Engineering）

智能体工程（Agent Engineering）

专知会员服务

35+阅读 · 2025年12月31日

最新新Agent综述！76页327篇论文梳理，北交大桑基韬教授团队发布《迈向模型原生智能体式人工智能的范式转变综述》

最新新Agent综述！76页327篇论文梳理，北交大桑基韬教授团队发布《迈向模型原生智能体式人工智能的范式转变综述》

专知会员服务

40+阅读 · 2025年10月17日

AI行业专题报告：国产Agent不断演进，通用协议推进系统性应用

AI行业专题报告：国产Agent不断演进，通用协议推进系统性应用

专知会员服务

19+阅读 · 2025年6月9日

AI专题·Agent：智能体基建厚积薄发，商业化应用曙光乍现

AI专题·Agent：智能体基建厚积薄发，商业化应用曙光乍现

专知会员服务

34+阅读 · 2025年4月24日

DeepSeek推出后，移动端AI风向要变《AI变革正在推动终端侧推理创新》技术报告

DeepSeek推出后，移动端AI风向要变《AI变革正在推动终端侧推理创新》技术报告

专知会员服务

23+阅读 · 2025年3月3日

如何提升大模型通用推理能力？DeepSeek最新论文《CODEI/O：通过代码输入输出预测凝练推理模式》

如何提升大模型通用推理能力？DeepSeek最新论文《CODEI/O：通过代码输入输出预测凝练推理模式》

专知会员服务

42+阅读 · 2025年2月16日

DeepSeek专题研究：“低成本、高性能、强推理”三位一体，DeepSeek驱动高质量模型平价化

DeepSeek专题研究：“低成本、高性能、强推理”三位一体，DeepSeek驱动高质量模型平价化

专知会员服务

80+阅读 · 2025年2月14日

paper速读：人工智能中的量子数学，Quantum Mathematics in Artificial Intelligence

paper速读：人工智能中的量子数学，Quantum Mathematics in Artificial Intelligence

专知会员服务

36+阅读 · 2022年3月18日

【清华大学】《人工智能之学术搜索》报告重磅发布：呈现知识和算法双引擎驱动的未来发展趋势 | 附报告PDF下载

【清华大学】《人工智能之学术搜索》报告重磅发布：呈现知识和算法双引擎驱动的未来发展趋势 | 附报告PDF下载

专知会员服务

71+阅读 · 2020年5月22日

热门VIP内容

开通专知VIP会员享更多权益服务

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

美以伊战争：首次人工智能战争——军事自主性困境

BES：让语言模型通过双向进化搜索自我改进

以色列-美国-伊朗战争中的无人机：关键要点

相关资讯

【ChatGPT系列报告】ChatGPT：存算一体，算力的下一极，47页ppt

【ChatGPT系列报告】ChatGPT：存算一体，算力的下一极，47页ppt

专知

14+阅读 · 2023年4月6日

推荐！《关于美国海军陆战队情报工作的人工智能（AI）战略和设计》美国海军研究生院131页报告

推荐！《关于美国海军陆战队情报工作的人工智能（AI）战略和设计》美国海军研究生院131页报告

专知

62+阅读 · 2022年9月7日

通过集成 XNNPACK 实现推理速度飞跃

通过集成 XNNPACK 实现推理速度飞跃

TensorFlow

26+阅读 · 2020年7月30日

浅谈群体智能——新一代AI的重要方向

浅谈群体智能——新一代AI的重要方向

中国科学院自动化研究所

44+阅读 · 2019年10月16日

AIoT重磅报告：四大关键助力，AI+IoT重新定义未来的可能性【附下载】

AIoT重磅报告：四大关键助力，AI+IoT重新定义未来的可能性【附下载】

物联网智库

13+阅读 · 2019年5月8日

让智能体主动交互，DeepMind提出用元强化学习实现因果推理

让智能体主动交互，DeepMind提出用元强化学习实现因果推理

机器之心

17+阅读 · 2019年2月11日

【边缘智能】边缘计算驱动的深度学习加速技术

【边缘智能】边缘计算驱动的深度学习加速技术

产业智能官

20+阅读 · 2019年2月8日

类脑计算的前沿论文，看我们推荐的这7篇

类脑计算的前沿论文，看我们推荐的这7篇

人工智能前沿讲习班

21+阅读 · 2019年1月7日

图深度学习(GraphDL)，下一个人工智能算法热点？一文了解最新GDL相关文章

图深度学习(GraphDL)，下一个人工智能算法热点？一文了解最新GDL相关文章

专知

18+阅读 · 2018年6月10日

群体智能：新一代人工智能的重要方向

群体智能：新一代人工智能的重要方向

走向智能论坛

12+阅读 · 2017年8月16日

相关论文

Accelerating Mobile Inference through Fine-Grained CPU-GPU Co-Execution

Arxiv

0+阅读 · 2月18日

Towards a Science of AI Agent Reliability

Arxiv

0+阅读 · 2月18日

Prompt-Driven Low-Altitude Edge Intelligence: Modular Agents and Generative Reasoning

Arxiv

0+阅读 · 2月15日

AgentCrypt: Advancing Privacy and (Secure) Computation in AI Agent Collaboration

Arxiv

1+阅读 · 2月11日

AgentSkiller: Scaling Generalist Agent Intelligence through Semantically Integrated Cross-Domain Data Synthesis

Arxiv

1+阅读 · 2月10日

Agentic AI Reasoning for Mobile Edge General Intelligence: Fundamentals, Approaches, and Directions

Arxiv

0+阅读 · 2月9日

Multi-Agentic AI for Fairness-Aware and Accelerated Multi-modal Large Model Inference in Real-world Mobile Edge Networks

Arxiv

0+阅读 · 2月6日

Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesis

Arxiv

0+阅读 · 2月3日

Confidential Computing on Heterogeneous CPU-GPU Systems: Survey and Future Directions

Arxiv

0+阅读 · 1月26日

Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core Concepts

Arxiv

0+阅读 · 1月23日

相关基金

基于学习的智能化漏洞挖掘关键技术研究

国家自然科学基金

6+阅读 · 2017年12月31日

逻辑等价算子在不确定性推理中的应用

国家自然科学基金

1+阅读 · 2015年12月31日

面向安全关键系统的时间可预测多核代码生成方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向物联网搜索的群智感知关键技术研究

国家自然科学基金

3+阅读 · 2015年12月31日

面向大数据的知识表示、推理、在线学习理论及应用研究

国家自然科学基金

12+阅读 · 2014年12月31日

线性时序关系下推理的概率计量化模型

国家自然科学基金

0+阅读 · 2014年12月31日

CPU和GPU混合体系结构上生物网络比对并行算法研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向大数据计算的高吞吐量众核处理器关键技术研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于人眼关注度与情感分析的电子商务智能推荐计算

国家自然科学基金

0+阅读 · 2014年12月31日

面向大数据的粒计算理论与方法

国家自然科学基金

4+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员