MING：一种自动化的CNN到边缘MLIR高层次综合框架 (MING: An Automated CNN-to-Edge MLIR HLS framework) - 专知论文

会员服务 ·

0

边缘 · 设计 · CNN · 高层次综合 · 约束 ·

MING: An Automated CNN-to-Edge MLIR HLS framework

翻译：MING：一种自动化的CNN到边缘MLIR高层次综合框架

Jiahong Bi,Lars Schütze,Jeronimo Castrillon

Driven by the increasing demand for low-latency and real-time processing, machine learning applications are steadily migrating toward edge computing platforms, where Field-Programmable Gate Arrays (FPGAs) are widely adopted for their energy efficiency compared to CPUs and GPUs. To generate high-performance and low-power FPGA designs, several frameworks built upon High Level Synthesis (HLS) vendor tools have been proposed, among which MLIR-based frameworks are gaining significant traction due to their extensibility and ease of use. However, existing state-of-the-art frameworks often overlook the stringent resource constraints of edge devices. To address this limitation, we propose MING, an Multi-Level Intermediate Representation (MLIR)-based framework that abstracts and automates the HLS design process. Within this framework, we adopt a streaming architecture with carefully managed buffers, specifically designed to handle resource constraints while ensuring low-latency. In comparison with recent frameworks, our approach achieves on average 15x speedup for standard Convolutional Neural Network (CNN) kernels with up to four layers, and up to 200x for single-layer kernels. For kernels with larger input sizes, MING is capable of generating efficient designs that respect hardware resource constraints, whereas state-of-the-art frameworks struggle to meet.

翻译：随着对低延迟和实时处理需求的日益增长，机器学习应用正稳步向边缘计算平台迁移。在现场可编程门阵列（FPGA）因其相较于CPU和GPU的能效优势而被广泛采用的背景下，为生成高性能、低功耗的FPGA设计，已有多个基于高层次综合（HLS）厂商工具构建的框架被提出，其中基于MLIR的框架因其可扩展性和易用性正获得显著关注。然而，现有的先进框架往往忽视了边缘设备严格的资源限制。为应对这一局限，我们提出了MING，一个基于多级中间表示（MLIR）的框架，该框架对HLS设计过程进行了抽象化和自动化。在此框架内，我们采用了一种具有精心管理缓冲区的流式架构，专门设计用于在确保低延迟的同时处理资源约束。与近期框架相比，我们的方法在多达四层的标准卷积神经网络（CNN）内核上平均实现了15倍的加速，在单层内核上最高可实现200倍的加速。对于具有较大输入尺寸的内核，MING能够生成尊重硬件资源约束的高效设计，而现有先进框架则难以满足这些约束。

0

相关内容

《面向边缘AI应用的高性能高能效架构探索》156页

《面向边缘AI应用的高性能高能效架构探索》156页

专知会员服务

34+阅读 · 2025年4月12日

《为高度不确定环境中的边缘系统定义参考架构》

《为高度不确定环境中的边缘系统定义参考架构》

专知会员服务

30+阅读 · 2024年7月11日

可解释AI《增加自主智能体透明度的用户直观解释》论文，雷神技术研究中心

可解释AI《增加自主智能体透明度的用户直观解释》论文，雷神技术研究中心

专知会员服务

47+阅读 · 2023年3月20日

基于机器学习的FPGA电子设计自动化技术研究综述

基于机器学习的FPGA电子设计自动化技术研究综述

专知会员服务

21+阅读 · 2022年11月22日

《“边缘计算+”技术白皮书》算网融合产业及标准推进委员会

《“边缘计算+”技术白皮书》算网融合产业及标准推进委员会

专知会员服务

83+阅读 · 2022年8月26日

南洋理工北大等首篇《GPU数据中心中深度学习工作负载调度》综述论文，35页pdf全面阐述DL训练与推理GPU调度技术进展

南洋理工北大等首篇《GPU数据中心中深度学习工作负载调度》综述论文，35页pdf全面阐述DL训练与推理GPU调度技术进展

专知会员服务

45+阅读 · 2022年5月27日

上海科技大学石远明等《联邦机器学习在6G中的机会与挑战》，附133页PPT

上海科技大学石远明等《联邦机器学习在6G中的机会与挑战》，附133页PPT

专知会员服务

28+阅读 · 2022年3月28日

深度神经网络 FPGA 设计进展、实现与展望

深度神经网络 FPGA 设计进展、实现与展望

专知会员服务

59+阅读 · 2022年3月26日

深度神经网络FPGA设计进展、实现与展望

深度神经网络FPGA设计进展、实现与展望

专知会员服务

36+阅读 · 2022年3月21日

【阿里巴巴达摩院】TResNet: 高性能的GPU专用架构，GPU-Dedicated Architecture

【阿里巴巴达摩院】TResNet: 高性能的GPU专用架构，GPU-Dedicated Architecture

专知会员服务

33+阅读 · 2020年4月1日

《“边缘计算+”技术白皮书》，82页pdf

《“边缘计算+”技术白皮书》，82页pdf

专知

11+阅读 · 2022年8月28日

清华大学《高级机器学习》课程

清华大学《高级机器学习》课程

专知

40+阅读 · 2020年7月21日

【研究报告】《边缘计算参考架构3.0》、《边云协同白皮书》发布！（附下载）

【研究报告】《边缘计算参考架构3.0》、《边云协同白皮书》发布！（附下载）

产业智能官

26+阅读 · 2019年10月12日

【综述】IBM 自动机器学习网络架构搜索最新综述，附45页全文下载

【综述】IBM 自动机器学习网络架构搜索最新综述，附45页全文下载

专知

20+阅读 · 2019年5月8日

【边缘计算】支撑边缘智能计算的软件体系：语言、工具与信息框架

【边缘计算】支撑边缘智能计算的软件体系：语言、工具与信息框架

产业智能官

16+阅读 · 2019年4月22日

深度学习时代的图模型，清华发文综述图网络

深度学习时代的图模型，清华发文综述图网络

GAN生成式对抗网络

13+阅读 · 2018年12月23日

每日论文 | 图形深度神经网络并行框架NGra；用人类注意力进行序列分类；针对多智能体协作的图卷积强化学习

每日论文 | 图形深度神经网络并行框架NGra；用人类注意力进行序列分类；针对多智能体协作的图卷积强化学习

论智

26+阅读 · 2018年10月30日

图深度学习(GraphDL)，下一个人工智能算法热点？一文了解最新GDL相关文章

图深度学习(GraphDL)，下一个人工智能算法热点？一文了解最新GDL相关文章

专知

18+阅读 · 2018年6月10日

讲透RCNN, Fast-RCNN, Faster-RCNN，将CNN用于目标检测

讲透RCNN, Fast-RCNN, Faster-RCNN，将CNN用于目标检测

数据挖掘入门与实战

18+阅读 · 2018年4月20日

NLP中自动生产文摘（auto text summarization）

NLP中自动生产文摘（auto text summarization）

机器学习研究会

14+阅读 · 2017年10月10日

基于加速网的光电混合三维互连架构设计方法研究

国家自然科学基金

0+阅读 · 2017年12月31日

基于动态网络结构的膜计算系统及其算法研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于智慧的下一代网络资源优化机制研究

国家自然科学基金

2+阅读 · 2015年12月31日

面向大规模动态异构网络的支持多用户并发任务的物联网应用构建方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

具有大线性复杂度的最优部分汉明相关跳频序列集的构造研究

国家自然科学基金

0+阅读 · 2015年12月31日

神经形态多核处理器的架构模型研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于动态匹配的高能量利用率多层堆叠结构静态随机存储器（SRAM）关键技术

国家自然科学基金

0+阅读 · 2015年12月31日

面向可重构多核处理器系统的分层次自适应优化机制研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向大数据的高时效并行计算机系统结构与技术

国家自然科学基金

0+阅读 · 2014年12月31日

CPU和GPU混合体系结构上生物网络比对并行算法研究

国家自然科学基金

0+阅读 · 2014年12月31日

DPUConfig: Optimizing ML Inference in FPGAs Using Reinforcement Learning

Arxiv

0+阅读 · 2月13日

LQA: A Lightweight Quantized-Adaptive Framework for Vision-Language Models on the Edge

Arxiv

0+阅读 · 2月8日

RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models

Arxiv

0+阅读 · 2月7日

BitLogic: Training Framework for Gradient-Based FPGA-Native Neural Networks

Arxiv

0+阅读 · 2月7日

LAAFD: LLM-based Agents for Accelerated FPGA Design

Arxiv

0+阅读 · 2月4日

CGRA4ML: A Hardware/Software Framework to Implement Neural Networks for Scientific Edge Computing

Arxiv

0+阅读 · 2月4日

Hexcute: A Compiler Framework for Automating Layout Synthesis in GPU Programs

Arxiv

0+阅读 · 1月28日

Agentic Fog: A Policy-driven Framework for Distributed Intelligence in Fog Computing

Arxiv

0+阅读 · 1月28日

A Reconfigurable Framework for AI-FPGA Agent Integration and Acceleration

Arxiv

0+阅读 · 1月27日

MLIR-Forge: A Modular Framework for Language Smiths

Arxiv

0+阅读 · 1月14日

VIP会员

文章信息

相关主题

高层次综合

相关VIP内容

《面向边缘AI应用的高性能高能效架构探索》156页

《面向边缘AI应用的高性能高能效架构探索》156页

专知会员服务

34+阅读 · 2025年4月12日

《为高度不确定环境中的边缘系统定义参考架构》

《为高度不确定环境中的边缘系统定义参考架构》

专知会员服务

30+阅读 · 2024年7月11日

可解释AI《增加自主智能体透明度的用户直观解释》论文，雷神技术研究中心

可解释AI《增加自主智能体透明度的用户直观解释》论文，雷神技术研究中心

专知会员服务

47+阅读 · 2023年3月20日

基于机器学习的FPGA电子设计自动化技术研究综述

基于机器学习的FPGA电子设计自动化技术研究综述

专知会员服务

21+阅读 · 2022年11月22日

《“边缘计算+”技术白皮书》算网融合产业及标准推进委员会

《“边缘计算+”技术白皮书》算网融合产业及标准推进委员会

专知会员服务

83+阅读 · 2022年8月26日

南洋理工北大等首篇《GPU数据中心中深度学习工作负载调度》综述论文，35页pdf全面阐述DL训练与推理GPU调度技术进展

南洋理工北大等首篇《GPU数据中心中深度学习工作负载调度》综述论文，35页pdf全面阐述DL训练与推理GPU调度技术进展

专知会员服务

45+阅读 · 2022年5月27日

上海科技大学石远明等《联邦机器学习在6G中的机会与挑战》，附133页PPT

上海科技大学石远明等《联邦机器学习在6G中的机会与挑战》，附133页PPT

专知会员服务

28+阅读 · 2022年3月28日

深度神经网络 FPGA 设计进展、实现与展望

深度神经网络 FPGA 设计进展、实现与展望

专知会员服务

59+阅读 · 2022年3月26日

深度神经网络FPGA设计进展、实现与展望

深度神经网络FPGA设计进展、实现与展望

专知会员服务

36+阅读 · 2022年3月21日

【阿里巴巴达摩院】TResNet: 高性能的GPU专用架构，GPU-Dedicated Architecture

【阿里巴巴达摩院】TResNet: 高性能的GPU专用架构，GPU-Dedicated Architecture

专知会员服务

33+阅读 · 2020年4月1日

热门VIP内容

开通专知VIP会员享更多权益服务

智能体记忆深度剖析：评价指标与系统局限性的分类体系及实证分析

《可信人工智能赋能系统的支柱》

【CMU博士论文】可靠轨迹预测的分层基石：数据、评估与方法

人工智能赋能边缘与自主系统：美陆军现代化进程聚焦威胁探测与战术边缘情报

相关资讯

《“边缘计算+”技术白皮书》，82页pdf

《“边缘计算+”技术白皮书》，82页pdf

专知

11+阅读 · 2022年8月28日

清华大学《高级机器学习》课程

清华大学《高级机器学习》课程

专知

40+阅读 · 2020年7月21日

【研究报告】《边缘计算参考架构3.0》、《边云协同白皮书》发布！（附下载）

【研究报告】《边缘计算参考架构3.0》、《边云协同白皮书》发布！（附下载）

产业智能官

26+阅读 · 2019年10月12日

【综述】IBM 自动机器学习网络架构搜索最新综述，附45页全文下载

【综述】IBM 自动机器学习网络架构搜索最新综述，附45页全文下载

专知

20+阅读 · 2019年5月8日

【边缘计算】支撑边缘智能计算的软件体系：语言、工具与信息框架

【边缘计算】支撑边缘智能计算的软件体系：语言、工具与信息框架

产业智能官

16+阅读 · 2019年4月22日

深度学习时代的图模型，清华发文综述图网络

深度学习时代的图模型，清华发文综述图网络

GAN生成式对抗网络

13+阅读 · 2018年12月23日

每日论文 | 图形深度神经网络并行框架NGra；用人类注意力进行序列分类；针对多智能体协作的图卷积强化学习

每日论文 | 图形深度神经网络并行框架NGra；用人类注意力进行序列分类；针对多智能体协作的图卷积强化学习

论智

26+阅读 · 2018年10月30日

图深度学习(GraphDL)，下一个人工智能算法热点？一文了解最新GDL相关文章

图深度学习(GraphDL)，下一个人工智能算法热点？一文了解最新GDL相关文章

专知

18+阅读 · 2018年6月10日

讲透RCNN, Fast-RCNN, Faster-RCNN，将CNN用于目标检测

讲透RCNN, Fast-RCNN, Faster-RCNN，将CNN用于目标检测

数据挖掘入门与实战

18+阅读 · 2018年4月20日

NLP中自动生产文摘（auto text summarization）

NLP中自动生产文摘（auto text summarization）

机器学习研究会

14+阅读 · 2017年10月10日

相关论文

DPUConfig: Optimizing ML Inference in FPGAs Using Reinforcement Learning

Arxiv

0+阅读 · 2月13日

LQA: A Lightweight Quantized-Adaptive Framework for Vision-Language Models on the Edge

Arxiv

0+阅读 · 2月8日

RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models

Arxiv

0+阅读 · 2月7日

BitLogic: Training Framework for Gradient-Based FPGA-Native Neural Networks

Arxiv

0+阅读 · 2月7日

LAAFD: LLM-based Agents for Accelerated FPGA Design

Arxiv

0+阅读 · 2月4日

CGRA4ML: A Hardware/Software Framework to Implement Neural Networks for Scientific Edge Computing

Arxiv

0+阅读 · 2月4日

Hexcute: A Compiler Framework for Automating Layout Synthesis in GPU Programs

Arxiv

0+阅读 · 1月28日

Agentic Fog: A Policy-driven Framework for Distributed Intelligence in Fog Computing

Arxiv

0+阅读 · 1月28日

A Reconfigurable Framework for AI-FPGA Agent Integration and Acceleration

Arxiv

0+阅读 · 1月27日

MLIR-Forge: A Modular Framework for Language Smiths

Arxiv

0+阅读 · 1月14日

相关基金

基于加速网的光电混合三维互连架构设计方法研究

国家自然科学基金

0+阅读 · 2017年12月31日

基于动态网络结构的膜计算系统及其算法研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于智慧的下一代网络资源优化机制研究

国家自然科学基金

2+阅读 · 2015年12月31日

面向大规模动态异构网络的支持多用户并发任务的物联网应用构建方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

具有大线性复杂度的最优部分汉明相关跳频序列集的构造研究

国家自然科学基金

0+阅读 · 2015年12月31日

神经形态多核处理器的架构模型研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于动态匹配的高能量利用率多层堆叠结构静态随机存储器（SRAM）关键技术

国家自然科学基金

0+阅读 · 2015年12月31日

面向可重构多核处理器系统的分层次自适应优化机制研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向大数据的高时效并行计算机系统结构与技术

国家自然科学基金

0+阅读 · 2014年12月31日

CPU和GPU混合体系结构上生物网络比对并行算法研究

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员