Mambalaya: Einsum-Based Fusion Optimizations on State-Space Models - 专知论文

会员服务 ·

0

融合 · 状态空间 · 级联 · 内存 · 映射 ·

Mambalaya: Einsum-Based Fusion Optimizations on State-Space Models

翻译：Mambalaya：基于Einsum融合优化的状态空间模型

Toluwanimi O. Odemuyiwa,John D. Owens,Joel S. Emer,Michael Pellauer

from arxiv, 15 pages, 15 figures, initial version

Mamba is an emerging, complex workload with various short-range and long-range dependencies, nonlinearities, and elementwise computations that are unable to run at near-peak speeds on modern hardware. Specifically, Mamba's complex dependency graph makes fusion across its full operator cascade difficult, leaving substantial inter-operator memory traffic on the table. To address these challenges, we propose Mambalaya, a novel reconfigurable accelerator that leverages fusion to overcome the limitations of Mamba. We use the recently proposed cascade-of-Einsums abstraction to characterize Mamba's full computational structure, then apply the extended Einsum framework to systematically explore inter-Einsum fusion opportunities. This principled approach yields a series of fusion mappings that reduce off-chip inter-Einsum traffic. These mappings are supported by the underlying Mambalaya architecture. Mambalaya achieves a layer performance speedup of 4.9$\times$ for prefill and 1.9$\times$ for generation over MARCA. In prefill-dominated scenarios, it achieves up to 1.5$\times$ over a recent fine-grained, memory-aware fusion accelerator for Mamba.

翻译：曼巴（Mamba）是一种新兴的复杂工作负载，包含多种短程与长程依赖、非线性运算及逐元素计算，难以在现代硬件上实现近峰值运行速度。具体而言，曼巴复杂的依赖关系图使其难以在完整的算子级联上进行融合，导致大量跨算子内存流量无法被充分利用。为解决这一挑战，我们提出Mambalaya——一种新型可重构加速器，通过融合技术突破曼巴的局限性。我们采用近期提出的Einsum级联抽象来表征曼巴的完整计算结构，随后应用扩展后的Einsum框架系统探索Einsum间融合机会。这一原则性方法产生了一系列融合映射，可减少片外Einsum间数据流量，而这些映射由底层Mambalaya架构提供支持。相较于MARCA，Mambalaya在预填充阶段实现了4.9倍的单层性能加速，在生成阶段实现了1.9倍加速。在预填充主导的场景中，其性能较近期为曼巴设计的细粒度内存感知融合加速器提升最高达1.5倍。

0

相关内容

《飞行自组织网络通信协议评估体系：三维高斯-马尔科夫移动模型的创新升级》172页

《飞行自组织网络通信协议评估体系：三维高斯-马尔科夫移动模型的创新升级》172页

专知会员服务

25+阅读 · 2025年8月12日

[ICCV2025]EAMamba：面向图像恢复的高效全能视觉状态空间模型

[ICCV2025]EAMamba：面向图像恢复的高效全能视觉状态空间模型

专知会员服务

5+阅读 · 2025年7月1日

《图Mamba》最新综述，探索图学习中的状态空间模型

《图Mamba》最新综述，探索图学习中的状态空间模型

专知会员服务

31+阅读 · 2024年12月26日

《视觉中的Mamba：技术与应用》全面综述

《视觉中的Mamba：技术与应用》全面综述

专知会员服务

37+阅读 · 2024年10月7日

Mamba 架构在医学图像分析中的全面综述：分类、分割、重建及其他应用

Mamba 架构在医学图像分析中的全面综述：分类、分割、重建及其他应用

专知会员服务

29+阅读 · 2024年10月4日

Meta Llama 3.1 405B 正式发布发布，Llama成大模型顶流，扎克伯格掀论战：玩开源，时代变了

Meta Llama 3.1 405B 正式发布发布，Llama成大模型顶流，扎克伯格掀论战：玩开源，时代变了

专知会员服务

19+阅读 · 2024年7月24日

模型即服务MaaS框架与应用研究报告（2024年），46页pdf

模型即服务MaaS框架与应用研究报告（2024年），46页pdf

专知会员服务

66+阅读 · 2024年6月9日

谷歌开源模型系列「Gemma」技术报告，中英文版

谷歌开源模型系列「Gemma」技术报告，中英文版

专知会员服务

47+阅读 · 2024年2月22日

《生成式模型: 变分自编码器与扩散模型》，75页ppt，Google DeepMind科学家Ruiqi Gao

《生成式模型: 变分自编码器与扩散模型》，75页ppt，Google DeepMind科学家Ruiqi Gao

专知会员服务

66+阅读 · 2023年6月10日

牛津大学发布首篇《Transformer多模态学习》综述论文，23页pdf涵盖310篇文献全面阐述MMT的理论与应用

牛津大学发布首篇《Transformer多模态学习》综述论文，23页pdf涵盖310篇文献全面阐述MMT的理论与应用

专知会员服务

124+阅读 · 2022年6月15日

【伯克利马毅老师等重磅新书】低维模型进行高维数据分析:原理、计算和应用，710页pdf

【伯克利马毅老师等重磅新书】低维模型进行高维数据分析:原理、计算和应用，710页pdf

专知

45+阅读 · 2020年12月9日

专家报告|深度学习+图像多模态融合

专家报告|深度学习+图像多模态融合

中国图象图形学报

12+阅读 · 2019年10月23日

基于RASA的task-orient对话系统解析（一）

基于RASA的task-orient对话系统解析（一）

AINLP

16+阅读 · 2019年8月27日

超越 BERT 和 GPT，微软亚洲研究院开源新模型 MASS！

超越 BERT 和 GPT，微软亚洲研究院开源新模型 MASS！

雷锋网

10+阅读 · 2019年6月27日

基于MaaS的智慧交通体系

基于MaaS的智慧交通体系

智能交通技术

11+阅读 · 2019年6月13日

出行即服务（MAAS）框架

出行即服务（MAAS）框架

智能交通技术

53+阅读 · 2019年5月22日

MAAS：出行服务的颠覆者

MAAS：出行服务的颠覆者

智能交通技术

16+阅读 · 2018年12月27日

每日论文 | CV中深度学习涉及到的几何和不确定性；用深度学习分析气象；可自动调整模拟器参数的模型

每日论文 | CV中深度学习涉及到的几何和不确定性；用深度学习分析气象；可自动调整模拟器参数的模型

论智

11+阅读 · 2018年10月9日

当前最好的非深度迁移学习方法：流形空间下的分布对齐

当前最好的非深度迁移学习方法：流形空间下的分布对齐

PaperWeekly

11+阅读 · 2018年7月31日

自然语言处理中的Attention Model：是什么及为什么

自然语言处理中的Attention Model：是什么及为什么

新智元

11+阅读 · 2017年7月13日

新型超导纳米线材料中Majorana束缚态的能谱与输运特性

国家自然科学基金

0+阅读 · 2016年12月31日

众核集群上基于MPI的模型扩展及性能优化研究

国家自然科学基金

1+阅读 · 2015年12月31日

神经形态多核处理器的架构模型研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于动态匹配的高能量利用率多层堆叠结构静态随机存储器（SRAM）关键技术

国家自然科学基金

0+阅读 · 2015年12月31日

基于扩展的概率转移矩阵模型的高精度快速广义门电路可靠性评估方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

可与MPSoC高度融合的片上自主测试-自主修复关键技术研究：针对自然、人为可靠性威胁

国家自然科学基金

0+阅读 · 2015年12月31日

插值条件下DEM误差的空间自相关模型研究

国家自然科学基金

1+阅读 · 2014年12月31日

Banach空间的嵌入理论及其应用

国家自然科学基金

1+阅读 · 2014年12月31日

函数空间、几何和Mahler测度

国家自然科学基金

0+阅读 · 2014年12月31日

千万自由度量级并行有限元模态和振动分析软件研发

国家自然科学基金

0+阅读 · 2014年12月31日

L2RU: a Structured State Space Model with prescribed L2-bound

Arxiv

0+阅读 · 4月29日

SpikingMamba: Towards Energy-Efficient Large Language Models via Knowledge Distillation from Mamba

Arxiv

0+阅读 · 4月12日

Large Language Models for Combinatorial Optimization of Design Structure Matrix

Arxiv

0+阅读 · 4月5日

SegMaFormer: A Hybrid State-Space and Transformer Model for Efficient Segmentation

Arxiv

0+阅读 · 3月23日

GOMA: Geometrically Optimal Mapping via Analytical Modeling for Spatial Accelerators

Arxiv

0+阅读 · 3月23日

SOMA: Unifying Parametric Human Body Models

Arxiv

0+阅读 · 3月17日

SF-Mamba: Rethinking State Space Model for Vision

Arxiv

0+阅读 · 3月17日

Mamba-3: Improved Sequence Modeling using State Space Principles

Arxiv

0+阅读 · 3月16日

Mamba Neural Operator: Who Wins? Transformers vs. State-Space Models for PDEs

Arxiv

0+阅读 · 3月11日

VEMamba: Efficient Isotropic Reconstruction of Volume Electron Microscopy with Axial-Lateral Consistent Mamba

Arxiv

0+阅读 · 3月1日

VIP会员

文章信息

相关主题

最新内容

美国军方使用的10种反无人机武器（2026年更新）

美国军方使用的10种反无人机武器（2026年更新）

专知会员服务

1+阅读 · 45分钟前

智能技术在战场指挥控制系统中的应用（附中英文版下载）

智能技术在战场指挥控制系统中的应用（附中英文版下载）

专知会员服务

1+阅读 · 今天3:21

北约《俄乌战争经验教训课程指南：25份课程计划》150页

北约《俄乌战争经验教训课程指南：25份课程计划》150页

专知会员服务

2+阅读 · 今天3:03

《不确定性环境下基于智能体框架中实时多机器人任务分配的贝叶斯网络》博士论文

《不确定性环境下基于智能体框架中实时多机器人任务分配的贝叶斯网络》博士论文

专知会员服务

2+阅读 · 今天2:59

首场人工智能战争——俄乌战争（中文版、原文下载）

首场人工智能战争——俄乌战争（中文版、原文下载）

专知会员服务

3+阅读 · 今天1:52

《提升战术级作战规划水平：城市进攻作战中的机动样式研究》

《提升战术级作战规划水平：城市进攻作战中的机动样式研究》

专知会员服务

3+阅读 · 今天1:36

《人员配置对陆军突击清障车与联合突击桥战备状态的影响研究》

《人员配置对陆军突击清障车与联合突击桥战备状态的影响研究》

专知会员服务

2+阅读 · 今天1:28

管理咨询报告：美国国防部量子技术开发与实施评估（译文）

管理咨询报告：美国国防部量子技术开发与实施评估（译文）

专知会员服务

1+阅读 · 今天1:16

【博士论文】可解释人工智能的数学基础与 Bandit 优化的研究进展

【博士论文】可解释人工智能的数学基础与 Bandit 优化的研究进展

专知会员服务

5+阅读 · 5月8日

生成-过滤-控制-重放：LLM强化学习中Rollout策略的全面综述

生成-过滤-控制-重放：LLM强化学习中Rollout策略的全面综述

专知会员服务

2+阅读 · 5月8日

认知战与交战性质的改变：神经战略视角

认知战与交战性质的改变：神经战略视角

专知会员服务

5+阅读 · 5月8日

美国《国防授权法案》指令要求界定“认知战”：区分相关概念

美国《国防授权法案》指令要求界定“认知战”：区分相关概念

专知会员服务

4+阅读 · 5月8日

人工智能对特定国防资源管理流程的影响（万字长文）

人工智能对特定国防资源管理流程的影响（万字长文）

专知会员服务

5+阅读 · 5月8日

《多域作战概念实证检验：美军“史诗怒火”行动中跨域协同的地理空间混合方法分析研究》245页报告

《多域作战概念实证检验：美军“史诗怒火”行动中跨域协同的地理空间混合方法分析研究》245页报告

专知会员服务

9+阅读 · 5月8日

《预设时间的单次协同估计、制导与控制框架：实现同时目标拦截》2026最新40页报告

《预设时间的单次协同估计、制导与控制框架：实现同时目标拦截》2026最新40页报告

专知会员服务

10+阅读 · 5月8日

相关VIP内容

《飞行自组织网络通信协议评估体系：三维高斯-马尔科夫移动模型的创新升级》172页

《飞行自组织网络通信协议评估体系：三维高斯-马尔科夫移动模型的创新升级》172页

专知会员服务

25+阅读 · 2025年8月12日

[ICCV2025]EAMamba：面向图像恢复的高效全能视觉状态空间模型

[ICCV2025]EAMamba：面向图像恢复的高效全能视觉状态空间模型

专知会员服务

5+阅读 · 2025年7月1日

《图Mamba》最新综述，探索图学习中的状态空间模型

《图Mamba》最新综述，探索图学习中的状态空间模型

专知会员服务

31+阅读 · 2024年12月26日

《视觉中的Mamba：技术与应用》全面综述

《视觉中的Mamba：技术与应用》全面综述

专知会员服务

37+阅读 · 2024年10月7日

Mamba 架构在医学图像分析中的全面综述：分类、分割、重建及其他应用

Mamba 架构在医学图像分析中的全面综述：分类、分割、重建及其他应用

专知会员服务

29+阅读 · 2024年10月4日

Meta Llama 3.1 405B 正式发布发布，Llama成大模型顶流，扎克伯格掀论战：玩开源，时代变了

Meta Llama 3.1 405B 正式发布发布，Llama成大模型顶流，扎克伯格掀论战：玩开源，时代变了

专知会员服务

19+阅读 · 2024年7月24日

模型即服务MaaS框架与应用研究报告（2024年），46页pdf

模型即服务MaaS框架与应用研究报告（2024年），46页pdf

专知会员服务

66+阅读 · 2024年6月9日

谷歌开源模型系列「Gemma」技术报告，中英文版

谷歌开源模型系列「Gemma」技术报告，中英文版

专知会员服务

47+阅读 · 2024年2月22日

《生成式模型: 变分自编码器与扩散模型》，75页ppt，Google DeepMind科学家Ruiqi Gao

《生成式模型: 变分自编码器与扩散模型》，75页ppt，Google DeepMind科学家Ruiqi Gao

专知会员服务

66+阅读 · 2023年6月10日

牛津大学发布首篇《Transformer多模态学习》综述论文，23页pdf涵盖310篇文献全面阐述MMT的理论与应用

牛津大学发布首篇《Transformer多模态学习》综述论文，23页pdf涵盖310篇文献全面阐述MMT的理论与应用

专知会员服务

124+阅读 · 2022年6月15日

热门VIP内容

开通专知VIP会员享更多权益服务

智能技术在战场指挥控制系统中的应用（附中英文版下载）

《不确定性环境下基于智能体框架中实时多机器人任务分配的贝叶斯网络》博士论文

美国军方使用的10种反无人机武器（2026年更新）

北约《俄乌战争经验教训课程指南：25份课程计划》150页

相关资讯

【伯克利马毅老师等重磅新书】低维模型进行高维数据分析:原理、计算和应用，710页pdf

【伯克利马毅老师等重磅新书】低维模型进行高维数据分析:原理、计算和应用，710页pdf

专知

45+阅读 · 2020年12月9日

专家报告|深度学习+图像多模态融合

专家报告|深度学习+图像多模态融合

中国图象图形学报

12+阅读 · 2019年10月23日

基于RASA的task-orient对话系统解析（一）

基于RASA的task-orient对话系统解析（一）

AINLP

16+阅读 · 2019年8月27日

超越 BERT 和 GPT，微软亚洲研究院开源新模型 MASS！

超越 BERT 和 GPT，微软亚洲研究院开源新模型 MASS！

雷锋网

10+阅读 · 2019年6月27日

基于MaaS的智慧交通体系

基于MaaS的智慧交通体系

智能交通技术

11+阅读 · 2019年6月13日

出行即服务（MAAS）框架

出行即服务（MAAS）框架

智能交通技术

53+阅读 · 2019年5月22日

MAAS：出行服务的颠覆者

MAAS：出行服务的颠覆者

智能交通技术

16+阅读 · 2018年12月27日

每日论文 | CV中深度学习涉及到的几何和不确定性；用深度学习分析气象；可自动调整模拟器参数的模型

每日论文 | CV中深度学习涉及到的几何和不确定性；用深度学习分析气象；可自动调整模拟器参数的模型

论智

11+阅读 · 2018年10月9日

当前最好的非深度迁移学习方法：流形空间下的分布对齐

当前最好的非深度迁移学习方法：流形空间下的分布对齐

PaperWeekly

11+阅读 · 2018年7月31日

自然语言处理中的Attention Model：是什么及为什么

自然语言处理中的Attention Model：是什么及为什么

新智元

11+阅读 · 2017年7月13日

相关论文

L2RU: a Structured State Space Model with prescribed L2-bound

Arxiv

0+阅读 · 4月29日

SpikingMamba: Towards Energy-Efficient Large Language Models via Knowledge Distillation from Mamba

Arxiv

0+阅读 · 4月12日

Large Language Models for Combinatorial Optimization of Design Structure Matrix

Arxiv

0+阅读 · 4月5日

SegMaFormer: A Hybrid State-Space and Transformer Model for Efficient Segmentation

Arxiv

0+阅读 · 3月23日

GOMA: Geometrically Optimal Mapping via Analytical Modeling for Spatial Accelerators

Arxiv

0+阅读 · 3月23日

SOMA: Unifying Parametric Human Body Models

Arxiv

0+阅读 · 3月17日

SF-Mamba: Rethinking State Space Model for Vision

Arxiv

0+阅读 · 3月17日

Mamba-3: Improved Sequence Modeling using State Space Principles

Arxiv

0+阅读 · 3月16日

Mamba Neural Operator: Who Wins? Transformers vs. State-Space Models for PDEs

Arxiv

0+阅读 · 3月11日

VEMamba: Efficient Isotropic Reconstruction of Volume Electron Microscopy with Axial-Lateral Consistent Mamba

Arxiv

0+阅读 · 3月1日

相关基金

新型超导纳米线材料中Majorana束缚态的能谱与输运特性

国家自然科学基金

0+阅读 · 2016年12月31日

众核集群上基于MPI的模型扩展及性能优化研究

国家自然科学基金

1+阅读 · 2015年12月31日

神经形态多核处理器的架构模型研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于动态匹配的高能量利用率多层堆叠结构静态随机存储器（SRAM）关键技术

国家自然科学基金

0+阅读 · 2015年12月31日

基于扩展的概率转移矩阵模型的高精度快速广义门电路可靠性评估方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

可与MPSoC高度融合的片上自主测试-自主修复关键技术研究：针对自然、人为可靠性威胁

国家自然科学基金

0+阅读 · 2015年12月31日

插值条件下DEM误差的空间自相关模型研究

国家自然科学基金

1+阅读 · 2014年12月31日

Banach空间的嵌入理论及其应用

国家自然科学基金

1+阅读 · 2014年12月31日

函数空间、几何和Mahler测度

国家自然科学基金

0+阅读 · 2014年12月31日

千万自由度量级并行有限元模态和振动分析软件研发

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员