On the Expressive Power of Mixture-of-Experts for Structured Complex Tasks - 专知论文

会员服务 ·

0

专家网络 · 结构 · 混合 · 结构化 · 稀疏 ·

On the Expressive Power of Mixture-of-Experts for Structured Complex Tasks

翻译：论混合专家网络在结构化复杂任务中的表达能力

Mingze Wang,Weinan E

from arxiv, 28 pages, NeurIPS 2025 Spotlight

Mixture-of-experts networks (MoEs) have demonstrated remarkable efficiency in modern deep learning. Despite their empirical success, the theoretical foundations underlying their ability to model complex tasks remain poorly understood. In this work, we conduct a systematic study of the expressive power of MoEs in modeling complex tasks with two common structural priors: low-dimensionality and sparsity. For shallow MoEs, we prove that they can efficiently approximate functions supported on low-dimensional manifolds, overcoming the curse of dimensionality. For deep MoEs, we show that $\mathcal{O}(L)$-layer MoEs with $E$ experts per layer can approximate piecewise functions comprising $E^L$ pieces with compositional sparsity, i.e., they can exhibit an exponential number of structured tasks. Our analysis reveals the roles of critical architectural components and hyperparameters in MoEs, including the gating mechanism, expert networks, the number of experts, and the number of layers, and offers natural suggestions for MoE variants.

翻译：混合专家网络（MoEs）在现代深度学习中展现出卓越的效率。尽管其经验性成功显著，但支撑其建模复杂任务能力的理论基础仍不甚明晰。本研究系统性地探讨了MoEs在建模具有两种常见结构先验（低维性与稀疏性）的复杂任务时的表达能力。对于浅层MoEs，我们证明其能高效逼近支撑在低维流形上的函数，从而克服维度灾难。对于深层MoEs，我们表明具有每层$E$个专家的$\mathcal{O}(L)$层MoEs能够逼近包含$E^L$个分段且具有组合稀疏性的分段函数，即它们能呈现指数级数量的结构化任务。我们的分析揭示了MoEs中关键架构组件与超参数的作用，包括门控机制、专家网络、专家数量及网络层数，并为MoE变体提供了自然的改进建议。

0

相关内容

专家网络

稀疏混合专家模型 (SMoE) 的崛起：从算法基础、去中心化架构到垂直领域应用的综述

稀疏混合专家模型 (SMoE) 的崛起：从算法基础、去中心化架构到垂直领域应用的综述

专知会员服务

17+阅读 · 2月12日

混合专家模型简述

混合专家模型简述

专知会员服务

18+阅读 · 2025年5月30日

【NYU博士论文】神经网络中的简单结构：论表达能力、优化性与数据分布

【NYU博士论文】神经网络中的简单结构：论表达能力、优化性与数据分布

专知会员服务

17+阅读 · 2025年4月30日

《混合专家模型推理优化技术综述》

《混合专家模型推理优化技术综述》

专知会员服务

46+阅读 · 2024年12月21日

【NeurIPS2024】LSH-MoE：通过局部敏感哈希实现通信高效的专家混合模型训练

【NeurIPS2024】LSH-MoE：通过局部敏感哈希实现通信高效的专家混合模型训练

专知会员服务

14+阅读 · 2024年11月14日

算法、系统和应用，三个视角全面读懂《混合专家（MoE）》

算法、系统和应用，三个视角全面读懂《混合专家（MoE）》

专知会员服务

77+阅读 · 2024年7月28日

GPT-4o核心技术？哈工大最新《Uni-MoE：使用专家混合模型扩展统一多模态大语言模型》

GPT-4o核心技术？哈工大最新《Uni-MoE：使用专家混合模型扩展统一多模态大语言模型》

专知会员服务

35+阅读 · 2024年5月26日

Jeff Dean署名《深度学习稀疏专家模型》综述论文

Jeff Dean署名《深度学习稀疏专家模型》综述论文

专知会员服务

39+阅读 · 2022年10月4日

【哥伦比亚大学】复杂网络深度表示的几何和拓扑推理，Geometric and Topological Inference for Deep Representations of Complex Networks

【哥伦比亚大学】复杂网络深度表示的几何和拓扑推理，Geometric and Topological Inference for Deep Representations of Complex Networks

专知会员服务

23+阅读 · 2022年3月11日

复杂网络的双曲空间表征学习方法

专知会员服务

47+阅读 · 2020年11月13日

网络表示学习概述

网络表示学习概述

机器学习与推荐算法

20+阅读 · 2020年3月27日

【WWW2020】结构深度聚类网络， Structural Deep Clustering Network，北京邮电大学

【WWW2020】结构深度聚类网络， Structural Deep Clustering Network，北京邮电大学

专知

31+阅读 · 2020年2月19日

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

专知

53+阅读 · 2019年12月1日

清华大学唐杰老师WWW2019网络表示学习教程-NE、GNN，500页ppt

清华大学唐杰老师WWW2019网络表示学习教程-NE、GNN，500页ppt

专知

71+阅读 · 2019年5月17日

【教程】从代码中理解深度网络架构（附72页slides及代码样例下载）

【教程】从代码中理解深度网络架构（附72页slides及代码样例下载）

专知

22+阅读 · 2019年4月17日

【最新综述】无监督网络表示学习综述，附18页全文下载

【最新综述】无监督网络表示学习综述，附18页全文下载

专知

28+阅读 · 2019年3月20日

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

机器之心

15+阅读 · 2019年3月18日

斯坦福Jure Leskovec：图神经网络表达能力有多强

斯坦福Jure Leskovec：图神经网络表达能力有多强

专知

39+阅读 · 2019年2月18日

【论文推荐】最新六篇用户建模精选论文推荐—深度多模态融合、跨平台、时序性RNN、ATRank、嵌入因子分解、异构信息网络

【论文推荐】最新六篇用户建模精选论文推荐—深度多模态融合、跨平台、时序性RNN、ATRank、嵌入因子分解、异构信息网络

专知

10+阅读 · 2018年3月10日

一文读懂复杂网络（应用、模型和研究历史）

一文读懂复杂网络（应用、模型和研究历史）

AI100

16+阅读 · 2017年11月14日

混合预编码器的内在关联机制与结构优化

国家自然科学基金

0+阅读 · 2017年12月31日

钢筋混凝土复杂受力构件的配筋设计方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

时空混杂社团网络的同步研究

国家自然科学基金

0+阅读 · 2015年12月31日

多输入-多输出网络量化系统的分析与综合研究

国家自然科学基金

0+阅读 · 2015年12月31日

钢-聚丙烯混杂纤维混凝土多尺度本构关系: 从纳米尺度到宏观尺度

国家自然科学基金

0+阅读 · 2014年12月31日

混杂动力系统的回复性及相关问题研究

国家自然科学基金

0+阅读 · 2014年12月31日

考虑不确定性和方向性的结构随机极值和疲劳风致响应及抗风可靠性评价理论

国家自然科学基金

0+阅读 · 2014年12月31日

城市知识流的表征及其结构演化的复杂性研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于非线性动力学的复杂网络结构识别及其在力学系统中的应用

国家自然科学基金

0+阅读 · 2014年12月31日

网络的小世界结构及其上随机游动的混合时

国家自然科学基金

1+阅读 · 2014年12月31日

Optimal Transport Aggregation for Distributed Mixture-of-Experts

Arxiv

0+阅读 · 3月11日

On the Expressive Power of Transformers for Maxout Networks and Continuous Piecewise Linear Functions

Arxiv

0+阅读 · 3月3日

SlimCaching: Edge Caching of Mixture-of-Experts for Distributed Inference

Arxiv

0+阅读 · 3月1日

Multilingual Routing in Mixture-of-Experts

Arxiv

0+阅读 · 2月17日

Mixture-of-Experts under Finite-Rate Gating: Communication--Generalization Trade-offs

Arxiv

0+阅读 · 2月16日

Hyperparameter Transfer with Mixture-of-Expert Layers

Arxiv

0+阅读 · 2月12日

Area-Efficient In-Memory Computing for Mixture-of-Experts via Multiplexing and Caching

Arxiv

0+阅读 · 2月10日

LIBMoE: A Library for comprehensive benchmarking Mixture of Experts in Large Language Models

Arxiv

0+阅读 · 2月10日

OmniMoE: An Efficient MoE by Orchestrating Atomic Experts at Scale

Arxiv

0+阅读 · 2月5日

LIBMoE: A Library for comprehensive benchmarking Mixture of Experts in Large Language Models

Arxiv

0+阅读 · 2月5日

VIP会员

文章信息

相关主题

最新内容

美以伊冲突中的人工智能应用：人工智能工具、部署策略及作战影响分析

美以伊冲突中的人工智能应用：人工智能工具、部署策略及作战影响分析

专知会员服务

5+阅读 · 5月31日

比利时发布用于实时战场军事装备识别的离线人工智能系统

比利时发布用于实时战场军事装备识别的离线人工智能系统

专知会员服务

3+阅读 · 5月31日

《经济冲击与战略损失：美伊军事冲突的不可持续成本》

《经济冲击与战略损失：美伊军事冲突的不可持续成本》

专知会员服务

3+阅读 · 5月31日

超越网格：作战环境对炮兵的影响

超越网格：作战环境对炮兵的影响

专知会员服务

2+阅读 · 5月31日

KDD 2026 | MixRAGRec：面向LLM推荐的混合专家KG-RAG框架

KDD 2026 | MixRAGRec：面向LLM推荐的混合专家KG-RAG框架

专知会员服务

7+阅读 · 5月31日

综述 | 推理时控制：可信大语言模型的运行时治理全景

综述 | 推理时控制：可信大语言模型的运行时治理全景

专知会员服务

4+阅读 · 5月31日

BES：让语言模型通过双向进化搜索自我改进

BES：让语言模型通过双向进化搜索自我改进

专知会员服务

6+阅读 · 5月30日

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

专知会员服务

7+阅读 · 5月30日

以色列-美国-伊朗战争中的无人机：关键要点

以色列-美国-伊朗战争中的无人机：关键要点

专知会员服务

7+阅读 · 5月30日

美以伊战争：首次人工智能战争——军事自主性困境

美以伊战争：首次人工智能战争——军事自主性困境

专知会员服务

6+阅读 · 5月30日

《Palantir任务保障性软件安全标准（MA-S2）》

《Palantir任务保障性软件安全标准（MA-S2）》

专知会员服务

19+阅读 · 5月30日

《美海军利用扩展现实增强知识流动研究》300页报告

《美海军利用扩展现实增强知识流动研究》300页报告

专知会员服务

10+阅读 · 5月30日

基于声学的无人机检测技术综述

基于声学的无人机检测技术综述

专知会员服务

11+阅读 · 5月30日

《当代混合战争分析框架：俄乌战争经验教训》

《当代混合战争分析框架：俄乌战争经验教训》

专知会员服务

10+阅读 · 5月30日

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

专知会员服务

14+阅读 · 5月29日

相关VIP内容

稀疏混合专家模型 (SMoE) 的崛起：从算法基础、去中心化架构到垂直领域应用的综述

稀疏混合专家模型 (SMoE) 的崛起：从算法基础、去中心化架构到垂直领域应用的综述

专知会员服务

17+阅读 · 2月12日

混合专家模型简述

混合专家模型简述

专知会员服务

18+阅读 · 2025年5月30日

【NYU博士论文】神经网络中的简单结构：论表达能力、优化性与数据分布

【NYU博士论文】神经网络中的简单结构：论表达能力、优化性与数据分布

专知会员服务

17+阅读 · 2025年4月30日

《混合专家模型推理优化技术综述》

《混合专家模型推理优化技术综述》

专知会员服务

46+阅读 · 2024年12月21日

【NeurIPS2024】LSH-MoE：通过局部敏感哈希实现通信高效的专家混合模型训练

【NeurIPS2024】LSH-MoE：通过局部敏感哈希实现通信高效的专家混合模型训练

专知会员服务

14+阅读 · 2024年11月14日

算法、系统和应用，三个视角全面读懂《混合专家（MoE）》

算法、系统和应用，三个视角全面读懂《混合专家（MoE）》

专知会员服务

77+阅读 · 2024年7月28日

GPT-4o核心技术？哈工大最新《Uni-MoE：使用专家混合模型扩展统一多模态大语言模型》

GPT-4o核心技术？哈工大最新《Uni-MoE：使用专家混合模型扩展统一多模态大语言模型》

专知会员服务

35+阅读 · 2024年5月26日

Jeff Dean署名《深度学习稀疏专家模型》综述论文

Jeff Dean署名《深度学习稀疏专家模型》综述论文

专知会员服务

39+阅读 · 2022年10月4日

【哥伦比亚大学】复杂网络深度表示的几何和拓扑推理，Geometric and Topological Inference for Deep Representations of Complex Networks

【哥伦比亚大学】复杂网络深度表示的几何和拓扑推理，Geometric and Topological Inference for Deep Representations of Complex Networks

专知会员服务

23+阅读 · 2022年3月11日

复杂网络的双曲空间表征学习方法

专知会员服务

47+阅读 · 2020年11月13日

热门VIP内容

开通专知VIP会员享更多权益服务

比利时发布用于实时战场军事装备识别的离线人工智能系统

超越网格：作战环境对炮兵的影响

美以伊冲突中的人工智能应用：人工智能工具、部署策略及作战影响分析

《经济冲击与战略损失：美伊军事冲突的不可持续成本》

相关资讯

网络表示学习概述

网络表示学习概述

机器学习与推荐算法

20+阅读 · 2020年3月27日

【WWW2020】结构深度聚类网络， Structural Deep Clustering Network，北京邮电大学

【WWW2020】结构深度聚类网络， Structural Deep Clustering Network，北京邮电大学

专知

31+阅读 · 2020年2月19日

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

专知

53+阅读 · 2019年12月1日

清华大学唐杰老师WWW2019网络表示学习教程-NE、GNN，500页ppt

清华大学唐杰老师WWW2019网络表示学习教程-NE、GNN，500页ppt

专知

71+阅读 · 2019年5月17日

【教程】从代码中理解深度网络架构（附72页slides及代码样例下载）

【教程】从代码中理解深度网络架构（附72页slides及代码样例下载）

专知

22+阅读 · 2019年4月17日

【最新综述】无监督网络表示学习综述，附18页全文下载

【最新综述】无监督网络表示学习综述，附18页全文下载

专知

28+阅读 · 2019年3月20日

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

机器之心

15+阅读 · 2019年3月18日

斯坦福Jure Leskovec：图神经网络表达能力有多强

斯坦福Jure Leskovec：图神经网络表达能力有多强

专知

39+阅读 · 2019年2月18日

【论文推荐】最新六篇用户建模精选论文推荐—深度多模态融合、跨平台、时序性RNN、ATRank、嵌入因子分解、异构信息网络

【论文推荐】最新六篇用户建模精选论文推荐—深度多模态融合、跨平台、时序性RNN、ATRank、嵌入因子分解、异构信息网络

专知

10+阅读 · 2018年3月10日

一文读懂复杂网络（应用、模型和研究历史）

一文读懂复杂网络（应用、模型和研究历史）

AI100

16+阅读 · 2017年11月14日

相关论文

Optimal Transport Aggregation for Distributed Mixture-of-Experts

Arxiv

0+阅读 · 3月11日

On the Expressive Power of Transformers for Maxout Networks and Continuous Piecewise Linear Functions

Arxiv

0+阅读 · 3月3日

SlimCaching: Edge Caching of Mixture-of-Experts for Distributed Inference

Arxiv

0+阅读 · 3月1日

Multilingual Routing in Mixture-of-Experts

Arxiv

0+阅读 · 2月17日

Mixture-of-Experts under Finite-Rate Gating: Communication--Generalization Trade-offs

Arxiv

0+阅读 · 2月16日

Hyperparameter Transfer with Mixture-of-Expert Layers

Arxiv

0+阅读 · 2月12日

Area-Efficient In-Memory Computing for Mixture-of-Experts via Multiplexing and Caching

Arxiv

0+阅读 · 2月10日

LIBMoE: A Library for comprehensive benchmarking Mixture of Experts in Large Language Models

Arxiv

0+阅读 · 2月10日

OmniMoE: An Efficient MoE by Orchestrating Atomic Experts at Scale

Arxiv

0+阅读 · 2月5日

LIBMoE: A Library for comprehensive benchmarking Mixture of Experts in Large Language Models

Arxiv

0+阅读 · 2月5日

相关基金

混合预编码器的内在关联机制与结构优化

国家自然科学基金

0+阅读 · 2017年12月31日

钢筋混凝土复杂受力构件的配筋设计方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

时空混杂社团网络的同步研究

国家自然科学基金

0+阅读 · 2015年12月31日

多输入-多输出网络量化系统的分析与综合研究

国家自然科学基金

0+阅读 · 2015年12月31日

钢-聚丙烯混杂纤维混凝土多尺度本构关系: 从纳米尺度到宏观尺度

国家自然科学基金

0+阅读 · 2014年12月31日

混杂动力系统的回复性及相关问题研究

国家自然科学基金

0+阅读 · 2014年12月31日

考虑不确定性和方向性的结构随机极值和疲劳风致响应及抗风可靠性评价理论

国家自然科学基金

0+阅读 · 2014年12月31日

城市知识流的表征及其结构演化的复杂性研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于非线性动力学的复杂网络结构识别及其在力学系统中的应用

国家自然科学基金

0+阅读 · 2014年12月31日

网络的小世界结构及其上随机游动的混合时

国家自然科学基金

1+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员