Manta: Enhancing Mamba for Few-Shot Action Recognition of Long Sub-Sequence - 专知论文

会员服务 ·

0

序列 · Mamba · 样本 · 动作识别 · 识别 ·

Manta: Enhancing Mamba for Few-Shot Action Recognition of Long Sub-Sequence

翻译：Manta：增强Mamba在长子序列少样本动作识别中的性能

Wenbo Huang,Jinghui Zhang,Guang Li,Lei Zhang,Shuoyuan Wang,Fang Dong,Jiahui Jin,Takahiro Ogawa,Miki Haseyama

from arxiv, Accepted by AAAI 2025

In few-shot action recognition (FSAR), long sub-sequences of video naturally express entire actions more effectively. However, the high computational complexity of mainstream Transformer-based methods limits their application. Recent Mamba demonstrates efficiency in modeling long sequences, but directly applying Mamba to FSAR overlooks the importance of local feature modeling and alignment. Moreover, long sub-sequences within the same class accumulate intra-class variance, which adversely impacts FSAR performance. To solve these challenges, we propose a Matryoshka MAmba and CoNtrasTive LeArning framework (Manta). Firstly, the Matryoshka Mamba introduces multiple Inner Modules to enhance local feature representation, rather than directly modeling global features. An Outer Module captures dependencies of timeline between these local features for implicit temporal alignment. Secondly, a hybrid contrastive learning paradigm, combining both supervised and unsupervised methods, is designed to mitigate the negative effects of intra-class variance accumulation. The Matryoshka Mamba and the hybrid contrastive learning paradigm operate in two parallel branches within Manta, enhancing Mamba for FSAR of long sub-sequence. Manta achieves new state-of-the-art performance on prominent benchmarks, including SSv2, Kinetics, UCF101, and HMDB51. Extensive empirical studies prove that Manta significantly improves FSAR of long sub-sequence from multiple perspectives.

翻译：在少样本动作识别（FSAR）中，视频的长子序列能更有效地完整表达动作。然而，主流基于Transformer的方法计算复杂度高，限制了其应用。近期提出的Mamba在长序列建模方面展现出高效性，但直接将Mamba应用于FSAR会忽略局部特征建模与对齐的重要性。此外，同一类别内的长子序列会累积类内方差，这对FSAR性能产生不利影响。为解决这些挑战，我们提出了一个嵌套式MAmba与对比学习框架（Manta）。首先，嵌套式Mamba通过引入多个内部模块来增强局部特征表示，而非直接建模全局特征。外部模块则捕获这些局部特征间的时间线依赖关系，实现隐式时间对齐。其次，设计了一种结合监督与无监督方法的混合对比学习范式，以减轻类内方差累积的负面影响。嵌套式Mamba与混合对比学习范式在Manta的两个并行分支中运行，共同增强了Mamba在长子序列FSAR任务中的能力。Manta在多个重要基准测试（包括SSv2、Kinetics、UCF101和HMDB51）上取得了新的最先进性能。广泛的实证研究表明，Manta从多个角度显著提升了长子序列的少样本动作识别性能。

0

相关内容

数学上，序列是被排成一列的对象（或事件）；这样每个元素不是在其他元素之前，就是在其他元素之后。这里，元素之间的顺序非常重要。

Mamba之后是什么？朝着更具表现力的递归更新规则迈进

Mamba之后是什么？朝着更具表现力的递归更新规则迈进

专知会员服务

15+阅读 · 2025年1月18日

《视觉中的Mamba：技术与应用》全面综述

《视觉中的Mamba：技术与应用》全面综述

专知会员服务

37+阅读 · 2024年10月7日

Mamba 架构在医学图像分析中的全面综述：分类、分割、重建及其他应用

Mamba 架构在医学图像分析中的全面综述：分类、分割、重建及其他应用

专知会员服务

29+阅读 · 2024年10月4日

大模型上下文长度扩展中的检索增强技术简述

大模型上下文长度扩展中的检索增强技术简述

专知会员服务

28+阅读 · 2024年7月5日

【CVPR2024】MA-LMM: 内存增强的大型多模态模型，用于长期视频理解

【CVPR2024】MA-LMM: 内存增强的大型多模态模型，用于长期视频理解

专知会员服务

21+阅读 · 2024年4月9日

【CVPR2024】预训练的视觉和语言变换器是少样本增量学习器

【CVPR2024】预训练的视觉和语言变换器是少样本增量学习器

专知会员服务

21+阅读 · 2024年4月7日

《多智能体深度强化学习模型中动作序列的解释》AAMAS 2023

《多智能体深度强化学习模型中动作序列的解释》AAMAS 2023

专知会员服务

30+阅读 · 2023年6月18日

最新综述：速览Transformer长文本建模研究进展

最新综述：速览Transformer长文本建模研究进展

专知会员服务

46+阅读 · 2023年3月15日

【ICML2021】PoolingFormer：具有池化注意力机制的长序列输入模型

专知会员服务

35+阅读 · 2021年7月25日

【AAAI2020论文-腾讯】通过稠密边界发生器快速学习时间动作方案（Fast Learning of Temporal Action Proposal via Dense Boundary Generator）

【AAAI2020论文-腾讯】通过稠密边界发生器快速学习时间动作方案（Fast Learning of Temporal Action Proposal via Dense Boundary Generator）

专知会员服务

12+阅读 · 2019年11月15日

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

专知

11+阅读 · 2020年3月17日

多智能体强化学习（MARL）近年研究概览

多智能体强化学习（MARL）近年研究概览

PaperWeekly

38+阅读 · 2020年3月15日

【Amazon】使用预训练Transformer模型进行数据增强

【Amazon】使用预训练Transformer模型进行数据增强

专知

12+阅读 · 2020年3月6日

SemanticAdv：基于语义属性的对抗样本生成方法

SemanticAdv：基于语义属性的对抗样本生成方法

机器之心

14+阅读 · 2019年7月12日

超越 BERT 和 GPT，微软亚洲研究院开源新模型 MASS！

超越 BERT 和 GPT，微软亚洲研究院开源新模型 MASS！

雷锋网

10+阅读 · 2019年6月27日

学界 | 超越 BERT 和 GPT，微软亚洲研究院开源新模型 MASS！

学界 | 超越 BERT 和 GPT，微软亚洲研究院开源新模型 MASS！

AI科技评论

18+阅读 · 2019年6月25日

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

机器之心

15+阅读 · 2019年3月18日

谷歌升级版Transformer官方解读：更大、更强，解决长文本问题（开源）

谷歌升级版Transformer官方解读：更大、更强，解决长文本问题（开源）

新智元

19+阅读 · 2019年1月30日

学界 | CVPR 2018论文解读：让神经网络学习比较来实现少样本学习

学界 | CVPR 2018论文解读：让神经网络学习比较来实现少样本学习

AI科技评论

14+阅读 · 2018年4月5日

自然语言处理中的Attention Model：是什么及为什么

自然语言处理中的Attention Model：是什么及为什么

新智元

11+阅读 · 2017年7月13日

基于反馈型级联连接模型的多模态语义SFM方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于序号调制的MIMO-OFDM系统容量增强技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

具有大线性复杂度的最优部分汉明相关跳频序列集的构造研究

国家自然科学基金

0+阅读 · 2015年12月31日

miR-382调控在椎间盘退变中的作用研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于稀疏表示和低秩矩阵分解的鲁棒人脸识别研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于深度学习和马尔科夫逻辑网络的特殊视频识别研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于压缩感知的MCSAR三维高分辨率快速成像研究

国家自然科学基金

0+阅读 · 2015年12月31日

扩展工作条件下基于核免疫集成的SAR目标识别关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

三维MOFs-贵金属复合物在表面增强拉曼散射中的传感效能研究

国家自然科学基金

0+阅读 · 2015年12月31日

结合图像块联合聚类加权和混合分类器的非对齐稀疏表示识别方法

国家自然科学基金

1+阅读 · 2015年12月31日

MASS-RAG: Multi-Agent Synthesis Retrieval-Augmented Generation

Arxiv

0+阅读 · 4月20日

MAMMA: Markerless & Automatic Multi-Person Motion Action Capture

Arxiv

0+阅读 · 4月7日

Mambalaya: Einsum-Based Fusion Optimizations on State-Space Models

Arxiv

0+阅读 · 4月4日

Otter: Mitigating Background Distractions of Wide-Angle Few-Shot Action Recognition with Enhanced RWKV

Arxiv

0+阅读 · 3月19日

SOAP: Enhancing Spatio-Temporal Relation and Motion Information Capturing for Few-Shot Action Recognition

Arxiv

0+阅读 · 3月18日

S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight

S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight

Arxiv

0+阅读 · 3月18日

DUET: Disaggregated Hybrid Mamba-Transformer LLMs with Prefill and Decode-Specific Packages

Arxiv

0+阅读 · 3月16日

Mamba Neural Operator: Who Wins? Transformers vs. State-Space Models for PDEs

Arxiv

0+阅读 · 3月11日

MaBERT:A Padding Safe Interleaved Transformer Mamba Hybrid Encoder for Efficient Extended Context Masked Language Modeling

Arxiv

0+阅读 · 3月3日

VEMamba: Efficient Isotropic Reconstruction of Volume Electron Microscopy with Axial-Lateral Consistent Mamba

Arxiv

0+阅读 · 3月1日

VIP会员

文章信息

相关主题

最新内容

【ICML 2026】面向视野外操作的VLA空间记忆框架SOMA

【ICML 2026】面向视野外操作的VLA空间记忆框架SOMA

专知会员服务

0+阅读 · 5月22日

【综述】大语言模型驱动的多模态情感识别综述：挑战、分类与未来方向

【综述】大语言模型驱动的多模态情感识别综述：挑战、分类与未来方向

专知会员服务

0+阅读 · 5月22日

安杜里尔与Meta研发军用智能眼镜的内幕

安杜里尔与Meta研发军用智能眼镜的内幕

专知会员服务

5+阅读 · 5月22日

《GPS拒止环境中的网络化赋能目标锁定》总结报告

《GPS拒止环境中的网络化赋能目标锁定》总结报告

专知会员服务

4+阅读 · 5月22日

超越步调威胁：整合人工智能以加速指挥决策

超越步调威胁：整合人工智能以加速指挥决策

专知会员服务

7+阅读 · 5月22日

连接供应链与杀伤链：Palantir 保障与对抗性后勤解决方案

连接供应链与杀伤链：Palantir 保障与对抗性后勤解决方案

专知会员服务

4+阅读 · 5月22日

Nature三连发AI自主科学发现论文

Nature三连发AI自主科学发现论文

专知会员服务

8+阅读 · 5月21日

【综述】大型音频语言模型综述：泛化、可信与未来展望

【综述】大型音频语言模型综述：泛化、可信与未来展望

专知会员服务

8+阅读 · 5月21日

安杜里尔与人工智能驱动防务的崛起

安杜里尔与人工智能驱动防务的崛起

专知会员服务

14+阅读 · 5月21日

《人工智能战争机器：安杜里尔与创新的武器化》36页报告

《人工智能战争机器：安杜里尔与创新的武器化》36页报告

专知会员服务

23+阅读 · 5月21日

《Palantir对联合全域指挥控制（JADC2）的支持能力》

《Palantir对联合全域指挥控制（JADC2）的支持能力》

专知会员服务

16+阅读 · 5月21日

《用于美海军作战力量战略部署与分散（SLD）的大规模人工智能（AI）》简报

《用于美海军作战力量战略部署与分散（SLD）的大规模人工智能（AI）》简报

专知会员服务

12+阅读 · 5月21日

《数字景观军事演示：AI决策系统的虚拟呈现——Palantir TITAN和 Anduril Lattice系统分析》

《数字景观军事演示：AI决策系统的虚拟呈现——Palantir TITAN和 Anduril Lattice系统分析》

专知会员服务

22+阅读 · 5月21日

《Palantir平台：FOUNDRY与AIP服务定义文档》

《Palantir平台：FOUNDRY与AIP服务定义文档》

专知会员服务

15+阅读 · 5月21日

2025年科学计算行业发展研究报告

2025年科学计算行业发展研究报告

专知会员服务

9+阅读 · 5月20日

相关VIP内容

Mamba之后是什么？朝着更具表现力的递归更新规则迈进

Mamba之后是什么？朝着更具表现力的递归更新规则迈进

专知会员服务

15+阅读 · 2025年1月18日

《视觉中的Mamba：技术与应用》全面综述

《视觉中的Mamba：技术与应用》全面综述

专知会员服务

37+阅读 · 2024年10月7日

Mamba 架构在医学图像分析中的全面综述：分类、分割、重建及其他应用

Mamba 架构在医学图像分析中的全面综述：分类、分割、重建及其他应用

专知会员服务

29+阅读 · 2024年10月4日

大模型上下文长度扩展中的检索增强技术简述

大模型上下文长度扩展中的检索增强技术简述

专知会员服务

28+阅读 · 2024年7月5日

【CVPR2024】MA-LMM: 内存增强的大型多模态模型，用于长期视频理解

【CVPR2024】MA-LMM: 内存增强的大型多模态模型，用于长期视频理解

专知会员服务

21+阅读 · 2024年4月9日

【CVPR2024】预训练的视觉和语言变换器是少样本增量学习器

【CVPR2024】预训练的视觉和语言变换器是少样本增量学习器

专知会员服务

21+阅读 · 2024年4月7日

《多智能体深度强化学习模型中动作序列的解释》AAMAS 2023

《多智能体深度强化学习模型中动作序列的解释》AAMAS 2023

专知会员服务

30+阅读 · 2023年6月18日

最新综述：速览Transformer长文本建模研究进展

最新综述：速览Transformer长文本建模研究进展

专知会员服务

46+阅读 · 2023年3月15日

【ICML2021】PoolingFormer：具有池化注意力机制的长序列输入模型

专知会员服务

35+阅读 · 2021年7月25日

【AAAI2020论文-腾讯】通过稠密边界发生器快速学习时间动作方案（Fast Learning of Temporal Action Proposal via Dense Boundary Generator）

【AAAI2020论文-腾讯】通过稠密边界发生器快速学习时间动作方案（Fast Learning of Temporal Action Proposal via Dense Boundary Generator）

专知会员服务

12+阅读 · 2019年11月15日

热门VIP内容

开通专知VIP会员享更多权益服务

【综述】大语言模型驱动的多模态情感识别综述：挑战、分类与未来方向

《GPS拒止环境中的网络化赋能目标锁定》总结报告

【ICML 2026】面向视野外操作的VLA空间记忆框架SOMA

安杜里尔与Meta研发军用智能眼镜的内幕

相关资讯

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

专知

11+阅读 · 2020年3月17日

多智能体强化学习（MARL）近年研究概览

多智能体强化学习（MARL）近年研究概览

PaperWeekly

38+阅读 · 2020年3月15日

【Amazon】使用预训练Transformer模型进行数据增强

【Amazon】使用预训练Transformer模型进行数据增强

专知

12+阅读 · 2020年3月6日

SemanticAdv：基于语义属性的对抗样本生成方法

SemanticAdv：基于语义属性的对抗样本生成方法

机器之心

14+阅读 · 2019年7月12日

超越 BERT 和 GPT，微软亚洲研究院开源新模型 MASS！

超越 BERT 和 GPT，微软亚洲研究院开源新模型 MASS！

雷锋网

10+阅读 · 2019年6月27日

学界 | 超越 BERT 和 GPT，微软亚洲研究院开源新模型 MASS！

学界 | 超越 BERT 和 GPT，微软亚洲研究院开源新模型 MASS！

AI科技评论

18+阅读 · 2019年6月25日

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

机器之心

15+阅读 · 2019年3月18日

谷歌升级版Transformer官方解读：更大、更强，解决长文本问题（开源）

谷歌升级版Transformer官方解读：更大、更强，解决长文本问题（开源）

新智元

19+阅读 · 2019年1月30日

学界 | CVPR 2018论文解读：让神经网络学习比较来实现少样本学习

学界 | CVPR 2018论文解读：让神经网络学习比较来实现少样本学习

AI科技评论

14+阅读 · 2018年4月5日

自然语言处理中的Attention Model：是什么及为什么

自然语言处理中的Attention Model：是什么及为什么

新智元

11+阅读 · 2017年7月13日

相关论文

MASS-RAG: Multi-Agent Synthesis Retrieval-Augmented Generation

Arxiv

0+阅读 · 4月20日

MAMMA: Markerless & Automatic Multi-Person Motion Action Capture

Arxiv

0+阅读 · 4月7日

Mambalaya: Einsum-Based Fusion Optimizations on State-Space Models

Arxiv

0+阅读 · 4月4日

Otter: Mitigating Background Distractions of Wide-Angle Few-Shot Action Recognition with Enhanced RWKV

Arxiv

0+阅读 · 3月19日

SOAP: Enhancing Spatio-Temporal Relation and Motion Information Capturing for Few-Shot Action Recognition

Arxiv

0+阅读 · 3月18日

S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight

S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight

Arxiv

0+阅读 · 3月18日

DUET: Disaggregated Hybrid Mamba-Transformer LLMs with Prefill and Decode-Specific Packages

Arxiv

0+阅读 · 3月16日

Mamba Neural Operator: Who Wins? Transformers vs. State-Space Models for PDEs

Arxiv

0+阅读 · 3月11日

MaBERT:A Padding Safe Interleaved Transformer Mamba Hybrid Encoder for Efficient Extended Context Masked Language Modeling

Arxiv

0+阅读 · 3月3日

VEMamba: Efficient Isotropic Reconstruction of Volume Electron Microscopy with Axial-Lateral Consistent Mamba

Arxiv

0+阅读 · 3月1日

相关基金

基于反馈型级联连接模型的多模态语义SFM方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于序号调制的MIMO-OFDM系统容量增强技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

具有大线性复杂度的最优部分汉明相关跳频序列集的构造研究

国家自然科学基金

0+阅读 · 2015年12月31日

miR-382调控在椎间盘退变中的作用研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于稀疏表示和低秩矩阵分解的鲁棒人脸识别研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于深度学习和马尔科夫逻辑网络的特殊视频识别研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于压缩感知的MCSAR三维高分辨率快速成像研究

国家自然科学基金

0+阅读 · 2015年12月31日

扩展工作条件下基于核免疫集成的SAR目标识别关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

三维MOFs-贵金属复合物在表面增强拉曼散射中的传感效能研究

国家自然科学基金

0+阅读 · 2015年12月31日

结合图像块联合聚类加权和混合分类器的非对齐稀疏表示识别方法

国家自然科学基金

1+阅读 · 2015年12月31日

微信扫码咨询专知VIP会员