Performance Comparison of CNN and AST Models with Stacked Features for Environmental Sound Classification - 专知论文

会员服务 ·

0

堆叠 · CNN · 声音分类 · 预训练 · 频谱 ·

Performance Comparison of CNN and AST Models with Stacked Features for Environmental Sound Classification

翻译：基于堆叠特征的CNN与AST模型在环境声音分类中的性能比较

Parinaz Binandeh Dehaghania,Danilo Penab,A. Pedro Aguiar

from arxiv, 7 pages, 1 figure

Environmental sound classification (ESC) has gained significant attention due to its diverse applications in smart city monitoring, fault detection, acoustic surveillance, and manufacturing quality control. To enhance CNN performance, feature stacking techniques have been explored to aggregate complementary acoustic descriptors into richer input representations. In this paper, we investigate CNN-based models employing various stacked feature combinations, including Log-Mel Spectrogram (LM), Spectral Contrast (SPC), Chroma (CH), Tonnetz (TZ), Mel-Frequency Cepstral Coefficients (MFCCs), and Gammatone Cepstral Coefficients (GTCC). Experiments are conducted on the widely used ESC-50 and UrbanSound8K datasets under different training regimes, including pretraining on ESC-50, fine-tuning on UrbanSound8K, and comparison with Audio Spectrogram Transformer (AST) models pretrained on large-scale corpora such as AudioSet. This experimental design enables an analysis of how feature-stacked CNNs compare with transformer-based models under varying levels of training data and pretraining diversity. The results indicate that feature-stacked CNNs offer a more computationally and data-efficient alternative when large-scale pretraining or extensive training data are unavailable, making them particularly well suited for resource-constrained and edge-level sound classification scenarios.

翻译：环境声音分类（ESC）因其在智慧城市监测、故障检测、声学监控和制造质量控制等领域的广泛应用而受到极大关注。为提升CNN性能，特征堆叠技术被用于将互补的声学描述子聚合为更丰富的输入表示。本文研究了采用多种堆叠特征组合的CNN模型，包括对数梅尔频谱（LM）、谱对比度（SPC）、色度特征（CH）、调性网格（TZ）、梅尔频率倒谱系数（MFCCs）和伽马通倒谱系数（GTCC）。实验在广泛使用的ESC-50和UrbanSound8K数据集上进行，采用不同训练策略，包括在ESC-50上的预训练、在UrbanSound8K上的微调，以及与基于大规模语料库（如AudioSet）预训练的音频频谱Transformer（AST）模型进行对比。该实验设计能够分析在不同训练数据规模和预训练多样性的条件下，基于特征堆叠的CNN与基于Transformer的模型之间的性能差异。结果表明，当大规模预训练或大量训练数据不可用时，特征堆叠CNN提供了计算和数据效率更高的替代方案，使其特别适用于资源受限和边缘端声音分类场景。

0

相关内容

医学图像分割中的通用模型：与任务特定方法的综述与性能比较

医学图像分割中的通用模型：与任务特定方法的综述与性能比较

专知会员服务

13+阅读 · 2025年6月13日

《深度学习技术在海战舰船声景分类中的应用研究》最新63页

《深度学习技术在海战舰船声景分类中的应用研究》最新63页

专知会员服务

26+阅读 · 2025年5月20日

军事目标分类《利用相邻视频帧提高卷积神经网络在压力环境下的分类鲁棒性》美陆军2023最新报告

军事目标分类《利用相邻视频帧提高卷积神经网络在压力环境下的分类鲁棒性》美陆军2023最新报告

专知会员服务

25+阅读 · 2023年9月7日

【深度迁移学习在图像分类中的应用综述】Deep transfer learning for image classification: a survey

【深度迁移学习在图像分类中的应用综述】Deep transfer learning for image classification: a survey

专知会员服务

25+阅读 · 2022年5月24日

图像分类的深度卷积神经网络模型综述

图像分类的深度卷积神经网络模型综述

专知会员服务

57+阅读 · 2021年10月29日

CNN/MLP/Transformer, 究竟谁行？中科大&微软实证三大网络结构公平比较，各有可取之处

专知会员服务

34+阅读 · 2021年9月18日

【上海交大】可解释CNN的对象分类，Interpretable CNNs for Object Classification

专知会员服务

54+阅读 · 2020年3月14日

【上海交通大学-张拳石】可解释CNN，Interpretable CNNs for Object Classification

【上海交通大学-张拳石】可解释CNN，Interpretable CNNs for Object Classification

专知会员服务

46+阅读 · 2020年3月13日

【AAAI2020-清华大学】张量图卷积网络文本分类，Tensor Graph Convolutional Networks for Text Classification

【AAAI2020-清华大学】张量图卷积网络文本分类，Tensor Graph Convolutional Networks for Text Classification

专知会员服务

76+阅读 · 2020年1月16日

【论文】深度卷积神经网络的ImageNet分类（ImageNet Classification with Deep Convolutional Neural Networks）

【论文】深度卷积神经网络的ImageNet分类（ImageNet Classification with Deep Convolutional Neural Networks）

专知会员服务

14+阅读 · 2020年1月1日

直白介绍卷积神经网络（CNN）

直白介绍卷积神经网络（CNN）

算法与数学之美

13+阅读 · 2019年1月23日

【干货】李沐等人：CNN图像分类Trick合集（附详细代码）

【干货】李沐等人：CNN图像分类Trick合集（附详细代码）

GAN生成式对抗网络

58+阅读 · 2018年12月11日

李沐等人：CNN图像分类Trick合集（附详细代码）

李沐等人：CNN图像分类Trick合集（附详细代码）

专知

12+阅读 · 2018年12月11日

CNN与RNN中文文本分类-基于TensorFlow 实现

CNN与RNN中文文本分类-基于TensorFlow 实现

七月在线实验室

13+阅读 · 2018年10月30日

关于CNN图像分类的一份综合设计指南

关于CNN图像分类的一份综合设计指南

云栖社区

11+阅读 · 2018年5月15日

CNN(卷积神经网络)、RNN(循环神经网络)、DNN(深度神经网络)概念区分理解

CNN(卷积神经网络)、RNN(循环神经网络)、DNN(深度神经网络)概念区分理解

数据挖掘入门与实战

33+阅读 · 2018年2月12日

从R-CNN到Mask R-CNN！

从R-CNN到Mask R-CNN！

全球人工智能

17+阅读 · 2017年11月13日

开源｜基于tensorflow使用CNN-RNN进行中文文本分类！

开源｜基于tensorflow使用CNN-RNN进行中文文本分类！

全球人工智能

11+阅读 · 2017年11月12日

CNN 模型压缩与加速算法综述

CNN 模型压缩与加速算法综述

机器学习研究会

16+阅读 · 2017年8月25日

CNN、RNN在自动特征提取中的应用

CNN、RNN在自动特征提取中的应用

乌镇智库

14+阅读 · 2017年8月4日

基于多元数据分析的城市开放空间声景品质景观影响要素提取与评价

国家自然科学基金

0+阅读 · 2015年12月31日

抽样环境下基于流记录的行为特征分析与多分类器识别模型研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于对象模型与多点空间统计的高分辨率遥感影像分类策略

国家自然科学基金

4+阅读 · 2015年12月31日

模糊认知集群优化的聚类算法

国家自然科学基金

9+阅读 · 2015年12月31日

面向光谱-空间特征集合的高光谱遥感影像度量学习与分类研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于聚类分析的高性能包分类技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

云南高原湿地生态环境音分类技术研究

国家自然科学基金

1+阅读 · 2014年12月31日

基于认知技术的分层异构网络能效分析与资源分配研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于膜算法的雷达辐射源信号聚类分选方法研究

国家自然科学基金

1+阅读 · 2014年12月31日

语音识别中的稀疏性深度学习

国家自然科学基金

11+阅读 · 2012年12月31日

Spectrogram features for audio and speech analysis

Spectrogram features for audio and speech analysis

Arxiv

0+阅读 · 3月16日

Expectation and Acoustic Neural Network Representations Enhance Music Identification from Brain Activity

Arxiv

0+阅读 · 3月12日

Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification

Arxiv

0+阅读 · 2月23日

Mind the Gap: Detecting Cluster Exits for Robust Local Density-Based Score Normalization in Anomalous Sound Detection

Arxiv

0+阅读 · 2月21日

XAI-Driven Spectral Analysis of Cough Sounds for Respiratory Disease Characterization

Arxiv

0+阅读 · 2月17日

Learning Vocal-Tract Area and Radiation with a Physics-Informed Webster Model

Arxiv

0+阅读 · 2月14日

BioME: A Resource-Efficient Bioacoustic Foundational Model for IoT Applications

Arxiv

0+阅读 · 2月10日

AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders

Arxiv

0+阅读 · 2月6日

Reading Between the Waves: Robust Topic Segmentation Using Inter-Sentence Audio Features

Arxiv

0+阅读 · 2月6日

A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation

Arxiv

0+阅读 · 1月30日

VIP会员

文章信息

相关主题

最新内容

大语言模型平台在国防情报应用中的对比

大语言模型平台在国防情报应用中的对比

专知会员服务

3+阅读 · 今天3:12

美陆军“增强任务分析”实验：将人工智能集成到军事决策流程中

美陆军“增强任务分析”实验：将人工智能集成到军事决策流程中

专知会员服务

4+阅读 · 今天3:00

《面向安全态势自适应决策的情报信息系统与机器学习算法研究》

《面向安全态势自适应决策的情报信息系统与机器学习算法研究》

专知会员服务

2+阅读 · 今天2:56

《杀伤链中人类判断的终结？论AI智能体对主动权与解释权的重置》

《杀伤链中人类判断的终结？论AI智能体对主动权与解释权的重置》

专知会员服务

2+阅读 · 今天2:44

《仿真互操作性标准：实时平台参考联邦对象模型指南、原理与互操作性模式标准》300页

《仿真互操作性标准：实时平台参考联邦对象模型指南、原理与互操作性模式标准》300页

专知会员服务

4+阅读 · 今天2:37

《自主远程巡飞弹药打击系统的嵌入式人工智能感知框架》

《自主远程巡飞弹药打击系统的嵌入式人工智能感知框架》

专知会员服务

3+阅读 · 今天2:22

美海军“超配项目”

美海军“超配项目”

专知会员服务

4+阅读 · 今天2:13

《美陆军条例：陆军指挥政策（2026版）》

《美陆军条例：陆军指挥政策（2026版）》

专知会员服务

10+阅读 · 4月21日

《提升美军全域城市作战训练最佳实践的案例研究》366页

《提升美军全域城市作战训练最佳实践的案例研究》366页

专知会员服务

13+阅读 · 4月21日

《军用自主人工智能系统的治理与安全》

《军用自主人工智能系统的治理与安全》

专知会员服务

7+阅读 · 4月21日

美海军数字作战负责人：如何利用数据快速生成战斗力

美海军数字作战负责人：如何利用数据快速生成战斗力

专知会员服务

8+阅读 · 4月21日

《COOL模型（行动循环圈）：军事领导体系中的战役层级变革流程》

《COOL模型（行动循环圈）：军事领导体系中的战役层级变革流程》

专知会员服务

11+阅读 · 4月20日

《系统簇式多域作战规划范畴论框架》

《系统簇式多域作战规划范畴论框架》

专知会员服务

10+阅读 · 4月20日

《美国防部指令6130.03，第2卷服役医疗标准：保留》

《美国防部指令6130.03，第2卷服役医疗标准：保留》

专知会员服务

6+阅读 · 4月20日

《美国防部指令6130.03，第1卷服役医疗标准：任命、征募或征召》

《美国防部指令6130.03，第1卷服役医疗标准：任命、征募或征召》

专知会员服务

4+阅读 · 4月20日

相关VIP内容

医学图像分割中的通用模型：与任务特定方法的综述与性能比较

医学图像分割中的通用模型：与任务特定方法的综述与性能比较

专知会员服务

13+阅读 · 2025年6月13日

《深度学习技术在海战舰船声景分类中的应用研究》最新63页

《深度学习技术在海战舰船声景分类中的应用研究》最新63页

专知会员服务

26+阅读 · 2025年5月20日

军事目标分类《利用相邻视频帧提高卷积神经网络在压力环境下的分类鲁棒性》美陆军2023最新报告

军事目标分类《利用相邻视频帧提高卷积神经网络在压力环境下的分类鲁棒性》美陆军2023最新报告

专知会员服务

25+阅读 · 2023年9月7日

【深度迁移学习在图像分类中的应用综述】Deep transfer learning for image classification: a survey

【深度迁移学习在图像分类中的应用综述】Deep transfer learning for image classification: a survey

专知会员服务

25+阅读 · 2022年5月24日

图像分类的深度卷积神经网络模型综述

图像分类的深度卷积神经网络模型综述

专知会员服务

57+阅读 · 2021年10月29日

CNN/MLP/Transformer, 究竟谁行？中科大&微软实证三大网络结构公平比较，各有可取之处

专知会员服务

34+阅读 · 2021年9月18日

【上海交大】可解释CNN的对象分类，Interpretable CNNs for Object Classification

专知会员服务

54+阅读 · 2020年3月14日

【上海交通大学-张拳石】可解释CNN，Interpretable CNNs for Object Classification

【上海交通大学-张拳石】可解释CNN，Interpretable CNNs for Object Classification

专知会员服务

46+阅读 · 2020年3月13日

【AAAI2020-清华大学】张量图卷积网络文本分类，Tensor Graph Convolutional Networks for Text Classification

【AAAI2020-清华大学】张量图卷积网络文本分类，Tensor Graph Convolutional Networks for Text Classification

专知会员服务

76+阅读 · 2020年1月16日

【论文】深度卷积神经网络的ImageNet分类（ImageNet Classification with Deep Convolutional Neural Networks）

【论文】深度卷积神经网络的ImageNet分类（ImageNet Classification with Deep Convolutional Neural Networks）

专知会员服务

14+阅读 · 2020年1月1日

热门VIP内容

开通专知VIP会员享更多权益服务

美陆军“增强任务分析”实验：将人工智能集成到军事决策流程中

《杀伤链中人类判断的终结？论AI智能体对主动权与解释权的重置》

大语言模型平台在国防情报应用中的对比

《面向安全态势自适应决策的情报信息系统与机器学习算法研究》

相关资讯

直白介绍卷积神经网络（CNN）

直白介绍卷积神经网络（CNN）

算法与数学之美

13+阅读 · 2019年1月23日

【干货】李沐等人：CNN图像分类Trick合集（附详细代码）

【干货】李沐等人：CNN图像分类Trick合集（附详细代码）

GAN生成式对抗网络

58+阅读 · 2018年12月11日

李沐等人：CNN图像分类Trick合集（附详细代码）

李沐等人：CNN图像分类Trick合集（附详细代码）

专知

12+阅读 · 2018年12月11日

CNN与RNN中文文本分类-基于TensorFlow 实现

CNN与RNN中文文本分类-基于TensorFlow 实现

七月在线实验室

13+阅读 · 2018年10月30日

关于CNN图像分类的一份综合设计指南

关于CNN图像分类的一份综合设计指南

云栖社区

11+阅读 · 2018年5月15日

CNN(卷积神经网络)、RNN(循环神经网络)、DNN(深度神经网络)概念区分理解

CNN(卷积神经网络)、RNN(循环神经网络)、DNN(深度神经网络)概念区分理解

数据挖掘入门与实战

33+阅读 · 2018年2月12日

从R-CNN到Mask R-CNN！

从R-CNN到Mask R-CNN！

全球人工智能

17+阅读 · 2017年11月13日

开源｜基于tensorflow使用CNN-RNN进行中文文本分类！

开源｜基于tensorflow使用CNN-RNN进行中文文本分类！

全球人工智能

11+阅读 · 2017年11月12日

CNN 模型压缩与加速算法综述

CNN 模型压缩与加速算法综述

机器学习研究会

16+阅读 · 2017年8月25日

CNN、RNN在自动特征提取中的应用

CNN、RNN在自动特征提取中的应用

乌镇智库

14+阅读 · 2017年8月4日

相关论文

Spectrogram features for audio and speech analysis

Spectrogram features for audio and speech analysis

Arxiv

0+阅读 · 3月16日

Expectation and Acoustic Neural Network Representations Enhance Music Identification from Brain Activity

Arxiv

0+阅读 · 3月12日

Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification

Arxiv

0+阅读 · 2月23日

Mind the Gap: Detecting Cluster Exits for Robust Local Density-Based Score Normalization in Anomalous Sound Detection

Arxiv

0+阅读 · 2月21日

XAI-Driven Spectral Analysis of Cough Sounds for Respiratory Disease Characterization

Arxiv

0+阅读 · 2月17日

Learning Vocal-Tract Area and Radiation with a Physics-Informed Webster Model

Arxiv

0+阅读 · 2月14日

BioME: A Resource-Efficient Bioacoustic Foundational Model for IoT Applications

Arxiv

0+阅读 · 2月10日

AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders

Arxiv

0+阅读 · 2月6日

Reading Between the Waves: Robust Topic Segmentation Using Inter-Sentence Audio Features

Arxiv

0+阅读 · 2月6日

A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation

Arxiv

0+阅读 · 1月30日

相关基金

基于多元数据分析的城市开放空间声景品质景观影响要素提取与评价

国家自然科学基金

0+阅读 · 2015年12月31日

抽样环境下基于流记录的行为特征分析与多分类器识别模型研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于对象模型与多点空间统计的高分辨率遥感影像分类策略

国家自然科学基金

4+阅读 · 2015年12月31日

模糊认知集群优化的聚类算法

国家自然科学基金

9+阅读 · 2015年12月31日

面向光谱-空间特征集合的高光谱遥感影像度量学习与分类研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于聚类分析的高性能包分类技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

云南高原湿地生态环境音分类技术研究

国家自然科学基金

1+阅读 · 2014年12月31日

基于认知技术的分层异构网络能效分析与资源分配研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于膜算法的雷达辐射源信号聚类分选方法研究

国家自然科学基金

1+阅读 · 2014年12月31日

语音识别中的稀疏性深度学习

国家自然科学基金

11+阅读 · 2012年12月31日

微信扫码咨询专知VIP会员