BNMusic: Blending Environmental Noises into Personalized Music - 专知论文

会员服务 ·

0

噪声 · 音乐 · 环境噪声 · 低噪声 · 频谱 ·

BNMusic: Blending Environmental Noises into Personalized Music

翻译：BNMusic：将环境噪声融入个性化音乐

Chi Zuo,Martin B. Møller,Pablo Martínez-Nuevo,Huayang Huang,Yu Wu,Ye Zhu

from arxiv, This paper has been accepted by NeurIPS 2025

While being disturbed by environmental noises, the acoustic masking technique is a conventional way to reduce the annoyance in audio engineering that seeks to cover up the noises with other dominant yet less intrusive sounds. However, misalignment between the dominant sound and the noise-such as mismatched downbeats-often requires an excessive volume increase to achieve effective masking. Motivated by recent advances in cross-modal generation, in this work, we introduce an alternative method to acoustic masking, aiming to reduce the noticeability of environmental noises by blending them into personalized music generated based on user-provided text prompts. Following the paradigm of music generation using mel-spectrogram representations, we propose a Blending Noises into Personalized Music (BNMusic) framework with two key stages. The first stage synthesizes a complete piece of music in a mel-spectrogram representation that encapsulates the musical essence of the noise. In the second stage, we adaptively amplify the generated music segment to further reduce noise perception and enhance the blending effectiveness, while preserving auditory quality. Our experiments with comprehensive evaluations on MusicBench, EPIC-SOUNDS, and ESC-50 demonstrate the effectiveness of our framework, highlighting the ability to blend environmental noise with rhythmically aligned, adaptively amplified, and enjoyable music segments, minimizing the noticeability of the noise, thereby improving overall acoustic experiences. Project page: https://d-fas.github.io/BNMusic_page/.

翻译：在受到环境噪声干扰时，声学掩蔽技术是音频工程中一种传统的降噪方法，旨在用其他更具主导性但侵扰性较低的声音来覆盖噪声。然而，主导声与噪声之间的不匹配——例如节拍错位——通常需要过度增大音量才能实现有效掩蔽。受跨模态生成领域最新进展的启发，本文提出了一种替代声学掩蔽的方法，旨在通过将环境噪声融入基于用户提供的文本提示生成的个性化音乐中，从而降低噪声的可察觉性。遵循使用梅尔频谱图表示进行音乐生成的范式，我们提出了一个将噪声融入个性化音乐（BNMusic）的框架，该框架包含两个关键阶段。第一阶段合成一首完整的音乐，其梅尔频谱图表示封装了噪声的音乐本质。在第二阶段，我们自适应地放大生成的音乐片段，以进一步降低噪声感知并增强融合效果，同时保持听觉质量。我们在MusicBench、EPIC-SOUNDS和ESC-50数据集上进行的综合评估实验证明了我们框架的有效性，突显了其能够将环境噪声与节奏对齐、自适应放大且令人愉悦的音乐片段相融合，从而最小化噪声的可察觉性，进而提升整体听觉体验。项目页面：https://d-fas.github.io/BNMusic_page/。

0

相关内容

【WWW2025】释放大型语言模型在去噪推荐中的强大能力

【WWW2025】释放大型语言模型在去噪推荐中的强大能力

专知会员服务

13+阅读 · 2025年2月18日

英伟达斯坦福CVPR2023等最新《去噪扩散模型：生成学习的大爆炸》教程，附300多页ppt

英伟达斯坦福CVPR2023等最新《去噪扩散模型：生成学习的大爆炸》教程，附300多页ppt

专知会员服务

54+阅读 · 2023年6月27日

去噪:有监督、自监督和无监督，57页ppt

去噪:有监督、自监督和无监督，57页ppt

专知会员服务

59+阅读 · 2023年5月3日

去噪扩散概率模型，46页ppt

去噪扩散概率模型，46页ppt

专知会员服务

63+阅读 · 2023年1月4日

【ICASSP 2022教程】声场估计:最新进展与应用，日本东京大学Shoichi Koyama博士

【ICASSP 2022教程】声场估计:最新进展与应用，日本东京大学Shoichi Koyama博士

专知会员服务

24+阅读 · 2022年6月7日

Google首席科学家Peyman 《图像去噪进展》斯坦福演讲报告，附视频与Slides

Google首席科学家Peyman 《图像去噪进展》斯坦福演讲报告，附视频与Slides

专知会员服务

38+阅读 · 2022年2月22日

图像去噪方法概述

专知会员服务

43+阅读 · 2021年8月30日

【Google Research】Wavesplit:通过说话者聚类实现端到端的语音分离，Wavesplit: End-to-End Speech Separation by Speaker Clustering

【Google Research】Wavesplit:通过说话者聚类实现端到端的语音分离，Wavesplit: End-to-End Speech Separation by Speaker Clustering

专知会员服务

19+阅读 · 2020年2月26日

【综述】图像去噪的深度学习:综述，36页pdf，Deep Learning on Image Denoising: An overview

【综述】图像去噪的深度学习:综述，36页pdf，Deep Learning on Image Denoising: An overview

专知会员服务

71+阅读 · 2019年12月31日

【ISMIR 2019】Generating Music with GANs: An Overview and Case Studies(GANs生成音乐：概述和案例研究)，中国科学院 Yi-Hsuan Yang

【ISMIR 2019】Generating Music with GANs: An Overview and Case Studies(GANs生成音乐：概述和案例研究)，中国科学院 Yi-Hsuan Yang

专知会员服务

23+阅读 · 2019年11月4日

图像去噪的深度学习最新综述论文，36页pdf，Deep Learning on Image Denoising

图像去噪的深度学习最新综述论文，36页pdf，Deep Learning on Image Denoising

专知

19+阅读 · 2020年1月6日

图像/视频去噪算法资源集锦

图像/视频去噪算法资源集锦

专知

19+阅读 · 2019年12月14日

用GANs来自动生成音乐【代码+PPT】

用GANs来自动生成音乐【代码+PPT】

专知

29+阅读 · 2019年11月7日

Deformable Kernels，用于图像/视频去噪，即将开源

Deformable Kernels，用于图像/视频去噪，即将开源

极市平台

13+阅读 · 2019年8月29日

使用 FastAI 和即时频率变换进行音频分类

使用 FastAI 和即时频率变换进行音频分类

AI研习社

11+阅读 · 2019年5月9日

语音情绪识别|声源增强|基频可视化

语音情绪识别|声源增强|基频可视化

深度学习每日摘要

15+阅读 · 2019年5月5日

近期声学领域前沿论文(No. 3)

近期声学领域前沿论文(No. 3)

深度学习每日摘要

24+阅读 · 2019年3月31日

干货 | Github项目推荐： GANSynth: 用GANs创作音乐

干货 | Github项目推荐： GANSynth: 用GANs创作音乐

AI科技评论

10+阅读 · 2019年3月2日

学界 | 现实版柯南「蝴蝶结变声器」：谷歌发布从声纹识别到多重声线语音合成的迁移学习

学界 | 现实版柯南「蝴蝶结变声器」：谷歌发布从声纹识别到多重声线语音合成的迁移学习

机器之心

11+阅读 · 2018年6月24日

图像降噪算法介绍及实现汇总

图像降噪算法介绍及实现汇总

极市平台

26+阅读 · 2018年1月3日

基于伴随方法、改进文化基因算法和kriging代理模型的涡扇发动机短舱减噪优化方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

冲击噪声与持续性稳态噪声混合条件下的有源控制研究

国家自然科学基金

0+阅读 · 2015年12月31日

用于音频子系统的自适应动态电源放大器新结构及其噪声抑制机制研究

国家自然科学基金

0+阅读 · 2015年12月31日

低频主动声纳双曲线调频串信号-接收处理联合设计研究

国家自然科学基金

1+阅读 · 2015年12月31日

封闭空间中声源辐射阻抗特性研究

国家自然科学基金

0+阅读 · 2015年12月31日

冲击噪声抑制技术的研究与应用

国家自然科学基金

0+阅读 · 2015年12月31日

有噪声纠缠比特的纠缠辅助量子纠错码研究

国家自然科学基金

0+阅读 · 2014年12月31日

配音演员的声音对广告效果的影响--基于机器学习的声音广告研究

国家自然科学基金

0+阅读 · 2014年12月31日

云南高原湿地生态环境音分类技术研究

国家自然科学基金

1+阅读 · 2014年12月31日

环境噪声对儿童影响及相应修复性环境的实验研究

国家自然科学基金

0+阅读 · 2014年12月31日

Artificial Noise Versus Artificial Noise Elimination: Redefining Scaling Laws of Physical Layer Security

Arxiv

0+阅读 · 3月10日

Noise-Aware Generalization: Robustness to In-Domain Noise and Out-of-Domain Generalization

Arxiv

0+阅读 · 2月22日

Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment

Arxiv

0+阅读 · 2月19日

Generative Audio Extension and Morphing

Arxiv

0+阅读 · 2月18日

AudioX: A Unified Framework for Anything-to-Audio Generation

Arxiv

0+阅读 · 2月14日

BioME: A Resource-Efficient Bioacoustic Foundational Model for IoT Applications

Arxiv

0+阅读 · 2月10日

GRAM: Spatial general-purpose audio representation models for real-world applications

Arxiv

0+阅读 · 2月4日

GRAM: Spatial general-purpose audio representations for real-world environments

Arxiv

0+阅读 · 2月4日

GRAM: Spatial general-purpose audio representations for real-world environments

Arxiv

0+阅读 · 2月3日

SSNAPS: Audio-Visual Separation of Speech and Background Noise with Diffusion Inverse Sampling

Arxiv

0+阅读 · 2月1日

VIP会员

文章信息

相关主题

最新内容

【斯坦福博士论文】语言模型的机械可解释性与控制

【斯坦福博士论文】语言模型的机械可解释性与控制

专知会员服务

0+阅读 · 今天13:13

大语言模型智能体长期记忆安全性综述：迈向记忆主权

大语言模型智能体长期记忆安全性综述：迈向记忆主权

专知会员服务

0+阅读 · 今天13:08

美军被摧毁的空战装备：伊朗战争如何重创美国空中力量

美军被摧毁的空战装备：伊朗战争如何重创美国空中力量

专知会员服务

3+阅读 · 今天7:11

人工智能赋能无人机：俄乌战争（万字长文）

人工智能赋能无人机：俄乌战争（万字长文）

专知会员服务

4+阅读 · 今天6:56

国外海军作战管理系统与作战训练系统

国外海军作战管理系统与作战训练系统

专知会员服务

2+阅读 · 今天4:16

美军条令《海军陆战队规划流程（2026版）》

美军条令《海军陆战队规划流程（2026版）》

专知会员服务

9+阅读 · 今天3:36

《压缩式分布式交互仿真标准》120页

《压缩式分布式交互仿真标准》120页

专知会员服务

4+阅读 · 今天3:21

《电子战数据交换模型研究报告》

《电子战数据交换模型研究报告》

专知会员服务

6+阅读 · 今天3:13

美军运用水下无人机与机器人系统竞速清除霍尔木兹海峡水雷

美军运用水下无人机与机器人系统竞速清除霍尔木兹海峡水雷

专知会员服务

4+阅读 · 今天2:55

《基于Transformer的异常舰船导航识别与跟踪》80页

《基于Transformer的异常舰船导航识别与跟踪》80页

专知会员服务

7+阅读 · 今天2:45

《美国太空系统司令部实验室原型作战管理系统的数据与决策可追溯性》

《美国太空系统司令部实验室原型作战管理系统的数据与决策可追溯性》

专知会员服务

6+阅读 · 今天2:41

《低数据领域军事目标检测模型研究》

《低数据领域军事目标检测模型研究》

专知会员服务

6+阅读 · 今天2:37

《为韧性而设计：在战略不确定时代提升军事空军基地的生存能力》

《为韧性而设计：在战略不确定时代提升军事空军基地的生存能力》

专知会员服务

6+阅读 · 今天2:32

【CMU博士论文】物理世界的视觉感知与深度理解

【CMU博士论文】物理世界的视觉感知与深度理解

专知会员服务

10+阅读 · 4月22日

多智能体系统：从经典范式到大基础模型驱动的未来

多智能体系统：从经典范式到大基础模型驱动的未来

专知会员服务

17+阅读 · 4月22日

相关VIP内容

【WWW2025】释放大型语言模型在去噪推荐中的强大能力

【WWW2025】释放大型语言模型在去噪推荐中的强大能力

专知会员服务

13+阅读 · 2025年2月18日

英伟达斯坦福CVPR2023等最新《去噪扩散模型：生成学习的大爆炸》教程，附300多页ppt

英伟达斯坦福CVPR2023等最新《去噪扩散模型：生成学习的大爆炸》教程，附300多页ppt

专知会员服务

54+阅读 · 2023年6月27日

去噪:有监督、自监督和无监督，57页ppt

去噪:有监督、自监督和无监督，57页ppt

专知会员服务

59+阅读 · 2023年5月3日

去噪扩散概率模型，46页ppt

去噪扩散概率模型，46页ppt

专知会员服务

63+阅读 · 2023年1月4日

【ICASSP 2022教程】声场估计:最新进展与应用，日本东京大学Shoichi Koyama博士

【ICASSP 2022教程】声场估计:最新进展与应用，日本东京大学Shoichi Koyama博士

专知会员服务

24+阅读 · 2022年6月7日

Google首席科学家Peyman 《图像去噪进展》斯坦福演讲报告，附视频与Slides

Google首席科学家Peyman 《图像去噪进展》斯坦福演讲报告，附视频与Slides

专知会员服务

38+阅读 · 2022年2月22日

图像去噪方法概述

专知会员服务

43+阅读 · 2021年8月30日

【Google Research】Wavesplit:通过说话者聚类实现端到端的语音分离，Wavesplit: End-to-End Speech Separation by Speaker Clustering

【Google Research】Wavesplit:通过说话者聚类实现端到端的语音分离，Wavesplit: End-to-End Speech Separation by Speaker Clustering

专知会员服务

19+阅读 · 2020年2月26日

【综述】图像去噪的深度学习:综述，36页pdf，Deep Learning on Image Denoising: An overview

【综述】图像去噪的深度学习:综述，36页pdf，Deep Learning on Image Denoising: An overview

专知会员服务

71+阅读 · 2019年12月31日

【ISMIR 2019】Generating Music with GANs: An Overview and Case Studies(GANs生成音乐：概述和案例研究)，中国科学院 Yi-Hsuan Yang

【ISMIR 2019】Generating Music with GANs: An Overview and Case Studies(GANs生成音乐：概述和案例研究)，中国科学院 Yi-Hsuan Yang

专知会员服务

23+阅读 · 2019年11月4日

热门VIP内容

开通专知VIP会员享更多权益服务

大语言模型智能体长期记忆安全性综述：迈向记忆主权

人工智能赋能无人机：俄乌战争（万字长文）

【斯坦福博士论文】语言模型的机械可解释性与控制

美军被摧毁的空战装备：伊朗战争如何重创美国空中力量

相关资讯

图像去噪的深度学习最新综述论文，36页pdf，Deep Learning on Image Denoising

图像去噪的深度学习最新综述论文，36页pdf，Deep Learning on Image Denoising

专知

19+阅读 · 2020年1月6日

图像/视频去噪算法资源集锦

图像/视频去噪算法资源集锦

专知

19+阅读 · 2019年12月14日

用GANs来自动生成音乐【代码+PPT】

用GANs来自动生成音乐【代码+PPT】

专知

29+阅读 · 2019年11月7日

Deformable Kernels，用于图像/视频去噪，即将开源

Deformable Kernels，用于图像/视频去噪，即将开源

极市平台

13+阅读 · 2019年8月29日

使用 FastAI 和即时频率变换进行音频分类

使用 FastAI 和即时频率变换进行音频分类

AI研习社

11+阅读 · 2019年5月9日

语音情绪识别|声源增强|基频可视化

语音情绪识别|声源增强|基频可视化

深度学习每日摘要

15+阅读 · 2019年5月5日

近期声学领域前沿论文(No. 3)

近期声学领域前沿论文(No. 3)

深度学习每日摘要

24+阅读 · 2019年3月31日

干货 | Github项目推荐： GANSynth: 用GANs创作音乐

干货 | Github项目推荐： GANSynth: 用GANs创作音乐

AI科技评论

10+阅读 · 2019年3月2日

学界 | 现实版柯南「蝴蝶结变声器」：谷歌发布从声纹识别到多重声线语音合成的迁移学习

学界 | 现实版柯南「蝴蝶结变声器」：谷歌发布从声纹识别到多重声线语音合成的迁移学习

机器之心

11+阅读 · 2018年6月24日

图像降噪算法介绍及实现汇总

图像降噪算法介绍及实现汇总

极市平台

26+阅读 · 2018年1月3日

相关论文

Artificial Noise Versus Artificial Noise Elimination: Redefining Scaling Laws of Physical Layer Security

Arxiv

0+阅读 · 3月10日

Noise-Aware Generalization: Robustness to In-Domain Noise and Out-of-Domain Generalization

Arxiv

0+阅读 · 2月22日

Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment

Arxiv

0+阅读 · 2月19日

Generative Audio Extension and Morphing

Arxiv

0+阅读 · 2月18日

AudioX: A Unified Framework for Anything-to-Audio Generation

Arxiv

0+阅读 · 2月14日

BioME: A Resource-Efficient Bioacoustic Foundational Model for IoT Applications

Arxiv

0+阅读 · 2月10日

GRAM: Spatial general-purpose audio representation models for real-world applications

Arxiv

0+阅读 · 2月4日

GRAM: Spatial general-purpose audio representations for real-world environments

Arxiv

0+阅读 · 2月4日

GRAM: Spatial general-purpose audio representations for real-world environments

Arxiv

0+阅读 · 2月3日

SSNAPS: Audio-Visual Separation of Speech and Background Noise with Diffusion Inverse Sampling

Arxiv

0+阅读 · 2月1日

相关基金

基于伴随方法、改进文化基因算法和kriging代理模型的涡扇发动机短舱减噪优化方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

冲击噪声与持续性稳态噪声混合条件下的有源控制研究

国家自然科学基金

0+阅读 · 2015年12月31日

用于音频子系统的自适应动态电源放大器新结构及其噪声抑制机制研究

国家自然科学基金

0+阅读 · 2015年12月31日

低频主动声纳双曲线调频串信号-接收处理联合设计研究

国家自然科学基金

1+阅读 · 2015年12月31日

封闭空间中声源辐射阻抗特性研究

国家自然科学基金

0+阅读 · 2015年12月31日

冲击噪声抑制技术的研究与应用

国家自然科学基金

0+阅读 · 2015年12月31日

有噪声纠缠比特的纠缠辅助量子纠错码研究

国家自然科学基金

0+阅读 · 2014年12月31日

配音演员的声音对广告效果的影响--基于机器学习的声音广告研究

国家自然科学基金

0+阅读 · 2014年12月31日

云南高原湿地生态环境音分类技术研究

国家自然科学基金

1+阅读 · 2014年12月31日

环境噪声对儿童影响及相应修复性环境的实验研究

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员