Interpretable Modeling of Articulatory Temporal Dynamics from real-time MRI for Phoneme Recognition - 专知论文

会员服务 ·

0

音素 · 磁共振 · 磁共振成像 · 识别 · 视频 ·

Interpretable Modeling of Articulatory Temporal Dynamics from real-time MRI for Phoneme Recognition

翻译：基于实时磁共振成像的发音时序动态可解释建模及其在音素识别中的应用

Jay Park,Hong Nguyen,Sean Foley,Jihwan Lee,Yoonjeong Lee,Dani Byrd,Shrikanth Narayanan

Real-time Magnetic Resonance Imaging (rtMRI) visualizes vocal tract action, offering a comprehensive window into speech articulation. However, its signals are high dimensional and noisy, hindering interpretation. We investigate compact representations of spatiotemporal articulatory dynamics for phoneme recognition from midsagittal vocal tract rtMRI videos. We compare three feature types: (1) raw video, (2) optical flow, and (3) six linguistically-relevant regions of interest (ROIs) for articulator movements. We evaluate models trained independently on each representation, as well as multi-feature combinations. Results show that multi-feature models consistently outperform single-feature baselines, with the lowest phoneme error rate (PER) of 0.34 obtained by combining ROI and raw video. Temporal fidelity experiments demonstrate a reliance on fine-grained articulatory dynamics, while ROI ablation studies reveal strong contributions from tongue and lips. Our findings highlight how rtMRI-derived features provide accuracy and interpretability, and establish strategies for leveraging articulatory data in speech processing.

翻译：实时磁共振成像（rtMRI）能够可视化声道动作，为语音发音过程提供了一个全面的观测窗口。然而，其信号具有高维且含噪声的特点，这阻碍了对其的解读。本研究针对从声道正中矢状面rtMRI视频中识别音素的任务，探索了发音时空动态的紧凑表示方法。我们比较了三种特征类型：（1）原始视频，（2）光流，以及（3）六个与发音器运动相关的语言学感兴趣区域（ROIs）。我们评估了基于每种表示独立训练的模型，以及多特征组合模型。结果表明，多特征模型始终优于单特征基线，其中ROI与原始视频组合获得了最低的音素错误率（PER）0.34。时序保真度实验证明了模型对细粒度发音动态的依赖，而ROI消融研究则揭示了舌头和嘴唇区域的重要贡献。我们的研究结果凸显了rtMRI衍生特征在提供准确性和可解释性方面的价值，并为在语音处理中利用发音数据确立了策略。

0

相关内容

【博士论文】面向真实世界音视联合语音识别的可扩展框架

【博士论文】面向真实世界音视联合语音识别的可扩展框架

专知会员服务

13+阅读 · 2025年12月19日

【普林斯顿博士论文】用于语音的生成式通用模型

【普林斯顿博士论文】用于语音的生成式通用模型

专知会员服务

19+阅读 · 2025年12月3日

【牛津博士论文】面向神经影像应用的可扩展且可解释的空间模型

【牛津博士论文】面向神经影像应用的可扩展且可解释的空间模型

专知会员服务

14+阅读 · 2025年8月3日

迈向可控语音合成：大语言模型时代的综述

迈向可控语音合成：大语言模型时代的综述

专知会员服务

24+阅读 · 2024年12月13日

大模型如何建模时序？莫纳什阿里等最新《面向时间序列和时空数据的大型模型》综述与展望

大模型如何建模时序？莫纳什阿里等最新《面向时间序列和时空数据的大型模型》综述与展望

专知会员服务

85+阅读 · 2023年10月22日

知识图谱如何时序建模？北工大等最新《时态知识图谱》综述，详述TKG的分类、进展与前景

知识图谱如何时序建模？北工大等最新《时态知识图谱》综述，详述TKG的分类、进展与前景

专知会员服务

37+阅读 · 2023年8月8日

瑞典皇家理工学院2022博士论文《从MRI图像分析和表征大脑形态的方法》

瑞典皇家理工学院2022博士论文《从MRI图像分析和表征大脑形态的方法》

专知会员服务

14+阅读 · 2022年4月18日

语音识别:不同深度学习方法的综述，Speech Recognition: a review of the different deep learning approaches

语音识别:不同深度学习方法的综述，Speech Recognition: a review of the different deep learning approaches

专知会员服务

33+阅读 · 2022年3月13日

多语言语音识别声学模型建模方法最新进展

多语言语音识别声学模型建模方法最新进展

专知会员服务

36+阅读 · 2022年2月7日

【KDD2019|讲座推荐】时点过程的建模与应用：Modeling and Applications for Temporal Point Processes

【KDD2019|讲座推荐】时点过程的建模与应用：Modeling and Applications for Temporal Point Processes

专知会员服务

24+阅读 · 2019年12月4日

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

专知

20+阅读 · 2019年11月24日

【ICASSP教程】深度生成模型在信号处理领域的应用（附116页PPT全文下载）

【ICASSP教程】深度生成模型在信号处理领域的应用（附116页PPT全文下载）

专知

16+阅读 · 2019年5月29日

使用 FastAI 和即时频率变换进行音频分类

使用 FastAI 和即时频率变换进行音频分类

AI研习社

11+阅读 · 2019年5月9日

近期声学领域前沿论文(No. 3)

近期声学领域前沿论文(No. 3)

深度学习每日摘要

24+阅读 · 2019年3月31日

使用RNN-Transducer进行语音识别建模【附PPT与视频资料】

使用RNN-Transducer进行语音识别建模【附PPT与视频资料】

人工智能前沿讲习班

74+阅读 · 2019年1月29日

基于Tacotron模型的语音合成实践

基于Tacotron模型的语音合成实践

深度学习每日摘要

15+阅读 · 2018年12月25日

【论文推荐】最新八篇视频描述生成相关论文—在线视频理解、联合定位和描述事件、生成视频、跨模态注意力机制、联合事件检测和描述

【论文推荐】最新八篇视频描述生成相关论文—在线视频理解、联合定位和描述事件、生成视频、跨模态注意力机制、联合事件检测和描述

专知

11+阅读 · 2018年6月4日

【论文推荐】最新5篇语音识别（ASR）相关论文—音频对抗样本、对抗性语音识别系统、声学模型、序列到序列、口语可理解性矫正

【论文推荐】最新5篇语音识别（ASR）相关论文—音频对抗样本、对抗性语音识别系统、声学模型、序列到序列、口语可理解性矫正

专知

14+阅读 · 2018年2月4日

微信美女研究员：详解CNN在语音识别中的应用

微信美女研究员：详解CNN在语音识别中的应用

机械鸡

13+阅读 · 2017年7月28日

自然语言处理中的Attention Model：是什么及为什么

自然语言处理中的Attention Model：是什么及为什么

新智元

11+阅读 · 2017年7月13日

功能磁共振成像无监督模式分析方法及应用

国家自然科学基金

3+阅读 · 2015年12月31日

混沌时间序列Volterra建模及其在语音信号处理中的应用

国家自然科学基金

0+阅读 · 2015年12月31日

人脑MRI数据特征提取方法的研究与应用

国家自然科学基金

0+阅读 · 2015年12月31日

通用时序逻辑表达下的视频时空行为理解研究与应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于实时fMRI解码与脑网络建模的听觉信息认知加工机理研究

国家自然科学基金

0+阅读 · 2015年12月31日

精神压力下基于物理模型的变异语音生成机理探索及检测方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于脉冲压缩的磁热声成像新方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

小鼠锰离子增强脑成像（MEMRI）数据分析算法研究及应用

国家自然科学基金

0+阅读 · 2014年12月31日

基于像素偏振片的实时相移数字全息技术

国家自然科学基金

0+阅读 · 2014年12月31日

超光谱、全偏振、立体形貌的多模态成像研究

国家自然科学基金

0+阅读 · 2014年12月31日

Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs

Arxiv

0+阅读 · 2月13日

Active Sampling for MRI-based Sequential Decision Making

Arxiv

0+阅读 · 2月13日

Speech to Speech Synthesis for Voice Impersonation

Arxiv

0+阅读 · 2月13日

Multilingual Dysarthric Speech Assessment Using Universal Phone Recognition and Language-Specific Phonemic Contrast Modeling

Arxiv

0+阅读 · 2月11日

GRAM: Spatial general-purpose audio representation models for real-world applications

Arxiv

0+阅读 · 2月4日

Do Models Hear Like Us? Probing the Representational Alignment of Audio LLMs and Naturalistic EEG

Arxiv

0+阅读 · 2月3日

Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM

Arxiv

0+阅读 · 2月2日

ARTI-6: Towards Six-dimensional Articulatory Speech Encoding

Arxiv

0+阅读 · 1月26日

Learned Hemodynamic Coupling Inference in Resting-State Functional MRI

Arxiv

0+阅读 · 1月23日

Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models

Arxiv

0+阅读 · 1月21日

VIP会员

文章信息

相关主题

磁共振成像

最新内容

美以伊冲突中的人工智能应用：人工智能工具、部署策略及作战影响分析

美以伊冲突中的人工智能应用：人工智能工具、部署策略及作战影响分析

专知会员服务

6+阅读 · 5月31日

比利时发布用于实时战场军事装备识别的离线人工智能系统

比利时发布用于实时战场军事装备识别的离线人工智能系统

专知会员服务

5+阅读 · 5月31日

《经济冲击与战略损失：美伊军事冲突的不可持续成本》

《经济冲击与战略损失：美伊军事冲突的不可持续成本》

专知会员服务

4+阅读 · 5月31日

超越网格：作战环境对炮兵的影响

超越网格：作战环境对炮兵的影响

专知会员服务

2+阅读 · 5月31日

KDD 2026 | MixRAGRec：面向LLM推荐的混合专家KG-RAG框架

KDD 2026 | MixRAGRec：面向LLM推荐的混合专家KG-RAG框架

专知会员服务

8+阅读 · 5月31日

综述 | 推理时控制：可信大语言模型的运行时治理全景

综述 | 推理时控制：可信大语言模型的运行时治理全景

专知会员服务

4+阅读 · 5月31日

BES：让语言模型通过双向进化搜索自我改进

BES：让语言模型通过双向进化搜索自我改进

专知会员服务

6+阅读 · 5月30日

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

专知会员服务

7+阅读 · 5月30日

以色列-美国-伊朗战争中的无人机：关键要点

以色列-美国-伊朗战争中的无人机：关键要点

专知会员服务

7+阅读 · 5月30日

美以伊战争：首次人工智能战争——军事自主性困境

美以伊战争：首次人工智能战争——军事自主性困境

专知会员服务

7+阅读 · 5月30日

《Palantir任务保障性软件安全标准（MA-S2）》

《Palantir任务保障性软件安全标准（MA-S2）》

专知会员服务

19+阅读 · 5月30日

《美海军利用扩展现实增强知识流动研究》300页报告

《美海军利用扩展现实增强知识流动研究》300页报告

专知会员服务

10+阅读 · 5月30日

基于声学的无人机检测技术综述

基于声学的无人机检测技术综述

专知会员服务

11+阅读 · 5月30日

《当代混合战争分析框架：俄乌战争经验教训》

《当代混合战争分析框架：俄乌战争经验教训》

专知会员服务

10+阅读 · 5月30日

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

专知会员服务

14+阅读 · 5月29日

相关VIP内容

【博士论文】面向真实世界音视联合语音识别的可扩展框架

【博士论文】面向真实世界音视联合语音识别的可扩展框架

专知会员服务

13+阅读 · 2025年12月19日

【普林斯顿博士论文】用于语音的生成式通用模型

【普林斯顿博士论文】用于语音的生成式通用模型

专知会员服务

19+阅读 · 2025年12月3日

【牛津博士论文】面向神经影像应用的可扩展且可解释的空间模型

【牛津博士论文】面向神经影像应用的可扩展且可解释的空间模型

专知会员服务

14+阅读 · 2025年8月3日

迈向可控语音合成：大语言模型时代的综述

迈向可控语音合成：大语言模型时代的综述

专知会员服务

24+阅读 · 2024年12月13日

大模型如何建模时序？莫纳什阿里等最新《面向时间序列和时空数据的大型模型》综述与展望

大模型如何建模时序？莫纳什阿里等最新《面向时间序列和时空数据的大型模型》综述与展望

专知会员服务

85+阅读 · 2023年10月22日

知识图谱如何时序建模？北工大等最新《时态知识图谱》综述，详述TKG的分类、进展与前景

知识图谱如何时序建模？北工大等最新《时态知识图谱》综述，详述TKG的分类、进展与前景

专知会员服务

37+阅读 · 2023年8月8日

瑞典皇家理工学院2022博士论文《从MRI图像分析和表征大脑形态的方法》

瑞典皇家理工学院2022博士论文《从MRI图像分析和表征大脑形态的方法》

专知会员服务

14+阅读 · 2022年4月18日

语音识别:不同深度学习方法的综述，Speech Recognition: a review of the different deep learning approaches

语音识别:不同深度学习方法的综述，Speech Recognition: a review of the different deep learning approaches

专知会员服务

33+阅读 · 2022年3月13日

多语言语音识别声学模型建模方法最新进展

多语言语音识别声学模型建模方法最新进展

专知会员服务

36+阅读 · 2022年2月7日

【KDD2019|讲座推荐】时点过程的建模与应用：Modeling and Applications for Temporal Point Processes

【KDD2019|讲座推荐】时点过程的建模与应用：Modeling and Applications for Temporal Point Processes

专知会员服务

24+阅读 · 2019年12月4日

热门VIP内容

开通专知VIP会员享更多权益服务

比利时发布用于实时战场军事装备识别的离线人工智能系统

超越网格：作战环境对炮兵的影响

美以伊冲突中的人工智能应用：人工智能工具、部署策略及作战影响分析

《经济冲击与战略损失：美伊军事冲突的不可持续成本》

相关资讯

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

专知

20+阅读 · 2019年11月24日

【ICASSP教程】深度生成模型在信号处理领域的应用（附116页PPT全文下载）

【ICASSP教程】深度生成模型在信号处理领域的应用（附116页PPT全文下载）

专知

16+阅读 · 2019年5月29日

使用 FastAI 和即时频率变换进行音频分类

使用 FastAI 和即时频率变换进行音频分类

AI研习社

11+阅读 · 2019年5月9日

近期声学领域前沿论文(No. 3)

近期声学领域前沿论文(No. 3)

深度学习每日摘要

24+阅读 · 2019年3月31日

使用RNN-Transducer进行语音识别建模【附PPT与视频资料】

使用RNN-Transducer进行语音识别建模【附PPT与视频资料】

人工智能前沿讲习班

74+阅读 · 2019年1月29日

基于Tacotron模型的语音合成实践

基于Tacotron模型的语音合成实践

深度学习每日摘要

15+阅读 · 2018年12月25日

【论文推荐】最新八篇视频描述生成相关论文—在线视频理解、联合定位和描述事件、生成视频、跨模态注意力机制、联合事件检测和描述

【论文推荐】最新八篇视频描述生成相关论文—在线视频理解、联合定位和描述事件、生成视频、跨模态注意力机制、联合事件检测和描述

专知

11+阅读 · 2018年6月4日

【论文推荐】最新5篇语音识别（ASR）相关论文—音频对抗样本、对抗性语音识别系统、声学模型、序列到序列、口语可理解性矫正

【论文推荐】最新5篇语音识别（ASR）相关论文—音频对抗样本、对抗性语音识别系统、声学模型、序列到序列、口语可理解性矫正

专知

14+阅读 · 2018年2月4日

微信美女研究员：详解CNN在语音识别中的应用

微信美女研究员：详解CNN在语音识别中的应用

机械鸡

13+阅读 · 2017年7月28日

自然语言处理中的Attention Model：是什么及为什么

自然语言处理中的Attention Model：是什么及为什么

新智元

11+阅读 · 2017年7月13日

相关论文

Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs

Arxiv

0+阅读 · 2月13日

Active Sampling for MRI-based Sequential Decision Making

Arxiv

0+阅读 · 2月13日

Speech to Speech Synthesis for Voice Impersonation

Arxiv

0+阅读 · 2月13日

Multilingual Dysarthric Speech Assessment Using Universal Phone Recognition and Language-Specific Phonemic Contrast Modeling

Arxiv

0+阅读 · 2月11日

GRAM: Spatial general-purpose audio representation models for real-world applications

Arxiv

0+阅读 · 2月4日

Do Models Hear Like Us? Probing the Representational Alignment of Audio LLMs and Naturalistic EEG

Arxiv

0+阅读 · 2月3日

Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM

Arxiv

0+阅读 · 2月2日

ARTI-6: Towards Six-dimensional Articulatory Speech Encoding

Arxiv

0+阅读 · 1月26日

Learned Hemodynamic Coupling Inference in Resting-State Functional MRI

Arxiv

0+阅读 · 1月23日

Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models

Arxiv

0+阅读 · 1月21日

相关基金

功能磁共振成像无监督模式分析方法及应用

国家自然科学基金

3+阅读 · 2015年12月31日

混沌时间序列Volterra建模及其在语音信号处理中的应用

国家自然科学基金

0+阅读 · 2015年12月31日

人脑MRI数据特征提取方法的研究与应用

国家自然科学基金

0+阅读 · 2015年12月31日

通用时序逻辑表达下的视频时空行为理解研究与应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于实时fMRI解码与脑网络建模的听觉信息认知加工机理研究

国家自然科学基金

0+阅读 · 2015年12月31日

精神压力下基于物理模型的变异语音生成机理探索及检测方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于脉冲压缩的磁热声成像新方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

小鼠锰离子增强脑成像（MEMRI）数据分析算法研究及应用

国家自然科学基金

0+阅读 · 2014年12月31日

基于像素偏振片的实时相移数字全息技术

国家自然科学基金

0+阅读 · 2014年12月31日

超光谱、全偏振、立体形貌的多模态成像研究

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员