The Infinite-Dimensional Nature of Spectroscopy and Why Models Succeed, Fail, and Mislead - 专知论文

会员服务 ·

0

The Infinite-Dimensional Nature of Spectroscopy and Why Models Succeed, Fail, and Mislead

翻译：光谱学的无限维本质：模型成功、失败与误导的成因

Umberto Michelucci,Francesca Venturini

Machine learning (ML) models have achieved strikingly high accuracies in spectroscopic classification tasks, often without a clear proof that those models used chemically meaningful features. Existing studies have linked these results to data preprocessing choices, noise sensitivity, and model complexity, but no unifying explanation is available so far. In this work, we show that these phenomena arise naturally from the intrinsic high dimensionality of spectral data. Using a theoretical analysis grounded in the Feldman-Hajek theorem and the concentration of measure, we show that even infinitesimal distributional differences, caused by noise, normalisation, or instrumental artefacts, may become perfectly separable in high-dimensional spaces. Through a series of specific experiments on synthetic and real fluorescence spectra, we illustrate how models can achieve near-perfect accuracy even when chemical distinctions are absent, and why feature-importance maps may highlight spectrally irrelevant regions. We provide a rigorous theoretical framework, confirm the effect experimentally, and conclude with practical recommendations for building and interpreting ML models in spectroscopy.

翻译：机器学习（ML）模型在光谱分类任务中已取得显著的高准确率，但通常缺乏明确的证据表明这些模型使用了具有化学意义的特征。现有研究将这些结果与数据预处理选择、噪声敏感性及模型复杂度相关联，但至今尚无统一的解释。在本工作中，我们揭示这些现象自然源于光谱数据固有的高维性。基于费尔德曼-哈杰克定理和测度集中理论的理论分析，我们证明：由噪声、归一化或仪器伪影引起的微小分布差异，在高维空间中可能变得完全可分。通过一系列针对合成荧光光谱和真实荧光光谱的特定实验，我们展示了即便在缺乏化学区分性时模型仍能实现近乎完美准确率的原因，以及为何特征重要性图谱可能突出与光谱无关的区域。我们提供了严格的理论框架，通过实验验证了这一效应，并最终提出了构建和解释光谱学中ML模型的实践建议。

0

相关内容

如何可视化机器学习模型？最新《机器学习的可视化分析: 数据视角综述》全面概述VIS4ML方法体系

如何可视化机器学习模型？最新《机器学习的可视化分析: 数据视角综述》全面概述VIS4ML方法体系

专知会员服务

51+阅读 · 2023年7月19日

博士论文《联邦学习仿真器》221页，米兰理工大学

博士论文《联邦学习仿真器》221页，米兰理工大学

专知会员服务

32+阅读 · 2023年3月14日

《通过数学演绎推理产生形式智能，并作为从数据模式中归纳推理产生知识的补充》2022最新论文，加拿大国防研究与发展部

《通过数学演绎推理产生形式智能，并作为从数据模式中归纳推理产生知识的补充》2022最新论文，加拿大国防研究与发展部

专知会员服务

29+阅读 · 2023年1月11日

《随机森林排列特征在离子迁移光谱特征选择中的重要性》2022最新美国陆军研究实验室24页论文

《随机森林排列特征在离子迁移光谱特征选择中的重要性》2022最新美国陆军研究实验室24页论文

专知会员服务

20+阅读 · 2022年10月28日

【干货书】有限样本学习-元学习及其在通信系统中的应用，134页pdf，

【干货书】有限样本学习-元学习及其在通信系统中的应用，134页pdf，

专知会员服务

59+阅读 · 2022年10月8日

最新《自动化机器学习》报告，73页ppt建模阐述AutoML进展，附书籍

最新《自动化机器学习》报告，73页ppt建模阐述AutoML进展，附书籍

专知会员服务

114+阅读 · 2022年8月26日

【MIT博士论文】机器学习与因果关系:建立高效、可靠的决策模型

【MIT博士论文】机器学习与因果关系:建立高效、可靠的决策模型

专知会员服务

112+阅读 · 2022年7月10日

量子机器学习的基础和应用：一个简明文献综述

量子机器学习的基础和应用：一个简明文献综述

专知会员服务

39+阅读 · 2022年6月28日

博士论文《对抗环境中的深度学习》全面讲解对抗深度学习，169页PDF

博士论文《对抗环境中的深度学习》全面讲解对抗深度学习，169页PDF

专知会员服务

64+阅读 · 2022年4月29日

【哈佛大学】最新《理解模型可解释性》综述报告，45页ppt

专知会员服务

77+阅读 · 2020年12月4日

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

专知

10+阅读 · 2023年4月6日

【干货书】MLOps是什么？MLOps实战：操作机器学习模型，461页pdf

【干货书】MLOps是什么？MLOps实战：操作机器学习模型，461页pdf

专知

15+阅读 · 2022年2月16日

【新书】机器学习算法，模型与应用，154页pdf

【新书】机器学习算法，模型与应用，154页pdf

专知

24+阅读 · 2022年1月20日

您可以相信模型的不确定性吗？

您可以相信模型的不确定性吗？

TensorFlow

14+阅读 · 2020年1月31日

金融时序预测中的深度学习方法综述: 从2005到2019，附63页pdf下载

金融时序预测中的深度学习方法综述: 从2005到2019，附63页pdf下载

专知

70+阅读 · 2019年12月4日

【伯克利PNAS最新论文】可解释机器学习的定义、方法和应用

【伯克利PNAS最新论文】可解释机器学习的定义、方法和应用

专知

78+阅读 · 2019年10月20日

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

专知

363+阅读 · 2019年4月12日

深度学习时代的图模型，清华发文综述图网络

深度学习时代的图模型，清华发文综述图网络

GAN生成式对抗网络

13+阅读 · 2018年12月23日

FCS 论坛 | 孟德宇：误差建模原理

FCS 论坛 | 孟德宇：误差建模原理

FCS

15+阅读 · 2017年8月17日

自然语言处理中的Attention Model：是什么及为什么

自然语言处理中的Attention Model：是什么及为什么

新智元

11+阅读 · 2017年7月13日

复杂环境下机器学习的理论研究

国家自然科学基金

21+阅读 · 2015年12月31日

高维回归模型的预测稳定性研究

国家自然科学基金

3+阅读 · 2015年12月31日

方差正则化的分类模型选择方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

面向光谱-空间特征集合的高光谱遥感影像度量学习与分类研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于模型的无波前传感器自适应光学关键理论和方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向异分布数据的主动学习方法

国家自然科学基金

12+阅读 · 2015年12月31日

一维光谱恢复与海量光谱红移自动测量方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

高维数据下的模型平均方法

国家自然科学基金

6+阅读 · 2014年12月31日

基于深度学习的三维模型检索技术

国家自然科学基金

13+阅读 · 2014年12月31日

超光谱、全偏振、立体形貌的多模态成像研究

国家自然科学基金

0+阅读 · 2014年12月31日

The Pragmatic Frames of Spurious Correlations in Machine Learning: Interpreting How and Why They Matter

The Pragmatic Frames of Spurious Correlations in Machine Learning: Interpreting How and Why They Matter

Arxiv

0+阅读 · 5月4日

Directional Confusions Reveal Divergent Inductive Biases Through Rate-Distortion Geometry in Human and Machine Vision

Arxiv

0+阅读 · 4月23日

Prediction decomposition for causal analysis

Arxiv

0+阅读 · 4月13日

Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification

Arxiv

0+阅读 · 4月9日

Diffusion Recommender Models and the Illusion of Progress: A Concerning Study of Reproducibility and a Conceptual Mismatch

Arxiv

0+阅读 · 3月26日

Revealing the influence of participant failures on model quality in cross-silo Federated Learning

Arxiv

0+阅读 · 3月26日

Spectral methods: crucial for machine learning, natural for quantum computers?

Arxiv

0+阅读 · 3月25日

Assessment of Spatio-Temporal Predictors in the Presence of Missing and Heterogeneous Data

Arxiv

0+阅读 · 2月27日

Inferential Mechanics Part 1: Causal Mechanistic Theories of Machine Learning in Chemical Biology with Implications

Arxiv

0+阅读 · 2月26日

A Review and Roadmap of Deep Causal Model from Different Causal Structures and Representations

Arxiv

13+阅读 · 2023年11月2日

VIP会员

文章信息

相关主题

最新内容

综述 | 从问答到任务完成：Agent系统与Harness设计

综述 | 从问答到任务完成：Agent系统与Harness设计

专知会员服务

3+阅读 · 6月24日

Agentic RL：框架、实践与长程智能体训练

Agentic RL：框架、实践与长程智能体训练

专知会员服务

2+阅读 · 6月24日

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

专知会员服务

8+阅读 · 6月24日

重新思考无人机时代的生存能力

重新思考无人机时代的生存能力

专知会员服务

6+阅读 · 6月24日

装甲突击旅：现代战争思考、战斗与组织

装甲突击旅：现代战争思考、战斗与组织

专知会员服务

5+阅读 · 6月24日

在人工智能加速决策环境中拓展OODA循环

在人工智能加速决策环境中拓展OODA循环

专知会员服务

6+阅读 · 6月24日

《廉价自杀式无人机战争的军事战略影响：乌克兰与伊朗案例研究》

《廉价自杀式无人机战争的军事战略影响：乌克兰与伊朗案例研究》

专知会员服务

6+阅读 · 6月24日

军事欺骗：供作战战术指挥官使用的工具

军事欺骗：供作战战术指挥官使用的工具

专知会员服务

5+阅读 · 6月24日

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

专知会员服务

4+阅读 · 6月23日

综述 | 世界动作模型：少做梦，多行动

综述 | 世界动作模型：少做梦，多行动

专知会员服务

7+阅读 · 6月23日

美以伊冲突：无人机与人工智能的运用

美以伊冲突：无人机与人工智能的运用

专知会员服务

12+阅读 · 6月23日

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

专知会员服务

6+阅读 · 6月23日

《特种部队在透明战场中的生存力》最新报告

《特种部队在透明战场中的生存力》最新报告

专知会员服务

5+阅读 · 6月23日

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

专知会员服务

9+阅读 · 6月23日

《人工智能生成的零日漏洞：对未来作战的影响》

《人工智能生成的零日漏洞：对未来作战的影响》

专知会员服务

8+阅读 · 6月23日

相关VIP内容

如何可视化机器学习模型？最新《机器学习的可视化分析: 数据视角综述》全面概述VIS4ML方法体系

如何可视化机器学习模型？最新《机器学习的可视化分析: 数据视角综述》全面概述VIS4ML方法体系

专知会员服务

51+阅读 · 2023年7月19日

博士论文《联邦学习仿真器》221页，米兰理工大学

博士论文《联邦学习仿真器》221页，米兰理工大学

专知会员服务

32+阅读 · 2023年3月14日

《通过数学演绎推理产生形式智能，并作为从数据模式中归纳推理产生知识的补充》2022最新论文，加拿大国防研究与发展部

《通过数学演绎推理产生形式智能，并作为从数据模式中归纳推理产生知识的补充》2022最新论文，加拿大国防研究与发展部

专知会员服务

29+阅读 · 2023年1月11日

《随机森林排列特征在离子迁移光谱特征选择中的重要性》2022最新美国陆军研究实验室24页论文

《随机森林排列特征在离子迁移光谱特征选择中的重要性》2022最新美国陆军研究实验室24页论文

专知会员服务

20+阅读 · 2022年10月28日

【干货书】有限样本学习-元学习及其在通信系统中的应用，134页pdf，

【干货书】有限样本学习-元学习及其在通信系统中的应用，134页pdf，

专知会员服务

59+阅读 · 2022年10月8日

最新《自动化机器学习》报告，73页ppt建模阐述AutoML进展，附书籍

最新《自动化机器学习》报告，73页ppt建模阐述AutoML进展，附书籍

专知会员服务

114+阅读 · 2022年8月26日

【MIT博士论文】机器学习与因果关系:建立高效、可靠的决策模型

【MIT博士论文】机器学习与因果关系:建立高效、可靠的决策模型

专知会员服务

112+阅读 · 2022年7月10日

量子机器学习的基础和应用：一个简明文献综述

量子机器学习的基础和应用：一个简明文献综述

专知会员服务

39+阅读 · 2022年6月28日

博士论文《对抗环境中的深度学习》全面讲解对抗深度学习，169页PDF

博士论文《对抗环境中的深度学习》全面讲解对抗深度学习，169页PDF

专知会员服务

64+阅读 · 2022年4月29日

【哈佛大学】最新《理解模型可解释性》综述报告，45页ppt

专知会员服务

77+阅读 · 2020年12月4日

热门VIP内容

开通专知VIP会员享更多权益服务

Agentic RL：框架、实践与长程智能体训练

重新思考无人机时代的生存能力

综述 | 从问答到任务完成：Agent系统与Harness设计

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

相关资讯

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

专知

10+阅读 · 2023年4月6日

【干货书】MLOps是什么？MLOps实战：操作机器学习模型，461页pdf

【干货书】MLOps是什么？MLOps实战：操作机器学习模型，461页pdf

专知

15+阅读 · 2022年2月16日

【新书】机器学习算法，模型与应用，154页pdf

【新书】机器学习算法，模型与应用，154页pdf

专知

24+阅读 · 2022年1月20日

您可以相信模型的不确定性吗？

您可以相信模型的不确定性吗？

TensorFlow

14+阅读 · 2020年1月31日

金融时序预测中的深度学习方法综述: 从2005到2019，附63页pdf下载

金融时序预测中的深度学习方法综述: 从2005到2019，附63页pdf下载

专知

70+阅读 · 2019年12月4日

【伯克利PNAS最新论文】可解释机器学习的定义、方法和应用

【伯克利PNAS最新论文】可解释机器学习的定义、方法和应用

专知

78+阅读 · 2019年10月20日

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

专知

363+阅读 · 2019年4月12日

深度学习时代的图模型，清华发文综述图网络

深度学习时代的图模型，清华发文综述图网络

GAN生成式对抗网络

13+阅读 · 2018年12月23日

FCS 论坛 | 孟德宇：误差建模原理

FCS 论坛 | 孟德宇：误差建模原理

FCS

15+阅读 · 2017年8月17日

自然语言处理中的Attention Model：是什么及为什么

自然语言处理中的Attention Model：是什么及为什么

新智元

11+阅读 · 2017年7月13日

相关论文

The Pragmatic Frames of Spurious Correlations in Machine Learning: Interpreting How and Why They Matter

The Pragmatic Frames of Spurious Correlations in Machine Learning: Interpreting How and Why They Matter

Arxiv

0+阅读 · 5月4日

Directional Confusions Reveal Divergent Inductive Biases Through Rate-Distortion Geometry in Human and Machine Vision

Arxiv

0+阅读 · 4月23日

Prediction decomposition for causal analysis

Arxiv

0+阅读 · 4月13日

Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification

Arxiv

0+阅读 · 4月9日

Diffusion Recommender Models and the Illusion of Progress: A Concerning Study of Reproducibility and a Conceptual Mismatch

Arxiv

0+阅读 · 3月26日

Revealing the influence of participant failures on model quality in cross-silo Federated Learning

Arxiv

0+阅读 · 3月26日

Spectral methods: crucial for machine learning, natural for quantum computers?

Arxiv

0+阅读 · 3月25日

Assessment of Spatio-Temporal Predictors in the Presence of Missing and Heterogeneous Data

Arxiv

0+阅读 · 2月27日

Inferential Mechanics Part 1: Causal Mechanistic Theories of Machine Learning in Chemical Biology with Implications

Arxiv

0+阅读 · 2月26日

A Review and Roadmap of Deep Causal Model from Different Causal Structures and Representations

Arxiv

13+阅读 · 2023年11月2日

相关基金

复杂环境下机器学习的理论研究

国家自然科学基金

21+阅读 · 2015年12月31日

高维回归模型的预测稳定性研究

国家自然科学基金

3+阅读 · 2015年12月31日

方差正则化的分类模型选择方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

面向光谱-空间特征集合的高光谱遥感影像度量学习与分类研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于模型的无波前传感器自适应光学关键理论和方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向异分布数据的主动学习方法

国家自然科学基金

12+阅读 · 2015年12月31日

一维光谱恢复与海量光谱红移自动测量方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

高维数据下的模型平均方法

国家自然科学基金

6+阅读 · 2014年12月31日

基于深度学习的三维模型检索技术

国家自然科学基金

13+阅读 · 2014年12月31日

超光谱、全偏振、立体形貌的多模态成像研究

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员