Mechanistic Interpretability as Statistical Estimation: A Variance Analysis - 专知论文

会员服务 ·

0

方差 · 分析 · 机制可解释性 · 差分 · 可解释性 ·

Mechanistic Interpretability as Statistical Estimation: A Variance Analysis

翻译：机制可解释性作为统计估计：方差分析

Maxime Méloux,François Portet,Maxime Peyrard

Mechanistic Interpretability (MI) aims to reverse-engineer model behaviors by identifying functional sub-networks. Yet, the scientific validity of these findings depends on their stability. In this work, we argue that circuit discovery is not a standalone task but a statistical estimation problem built upon causal mediation analysis (CMA). We uncover a fundamental instability at this base layer: exact, single-input CMA scores exhibit high intrinsic variance, implying that the causal effect of a component is a volatile random variable rather than a fixed property. We then demonstrate that circuit discovery pipelines inherit this variance and further amplify it. Fast approximation methods, such as Edge Attribution Patching and its successors, introduce additional estimation noise, while aggregating these noisy scores over datasets leads to fragile structural estimates. Consequently, small perturbations in input data or hyperparameters yield vastly different circuits. We systematically decompose these sources of variance and advocate for more rigorous MI practices, prioritizing statistical robustness and routine reporting of stability metrics.

翻译：机制可解释性（MI）旨在通过识别功能性子网络来逆向工程模型行为。然而，这些发现科学有效性取决于其稳定性。在本工作中，我们认为电路发现并非独立任务，而是建立在因果中介分析（CMA）之上的统计估计问题。我们揭示了该基础层存在一个根本性不稳定因素：精确的单输入CMA分数表现出高固有方差，这意味着组件的因果效应是波动随机变量而非固定属性。我们进而证明电路发现流程继承了这种方差并进一步放大它。快速近似方法（如Edge Attribution Patching及其后续方法）会引入额外估计噪声，而在数据集上聚合这些含噪分数会导致脆弱的结构估计。因此，输入数据或超参数的微小扰动会产生截然不同的电路。我们系统分解了这些方差来源，并倡导采用更严谨的MI实践，优先考虑统计鲁棒性及稳定性指标的常规报告。

0

相关内容

ICML 2025 关于语言模型机械可解释性的教程

ICML 2025 关于语言模型机械可解释性的教程

专知会员服务

18+阅读 · 2025年7月25日

多模态基础模型的机制可解释性综述

多模态基础模型的机制可解释性综述

专知会员服务

43+阅读 · 2025年2月28日

机器学习可解释如何客观评估？CMU-Yeh博士论文《可解释机器学习的客观标准》，148页pdf

机器学习可解释如何客观评估？CMU-Yeh博士论文《可解释机器学习的客观标准》，148页pdf

专知会员服务

79+阅读 · 2022年11月23日

【NeurIPS2022】可解释机器学习的安全性:一种最大偏差方法

【NeurIPS2022】可解释机器学习的安全性:一种最大偏差方法

专知会员服务

24+阅读 · 2022年11月8日

到底什么是有用的ML可解释性？伯克利郁彬高徒Singh68页博士论文《现实世界的机器学习中有用的可解释性》全面综述可解释性技术

到底什么是有用的ML可解释性？伯克利郁彬高徒Singh68页博士论文《现实世界的机器学习中有用的可解释性》全面综述可解释性技术

专知会员服务

119+阅读 · 2022年5月16日

基于规则的建模方法的可解释性及其发展

专知会员服务

104+阅读 · 2021年6月23日

【哈佛大学Hima】最新《可解释的机器学习:概述和解决方案》综述报告，94页ppt

【哈佛大学Hima】最新《可解释的机器学习:概述和解决方案》综述报告，94页ppt

专知会员服务

127+阅读 · 2020年12月3日

【机器推理可解释性】Machine Reasoning Explainability

【机器推理可解释性】Machine Reasoning Explainability

专知会员服务

35+阅读 · 2020年9月3日

机器学习的可解释性

机器学习的可解释性

专知会员服务

179+阅读 · 2020年8月27日

【哈佛大学商学院课程Fall 2019】机器学习可解释性

【哈佛大学商学院课程Fall 2019】机器学习可解释性

专知会员服务

105+阅读 · 2019年10月9日

「强化学习可解释性」最新2022综述

「强化学习可解释性」最新2022综述

专知

12+阅读 · 2022年1月16日

深度学习可解释性研究进展

深度学习可解释性研究进展

专知

19+阅读 · 2020年6月26日

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

AINLP

19+阅读 · 2020年6月14日

【伯克利PNAS最新论文】可解释机器学习的定义、方法和应用

【伯克利PNAS最新论文】可解释机器学习的定义、方法和应用

专知

78+阅读 · 2019年10月20日

AI可解释性文献列表

AI可解释性文献列表

专知

43+阅读 · 2019年10月7日

【Awesome】最全的机器学习可解释性资料（machine-learning-interpretability）

【Awesome】最全的机器学习可解释性资料（machine-learning-interpretability）

专知

29+阅读 · 2019年3月1日

可解释的机器学习

可解释的机器学习

平均机器

25+阅读 · 2019年2月25日

高赞新书《可解释的机器学习》出版：理解黑盒必备，免费资源

高赞新书《可解释的机器学习》出版：理解黑盒必备，免费资源

量子位

23+阅读 · 2019年2月23日

【UC伯克利】可解释性机器学习：定义、方法和应用

【UC伯克利】可解释性机器学习：定义、方法和应用

专知

70+阅读 · 2019年1月19日

【学界】机器学习模型的“可解释性”到底有多重要？

【学界】机器学习模型的“可解释性”到底有多重要？

GAN生成式对抗网络

12+阅读 · 2018年3月3日

随机振动响应预测中的模型形式不确定性量化方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于动态相关机理分析的机械系统可靠性评估方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

正倒向随机微分方程与两类衍生模型的统计推断及金融中的应用

国家自然科学基金

2+阅读 · 2015年12月31日

考虑不确定性的结构动力学响应模型可信度确认方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

故障机理的不确定传播及系统故障自动推演建模方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于扩展的概率转移矩阵模型的高精度快速广义门电路可靠性评估方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

随机微分方程解的稳定性和矩有界性

国家自然科学基金

0+阅读 · 2015年12月31日

随机延迟微分方程数值解的延迟依赖稳定性及自适应技术

国家自然科学基金

0+阅读 · 2014年12月31日

微分代数方程中的误差可控计算理论与算法

国家自然科学基金

0+阅读 · 2014年12月31日

含有隐变量的因果结构学习与统计因果推断

国家自然科学基金

21+阅读 · 2013年12月31日

Estimation and Inference for Causal Explainability

Arxiv

0+阅读 · 3月6日

Circuit Insights: Towards Interpretability Beyond Activations

Arxiv

0+阅读 · 3月4日

Exact Functional ANOVA Decomposition for Categorical Inputs Models

Arxiv

0+阅读 · 3月3日

Mechanistic Indicators of Understanding in Large Language Models

Arxiv

0+阅读 · 2月25日

Formal Mechanistic Interpretability: Automated Circuit Discovery with Provable Guarantees

Arxiv

0+阅读 · 2月18日

Interpretability-by-Design with Accurate Locally Additive Models and Conditional Feature Effects

Arxiv

0+阅读 · 2月18日

Reproducibility and Statistical Methodology

Arxiv

0+阅读 · 2月17日

Probabilistic RNA Designability via Interpretable Ensemble Approximation and Dynamic Decomposition

Arxiv

0+阅读 · 2月14日

Momentum Attention: The Physics of In-Context Learning and Spectral Forensics for Mechanistic Interpretability

Arxiv

0+阅读 · 2月7日

Additive Models Explained: A Computational Complexity Approach

Arxiv

0+阅读 · 2月5日

VIP会员

文章信息

相关主题

机制可解释性

最新内容

国外海军作战管理系统与作战训练系统

国外海军作战管理系统与作战训练系统

专知会员服务

0+阅读 · 今天4:16

美军条令《海军陆战队规划流程（2026版）》

美军条令《海军陆战队规划流程（2026版）》

专知会员服务

5+阅读 · 今天3:36

《压缩式分布式交互仿真标准》120页

《压缩式分布式交互仿真标准》120页

专知会员服务

3+阅读 · 今天3:21

《电子战数据交换模型研究报告》

《电子战数据交换模型研究报告》

专知会员服务

4+阅读 · 今天3:13

美军运用水下无人机与机器人系统竞速清除霍尔木兹海峡水雷

美军运用水下无人机与机器人系统竞速清除霍尔木兹海峡水雷

专知会员服务

4+阅读 · 今天2:55

《基于Transformer的异常舰船导航识别与跟踪》80页

《基于Transformer的异常舰船导航识别与跟踪》80页

专知会员服务

5+阅读 · 今天2:45

《美国太空系统司令部实验室原型作战管理系统的数据与决策可追溯性》

《美国太空系统司令部实验室原型作战管理系统的数据与决策可追溯性》

专知会员服务

4+阅读 · 今天2:41

《低数据领域军事目标检测模型研究》

《低数据领域军事目标检测模型研究》

专知会员服务

4+阅读 · 今天2:37

《为韧性而设计：在战略不确定时代提升军事空军基地的生存能力》

《为韧性而设计：在战略不确定时代提升军事空军基地的生存能力》

专知会员服务

4+阅读 · 今天2:32

【CMU博士论文】物理世界的视觉感知与深度理解

【CMU博士论文】物理世界的视觉感知与深度理解

专知会员服务

6+阅读 · 4月22日

多智能体系统：从经典范式到大基础模型驱动的未来

多智能体系统：从经典范式到大基础模型驱动的未来

专知会员服务

9+阅读 · 4月22日

伊朗战争停火期间美军关键弹药状况分析

伊朗战争停火期间美军关键弹药状况分析

专知会员服务

8+阅读 · 4月22日

电子战革命：塑造战场的十年突破（2015–2025）

电子战革命：塑造战场的十年突破（2015–2025）

专知会员服务

6+阅读 · 4月22日

人工智能赋能电子战解决方案：实现电磁优势的认知方法（万字长文）

人工智能赋能电子战解决方案：实现电磁优势的认知方法（万字长文）

专知会员服务

9+阅读 · 4月22日

《基于模型的系统工程框架及其在电子战系统中的应用》

《基于模型的系统工程框架及其在电子战系统中的应用》

专知会员服务

7+阅读 · 4月22日

相关VIP内容

ICML 2025 关于语言模型机械可解释性的教程

ICML 2025 关于语言模型机械可解释性的教程

专知会员服务

18+阅读 · 2025年7月25日

多模态基础模型的机制可解释性综述

多模态基础模型的机制可解释性综述

专知会员服务

43+阅读 · 2025年2月28日

机器学习可解释如何客观评估？CMU-Yeh博士论文《可解释机器学习的客观标准》，148页pdf

机器学习可解释如何客观评估？CMU-Yeh博士论文《可解释机器学习的客观标准》，148页pdf

专知会员服务

79+阅读 · 2022年11月23日

【NeurIPS2022】可解释机器学习的安全性:一种最大偏差方法

【NeurIPS2022】可解释机器学习的安全性:一种最大偏差方法

专知会员服务

24+阅读 · 2022年11月8日

到底什么是有用的ML可解释性？伯克利郁彬高徒Singh68页博士论文《现实世界的机器学习中有用的可解释性》全面综述可解释性技术

到底什么是有用的ML可解释性？伯克利郁彬高徒Singh68页博士论文《现实世界的机器学习中有用的可解释性》全面综述可解释性技术

专知会员服务

119+阅读 · 2022年5月16日

基于规则的建模方法的可解释性及其发展

专知会员服务

104+阅读 · 2021年6月23日

【哈佛大学Hima】最新《可解释的机器学习:概述和解决方案》综述报告，94页ppt

【哈佛大学Hima】最新《可解释的机器学习:概述和解决方案》综述报告，94页ppt

专知会员服务

127+阅读 · 2020年12月3日

【机器推理可解释性】Machine Reasoning Explainability

【机器推理可解释性】Machine Reasoning Explainability

专知会员服务

35+阅读 · 2020年9月3日

机器学习的可解释性

机器学习的可解释性

专知会员服务

179+阅读 · 2020年8月27日

【哈佛大学商学院课程Fall 2019】机器学习可解释性

【哈佛大学商学院课程Fall 2019】机器学习可解释性

专知会员服务

105+阅读 · 2019年10月9日

热门VIP内容

开通专知VIP会员享更多权益服务

美军条令《海军陆战队规划流程（2026版）》

《电子战数据交换模型研究报告》

国外海军作战管理系统与作战训练系统

《压缩式分布式交互仿真标准》120页

相关资讯

「强化学习可解释性」最新2022综述

「强化学习可解释性」最新2022综述

专知

12+阅读 · 2022年1月16日

深度学习可解释性研究进展

深度学习可解释性研究进展

专知

19+阅读 · 2020年6月26日

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

AINLP

19+阅读 · 2020年6月14日

【伯克利PNAS最新论文】可解释机器学习的定义、方法和应用

【伯克利PNAS最新论文】可解释机器学习的定义、方法和应用

专知

78+阅读 · 2019年10月20日

AI可解释性文献列表

AI可解释性文献列表

专知

43+阅读 · 2019年10月7日

【Awesome】最全的机器学习可解释性资料（machine-learning-interpretability）

【Awesome】最全的机器学习可解释性资料（machine-learning-interpretability）

专知

29+阅读 · 2019年3月1日

可解释的机器学习

可解释的机器学习

平均机器

25+阅读 · 2019年2月25日

高赞新书《可解释的机器学习》出版：理解黑盒必备，免费资源

高赞新书《可解释的机器学习》出版：理解黑盒必备，免费资源

量子位

23+阅读 · 2019年2月23日

【UC伯克利】可解释性机器学习：定义、方法和应用

【UC伯克利】可解释性机器学习：定义、方法和应用

专知

70+阅读 · 2019年1月19日

【学界】机器学习模型的“可解释性”到底有多重要？

【学界】机器学习模型的“可解释性”到底有多重要？

GAN生成式对抗网络

12+阅读 · 2018年3月3日

相关论文

Estimation and Inference for Causal Explainability

Arxiv

0+阅读 · 3月6日

Circuit Insights: Towards Interpretability Beyond Activations

Arxiv

0+阅读 · 3月4日

Exact Functional ANOVA Decomposition for Categorical Inputs Models

Arxiv

0+阅读 · 3月3日

Mechanistic Indicators of Understanding in Large Language Models

Arxiv

0+阅读 · 2月25日

Formal Mechanistic Interpretability: Automated Circuit Discovery with Provable Guarantees

Arxiv

0+阅读 · 2月18日

Interpretability-by-Design with Accurate Locally Additive Models and Conditional Feature Effects

Arxiv

0+阅读 · 2月18日

Reproducibility and Statistical Methodology

Arxiv

0+阅读 · 2月17日

Probabilistic RNA Designability via Interpretable Ensemble Approximation and Dynamic Decomposition

Arxiv

0+阅读 · 2月14日

Momentum Attention: The Physics of In-Context Learning and Spectral Forensics for Mechanistic Interpretability

Arxiv

0+阅读 · 2月7日

Additive Models Explained: A Computational Complexity Approach

Arxiv

0+阅读 · 2月5日

相关基金

随机振动响应预测中的模型形式不确定性量化方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于动态相关机理分析的机械系统可靠性评估方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

正倒向随机微分方程与两类衍生模型的统计推断及金融中的应用

国家自然科学基金

2+阅读 · 2015年12月31日

考虑不确定性的结构动力学响应模型可信度确认方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

故障机理的不确定传播及系统故障自动推演建模方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于扩展的概率转移矩阵模型的高精度快速广义门电路可靠性评估方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

随机微分方程解的稳定性和矩有界性

国家自然科学基金

0+阅读 · 2015年12月31日

随机延迟微分方程数值解的延迟依赖稳定性及自适应技术

国家自然科学基金

0+阅读 · 2014年12月31日

微分代数方程中的误差可控计算理论与算法

国家自然科学基金

0+阅读 · 2014年12月31日

含有隐变量的因果结构学习与统计因果推断

国家自然科学基金

21+阅读 · 2013年12月31日

微信扫码咨询专知VIP会员