Decomposing Physician Disagreement in HealthBench - 专知论文

会员服务 ·

0

不确定 · 不确定性 · 分解 · 方差 · AUC ·

Decomposing Physician Disagreement in HealthBench

翻译：分解HealthBench中医生评估分歧的成因

Satya Borgohain,Roy Mariathas

We decompose physician disagreement in the HealthBench medical AI evaluation dataset to understand where variance resides and what observable features can explain it. Rubric identity accounts for 15.8% of met/not-met label variance but only 3.6-6.9% of disagreement variance; physician identity accounts for just 2.4%. The dominant 81.8% case-level residual is not reduced by HealthBench's metadata labels (z = -0.22, p = 0.83), normative rubric language (pseudo R^2 = 1.2%), medical specialty (0/300 Tukey pairs significant), surface-feature triage (AUC = 0.58), or embeddings (AUC = 0.485). Disagreement follows an inverted-U with completion quality (AUC = 0.689), confirming physicians agree on clearly good or bad outputs but split on borderline cases. Physician-validated uncertainty categories reveal that reducible uncertainty (missing context, ambiguous phrasing) more than doubles disagreement odds (OR = 2.55, p < 10^(-24)), while irreducible uncertainty (genuine medical ambiguity) has no effect (OR = 1.01, p = 0.90), though even the former explains only ~3% of total variance. The agreement ceiling in medical AI evaluation is thus largely structural, but the reducible/irreducible dissociation suggests that closing information gaps in evaluation scenarios could lower disagreement where inherent clinical ambiguity does not, pointing toward actionable evaluation design improvements.

翻译：本研究对HealthBench医疗人工智能评估数据集中的医生评估分歧进行分解，以探究差异来源及其可解释性特征。评分标准身份解释了15.8%的"符合/不符合"标签方差，但仅能解释3.6-6.9%的分歧方差；医生身份仅贡献2.4%。占主导地位的81.8%病例级残差无法通过HealthBench元数据标签（z = -0.22, p = 0.83）、规范性评分标准语言（伪R² = 1.2%）、医学专业（300组Tukey检验均不显著）、表面特征分诊（AUC = 0.58）或嵌入表示（AUC = 0.485）得到解释。分歧与回答质量呈倒U型关系（AUC = 0.689），证实医生对明显优劣的回答达成共识，而对临界案例存在分歧。经医生验证的不确定性分类显示：可约不确定性（缺失语境、表述模糊）使分歧几率提升超两倍（OR = 2.55, p < 10⁻²⁴），而不可约不确定性（真实医学模糊性）无显著影响（OR = 1.01, p = 0.90），但前者仅能解释约3%的总方差。医疗AI评估中的一致性上限主要源于结构性因素，但可约/不可约不确定性的解离现象表明：在非固有临床模糊性场景中，通过填补评估信息缺口可降低分歧，这为可操作的评估设计改进指明了方向。

0

相关内容

不确定

《可信的医学问答：以评估为中心的综述》

《可信的医学问答：以评估为中心的综述》

专知会员服务

13+阅读 · 2025年6月5日

港科大最新《深度学习医学图像分割MedISeg》综述论文，21页pdf涵盖212篇文献阐述MedISeg技巧、挑战和未来方向

港科大最新《深度学习医学图像分割MedISeg》综述论文，21页pdf涵盖212篇文献阐述MedISeg技巧、挑战和未来方向

专知会员服务

42+阅读 · 2022年9月22日

《用于医疗数据的分析和机器学习》佐治亚理工学院137页博士论文

《用于医疗数据的分析和机器学习》佐治亚理工学院137页博士论文

专知会员服务

26+阅读 · 2022年7月21日

MIT最新论文《对可解释特征的需求：动机和分类》：在机器学习模型的组成元素中建立可解释性

MIT最新论文《对可解释特征的需求：动机和分类》：在机器学习模型的组成元素中建立可解释性

专知会员服务

25+阅读 · 2022年6月30日

医学诊断如何可解释？贝拉内大学最新《医学诊断中可解释深度学习方法》综述，36页pdf153篇文献概述最新XAI医学诊断进展

医学诊断如何可解释？贝拉内大学最新《医学诊断中可解释深度学习方法》综述，36页pdf153篇文献概述最新XAI医学诊断进展

专知会员服务

92+阅读 · 2022年5月14日

《异构观测数据中的联合因果推理》美国艾莫利大学、微软、约翰霍普金斯大学、哈佛大学、斯坦福大学等联合发表最新论文63页PDF

《异构观测数据中的联合因果推理》美国艾莫利大学、微软、约翰霍普金斯大学、哈佛大学、斯坦福大学等联合发表最新论文63页PDF

专知会员服务

29+阅读 · 2022年4月28日

【PKDD2021】医疗健康中的公平机器学习:实用指南，142页ppt

专知会员服务

30+阅读 · 2021年6月9日

基于图深度学习的医疗诊断与分析：过去，现在与未来

专知会员服务

68+阅读 · 2021年6月3日

剑桥大学《人工智能在药物发现中的作用》，附论文与31页PPT

剑桥大学《人工智能在药物发现中的作用》，附论文与31页PPT

专知会员服务

56+阅读 · 2021年2月20日

【帝国理工学院】医疗影像中「因果性」至关重要，Glocker这52页ppt讲述医疗机器学习因果性

【帝国理工学院】医疗影像中「因果性」至关重要，Glocker这52页ppt讲述医疗机器学习因果性

专知会员服务

51+阅读 · 2020年3月15日

不可错过！斯坦福《人工智能医学健康》课程，全面阐述AI在医学的应用，附Slides

不可错过！斯坦福《人工智能医学健康》课程，全面阐述AI在医学的应用，附Slides

专知

11+阅读 · 2022年10月24日

医疗健康领域的短文本解析探索----文本纠错

医疗健康领域的短文本解析探索----文本纠错

深度学习自然语言处理

10+阅读 · 2020年8月5日

【综述】医疗可解释人工智能综述论文

【综述】医疗可解释人工智能综述论文

专知

33+阅读 · 2019年7月18日

用深度学习揭示数据的因果关系

用深度学习揭示数据的因果关系

专知

28+阅读 · 2019年5月18日

医疗中的自动机器学习和可解释性

医疗中的自动机器学习和可解释性

专知

24+阅读 · 2019年4月1日

Nature Medicine连发9篇论文，Jeff Dean、吴恩达等最新研究入列

Nature Medicine连发9篇论文，Jeff Dean、吴恩达等最新研究入列

新智元

15+阅读 · 2019年1月14日

Jeff Dean等发文《Nature Medicine》，综述深度学习在医疗领域的应用

Jeff Dean等发文《Nature Medicine》，综述深度学习在医疗领域的应用

机器之心

13+阅读 · 2019年1月13日

AI+医疗真正落地？Nature Medicine同时刊登9篇论文，聚焦人工智能在医学领域的应用

AI+医疗真正落地？Nature Medicine同时刊登9篇论文，聚焦人工智能在医学领域的应用

专知

14+阅读 · 2019年1月12日

隐私和机器学习：两个意想不到的盟友？一文了解差分隐私

隐私和机器学习：两个意想不到的盟友？一文了解差分隐私

专知

21+阅读 · 2018年5月14日

基于深度学习的医疗影像论文汇总（Deep Learning Papers on Medical Image Analysis）

基于深度学习的医疗影像论文汇总（Deep Learning Papers on Medical Image Analysis）

AI研习社

17+阅读 · 2017年10月21日

基于多主题和网络模型的社交媒体电子医疗用户推荐研究

国家自然科学基金

2+阅读 · 2015年12月31日

大型复杂医学领域本体质量评估理论研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于项目反应理论和混合值差度量的中医个体化诊疗疗效评价方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

生物医疗大数据集成分析的统计与计算方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

医生工作生态视角下的分级诊疗机制建模与实证研究

国家自然科学基金

2+阅读 · 2015年12月31日

复杂纵向数据的分位回归建模及其在生物医学大数据中的应用

国家自然科学基金

4+阅读 · 2015年12月31日

基于潜在类别回归模型的失眠中医人群特征分类方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于EHR结构模型和DCM的医学术语协同化方法研究

国家自然科学基金

4+阅读 · 2014年12月31日

医疗健康网站信息可信度与质量控制研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于部分核实数据的统计推断及应用

国家自然科学基金

0+阅读 · 2014年12月31日

Bridging the Gap in the Responsible AI Divides

Arxiv

0+阅读 · 3月15日

Evaluation format, not model capability, drives triage failure in the assessment of consumer health AI

Arxiv

0+阅读 · 3月15日

Measuring Perceptions of Fairness in AI Systems: The Effects of Infra-marginality

Arxiv

0+阅读 · 3月6日

Statistical Inference for Score Decompositions

Arxiv

0+阅读 · 3月4日

Personal Health Data Integration and Intelligence through Semantic Web and Blockchain Technologies

Arxiv

0+阅读 · 3月2日

Decomposing Physician Disagreement in HealthBench

Arxiv

0+阅读 · 2月26日

Towards explainable reference-free speech intelligibility evaluation of people with pathological speech

Arxiv

0+阅读 · 2月13日

Understanding Fairness and Prediction Error through Subspace Decomposition and Influence Analysis

Arxiv

0+阅读 · 2月7日

Towards Visually Explaining Statistical Tests with Applications in Biomedical Imaging

Arxiv

0+阅读 · 2月5日

Understanding-informed Bias Mitigation for Fair CMR Segmentation

Arxiv

0+阅读 · 2月3日

VIP会员

文章信息

相关主题

最新内容

博士论文 | 面向大模型推理的内存高效算法

博士论文 | 面向大模型推理的内存高效算法

专知会员服务

0+阅读 · 42分钟前

论文解读 | 从预训练到后训练：理解大模型推理能力如何形成

论文解读 | 从预训练到后训练：理解大模型推理能力如何形成

专知会员服务

0+阅读 · 44分钟前

《无人系统互操作性导论——无人系统联合架构（JAUS）》

《无人系统互操作性导论——无人系统联合架构（JAUS）》

专知会员服务

8+阅读 · 今天5:53

美空军新型反无人机部队初探

美空军新型反无人机部队初探

专知会员服务

4+阅读 · 今天5:45

《对抗性电磁环境下远程巡飞弹作战的安全指挥与控制数据链》

《对抗性电磁环境下远程巡飞弹作战的安全指挥与控制数据链》

专知会员服务

2+阅读 · 今天5:23

《北约下一代建模与仿真（NexGen M&S）计划》2026年69页

《北约下一代建模与仿真（NexGen M&S）计划》2026年69页

专知会员服务

2+阅读 · 今天5:11

《防空交战流程的概率建模研究》

《防空交战流程的概率建模研究》

专知会员服务

6+阅读 · 今天5:04

ICML 2026 教程 | 数值优化理论还重要吗？

ICML 2026 教程 | 数值优化理论还重要吗？

专知会员服务

4+阅读 · 7月26日

ICM 2026 | 陶哲轩：人工智能时代的数学

ICM 2026 | 陶哲轩：人工智能时代的数学

专知会员服务

8+阅读 · 7月26日

《面向可扩展高韧性无人机集群网络的速度感知分层通信框架》

《面向可扩展高韧性无人机集群网络的速度感知分层通信框架》

专知会员服务

8+阅读 · 7月26日

《面向概率推理的可定制战术引擎及其在军事任务规划中的应用》

《面向概率推理的可定制战术引擎及其在军事任务规划中的应用》

专知会员服务

10+阅读 · 7月26日

《先进防空系统选型战略框架：基于巴基斯坦的实证启示》

《先进防空系统选型战略框架：基于巴基斯坦的实证启示》

专知会员服务

8+阅读 · 7月26日

《反无人机交战场景下的战斗归零研究》

《反无人机交战场景下的战斗归零研究》

专知会员服务

7+阅读 · 7月26日

霍尔木兹与不对称作战时代：水雷、无人系统与海军力量的重新定义

霍尔木兹与不对称作战时代：水雷、无人系统与海军力量的重新定义

专知会员服务

4+阅读 · 7月26日

博士论文 | 用代码结构感知方法推进代码大模型

博士论文 | 用代码结构感知方法推进代码大模型

专知会员服务

5+阅读 · 7月25日

相关VIP内容

《可信的医学问答：以评估为中心的综述》

《可信的医学问答：以评估为中心的综述》

专知会员服务

13+阅读 · 2025年6月5日

港科大最新《深度学习医学图像分割MedISeg》综述论文，21页pdf涵盖212篇文献阐述MedISeg技巧、挑战和未来方向

港科大最新《深度学习医学图像分割MedISeg》综述论文，21页pdf涵盖212篇文献阐述MedISeg技巧、挑战和未来方向

专知会员服务

42+阅读 · 2022年9月22日

《用于医疗数据的分析和机器学习》佐治亚理工学院137页博士论文

《用于医疗数据的分析和机器学习》佐治亚理工学院137页博士论文

专知会员服务

26+阅读 · 2022年7月21日

MIT最新论文《对可解释特征的需求：动机和分类》：在机器学习模型的组成元素中建立可解释性

MIT最新论文《对可解释特征的需求：动机和分类》：在机器学习模型的组成元素中建立可解释性

专知会员服务

25+阅读 · 2022年6月30日

医学诊断如何可解释？贝拉内大学最新《医学诊断中可解释深度学习方法》综述，36页pdf153篇文献概述最新XAI医学诊断进展

医学诊断如何可解释？贝拉内大学最新《医学诊断中可解释深度学习方法》综述，36页pdf153篇文献概述最新XAI医学诊断进展

专知会员服务

92+阅读 · 2022年5月14日

《异构观测数据中的联合因果推理》美国艾莫利大学、微软、约翰霍普金斯大学、哈佛大学、斯坦福大学等联合发表最新论文63页PDF

《异构观测数据中的联合因果推理》美国艾莫利大学、微软、约翰霍普金斯大学、哈佛大学、斯坦福大学等联合发表最新论文63页PDF

专知会员服务

29+阅读 · 2022年4月28日

【PKDD2021】医疗健康中的公平机器学习:实用指南，142页ppt

专知会员服务

30+阅读 · 2021年6月9日

基于图深度学习的医疗诊断与分析：过去，现在与未来

专知会员服务

68+阅读 · 2021年6月3日

剑桥大学《人工智能在药物发现中的作用》，附论文与31页PPT

剑桥大学《人工智能在药物发现中的作用》，附论文与31页PPT

专知会员服务

56+阅读 · 2021年2月20日

【帝国理工学院】医疗影像中「因果性」至关重要，Glocker这52页ppt讲述医疗机器学习因果性

【帝国理工学院】医疗影像中「因果性」至关重要，Glocker这52页ppt讲述医疗机器学习因果性

专知会员服务

51+阅读 · 2020年3月15日

热门VIP内容

开通专知VIP会员享更多权益服务

论文解读 | 从预训练到后训练：理解大模型推理能力如何形成

美空军新型反无人机部队初探

博士论文 | 面向大模型推理的内存高效算法

《无人系统互操作性导论——无人系统联合架构（JAUS）》

相关资讯

不可错过！斯坦福《人工智能医学健康》课程，全面阐述AI在医学的应用，附Slides

不可错过！斯坦福《人工智能医学健康》课程，全面阐述AI在医学的应用，附Slides

专知

11+阅读 · 2022年10月24日

医疗健康领域的短文本解析探索----文本纠错

医疗健康领域的短文本解析探索----文本纠错

深度学习自然语言处理

10+阅读 · 2020年8月5日

【综述】医疗可解释人工智能综述论文

【综述】医疗可解释人工智能综述论文

专知

33+阅读 · 2019年7月18日

用深度学习揭示数据的因果关系

用深度学习揭示数据的因果关系

专知

28+阅读 · 2019年5月18日

医疗中的自动机器学习和可解释性

医疗中的自动机器学习和可解释性

专知

24+阅读 · 2019年4月1日

Nature Medicine连发9篇论文，Jeff Dean、吴恩达等最新研究入列

Nature Medicine连发9篇论文，Jeff Dean、吴恩达等最新研究入列

新智元

15+阅读 · 2019年1月14日

Jeff Dean等发文《Nature Medicine》，综述深度学习在医疗领域的应用

Jeff Dean等发文《Nature Medicine》，综述深度学习在医疗领域的应用

机器之心

13+阅读 · 2019年1月13日

AI+医疗真正落地？Nature Medicine同时刊登9篇论文，聚焦人工智能在医学领域的应用

AI+医疗真正落地？Nature Medicine同时刊登9篇论文，聚焦人工智能在医学领域的应用

专知

14+阅读 · 2019年1月12日

隐私和机器学习：两个意想不到的盟友？一文了解差分隐私

隐私和机器学习：两个意想不到的盟友？一文了解差分隐私

专知

21+阅读 · 2018年5月14日

基于深度学习的医疗影像论文汇总（Deep Learning Papers on Medical Image Analysis）

基于深度学习的医疗影像论文汇总（Deep Learning Papers on Medical Image Analysis）

AI研习社

17+阅读 · 2017年10月21日

相关论文

Bridging the Gap in the Responsible AI Divides

Arxiv

0+阅读 · 3月15日

Evaluation format, not model capability, drives triage failure in the assessment of consumer health AI

Arxiv

0+阅读 · 3月15日

Measuring Perceptions of Fairness in AI Systems: The Effects of Infra-marginality

Arxiv

0+阅读 · 3月6日

Statistical Inference for Score Decompositions

Arxiv

0+阅读 · 3月4日

Personal Health Data Integration and Intelligence through Semantic Web and Blockchain Technologies

Arxiv

0+阅读 · 3月2日

Decomposing Physician Disagreement in HealthBench

Arxiv

0+阅读 · 2月26日

Towards explainable reference-free speech intelligibility evaluation of people with pathological speech

Arxiv

0+阅读 · 2月13日

Understanding Fairness and Prediction Error through Subspace Decomposition and Influence Analysis

Arxiv

0+阅读 · 2月7日

Towards Visually Explaining Statistical Tests with Applications in Biomedical Imaging

Arxiv

0+阅读 · 2月5日

Understanding-informed Bias Mitigation for Fair CMR Segmentation

Arxiv

0+阅读 · 2月3日

相关基金

基于多主题和网络模型的社交媒体电子医疗用户推荐研究

国家自然科学基金

2+阅读 · 2015年12月31日

大型复杂医学领域本体质量评估理论研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于项目反应理论和混合值差度量的中医个体化诊疗疗效评价方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

生物医疗大数据集成分析的统计与计算方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

医生工作生态视角下的分级诊疗机制建模与实证研究

国家自然科学基金

2+阅读 · 2015年12月31日

复杂纵向数据的分位回归建模及其在生物医学大数据中的应用

国家自然科学基金

4+阅读 · 2015年12月31日

基于潜在类别回归模型的失眠中医人群特征分类方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于EHR结构模型和DCM的医学术语协同化方法研究

国家自然科学基金

4+阅读 · 2014年12月31日

医疗健康网站信息可信度与质量控制研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于部分核实数据的统计推断及应用

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员