Post-Selection Distributional Model Evaluation - 专知论文

会员服务 ·

0

模型评估 · 样本 · 关键性能指标 · 性能指标 · 分析 ·

Post-Selection Distributional Model Evaluation

翻译：后验选择下的分布模型评估

Amirmohammad Farzaneh,Osvaldo Simeone

Formal model evaluation methods typically certify that a model satisfies a prescribed target key performance indicator (KPI) level. However, in many applications, the relevant target KPI level may not be known a priori, and the user may instead wish to compare candidate models by analyzing the full trade-offs between performance and reliability achievable at test time by the models. This task, requiring the reliable estimate of the test-time KPI distributions, is made more complicated by the fact that the same data must often be used both to pre-select a subset of candidate models and to estimate their KPI distributions, causing a potential post-selection bias. In this work, we introduce post-selection distributional model evaluation (PS-DME), a general framework for statistically valid distributional model assessment after arbitrary data-dependent model pre-selection. Building on e-values, PS-DME controls post-selection false coverage rate (FCR) for the distributional KPI estimates and is proved to be more sample efficient than a baseline method based on sample splitting. Experiments on synthetic data, text-to-SQL decoding with large language models, and telecom network performance evaluation demonstrate that PS-DME enables reliable comparison of candidate configurations across a range of reliability levels, supporting the statistically reliable exploration of performance--reliability trade-offs.

翻译：正式的模型评估方法通常需验证模型满足预设的关键性能指标（KPI）水平。然而，在许多应用中，目标KPI水平可能事先未知，用户更希望分析模型在测试时实现的性能与可靠性之间的完整权衡，从而比较候选模型。该任务需要可靠估计测试时的KPI分布，但由于同一数据通常需同时用于预选候选模型子集并估计其KPI分布，这可能导致后验选择偏差，使问题复杂化。本文提出后验选择分布模型评估（PS-DME），一个通用的统计有效框架，用于在任意数据依赖模型预选后进行分布型模型评估。基于e值构建，PS-DME能控制分布型KPI估计的后验选择错误覆盖率（FCR），并证明其比基于样本分割的基线方法更具样本效率。在合成数据、大语言模型文本到SQL解码及电信网络性能评估上的实验表明，PS-DME能在不同可靠性水平下实现候选配置的可靠比较，为性能-可靠性权衡的统计可信探索提供支持。

0

相关内容

模型评估

机器学习系统设计系统评估标准

《测试评估（T&E）与基于模型的系统工程（MBSE）的整合》最新120页

《测试评估（T&E）与基于模型的系统工程（MBSE）的整合》最新120页

专知会员服务

17+阅读 · 3月29日

【斯坦福博士论文】基础模型的数据分布视角，321页pdf

【斯坦福博士论文】基础模型的数据分布视角，321页pdf

专知会员服务

42+阅读 · 2024年7月8日

2024年中国大语言模型能力评析（一）：评测方法论与综合评测结果-AI变革行业创新发展

2024年中国大语言模型能力评析（一）：评测方法论与综合评测结果-AI变革行业创新发展

专知会员服务

42+阅读 · 2024年6月27日

清华大学《《SuperBench大模型综合能力评测报告》发布

清华大学《《SuperBench大模型综合能力评测报告》发布

专知会员服务

47+阅读 · 2024年4月20日

《模拟战争中的战斗评估》109页论文

《模拟战争中的战斗评估》109页论文

专知会员服务

113+阅读 · 2023年12月8日

事件抽取的再评价:过去、现在和未来的挑战

事件抽取的再评价:过去、现在和未来的挑战

专知会员服务

25+阅读 · 2023年11月28日

《防空反导作战中心的多级指挥和控制性能评估概念》

《防空反导作战中心的多级指挥和控制性能评估概念》

专知会员服务

96+阅读 · 2023年6月30日

《部分遮挡目标检测模型的基线评估》美陆军24页报告

《部分遮挡目标检测模型的基线评估》美陆军24页报告

专知会员服务

48+阅读 · 2023年6月26日

【2023新书】解释模型分析:探索、解释和检验预测模型，327页pdf

【2023新书】解释模型分析:探索、解释和检验预测模型，327页pdf

专知会员服务

88+阅读 · 2023年4月10日

【CIKM2020-北大】Set-Sequence-Graph:一种利用评论来获取推荐的多视图方法

专知会员服务

21+阅读 · 2020年9月22日

国家标准《信息技术大数据数据资产价值评估》（征求意见稿）

国家标准《信息技术大数据数据资产价值评估》（征求意见稿）

专知

18+阅读 · 2022年9月9日

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

AINLP

19+阅读 · 2020年6月14日

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

专知

11+阅读 · 2020年3月17日

【WWW2020-新加坡国立大学】知识图谱强化负采样的推荐系统，Reinforced Negative Sampling

【WWW2020-新加坡国立大学】知识图谱强化负采样的推荐系统，Reinforced Negative Sampling

专知

22+阅读 · 2020年3月14日

多因素问题分析时，如何确立各因素权重？

多因素问题分析时，如何确立各因素权重？

人人都是产品经理

75+阅读 · 2020年3月4日

你的算法可靠吗？神经网络不确定性度量

你的算法可靠吗？神经网络不确定性度量

专知

40+阅读 · 2019年4月27日

深度 | 推荐系统评估

深度 | 推荐系统评估

AI100

24+阅读 · 2019年3月16日

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

机器学习研究会

19+阅读 · 2018年3月11日

推荐｜机器学习中的模型评价、模型选择和算法选择！

推荐｜机器学习中的模型评价、模型选择和算法选择！

全球人工智能

10+阅读 · 2018年2月5日

推荐算法：Match与Rank模型的交织配合

推荐算法：Match与Rank模型的交织配合

从0到1

15+阅读 · 2017年12月18日

测量误差数据下部分线性模型有约束统计推断理论

国家自然科学基金

2+阅读 · 2015年12月31日

高维回归模型的预测稳定性研究

国家自然科学基金

3+阅读 · 2015年12月31日

方差正则化的分类模型选择方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于异构信息网络的分类算法推荐方法研究

国家自然科学基金

7+阅读 · 2015年12月31日

试验设计中的模型选择

国家自然科学基金

6+阅读 · 2014年12月31日

测量误差数据下约束线性模型的有偏估计及变量选择研究

国家自然科学基金

0+阅读 · 2014年12月31日

广义线性模型的组变量选择及其在信用评分中的应用

国家自然科学基金

2+阅读 · 2014年12月31日

复杂数据下含指标项半参数模型结构的统计推断及应用

国家自然科学基金

0+阅读 · 2014年12月31日

基于第三方的APP软件质量度量和评估方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

具有可靠性增长的系统可靠性试验鉴定方法研究

国家自然科学基金

10+阅读 · 2013年12月31日

Beyond the Training Distribution: Evaluating Predictions Under Distribution Shift and Selection Bias

Arxiv

0+阅读 · 6月12日

Distributional Biases in Post-Training: A Markovian Analysis of Reasoning Trajectories

Arxiv

0+阅读 · 6月12日

Query-efficient model evaluation using cached responses

Arxiv

0+阅读 · 6月4日

Beyond Point Estimates: Reliable Evaluation of Prediction Performance Metrics under Clustered Data

Arxiv

0+阅读 · 6月3日

Beyond Point Estimates: Reliable Evaluation of Prediction Performance Metrics under Clustered Data

Arxiv

0+阅读 · 6月2日

A Theoretical Framework for Statistical Evaluability of Generative Models

Arxiv

0+阅读 · 6月1日

Beyond Point Estimates: Distributional Uncertainty in Machine Learning Performance Evaluation

Arxiv

0+阅读 · 5月12日

What should post-training optimize? A test-time scaling law perspective

Arxiv

0+阅读 · 5月11日

Post-Selection Distributional Model Evaluation

Arxiv

0+阅读 · 5月7日

Post-Selection Distributional Model Evaluation

Arxiv

0+阅读 · 4月10日

VIP会员

文章信息

相关主题

关键性能指标

最新内容

深入解读 Palantir AIP：全球最具争议的人工智能平台究竟如何运作

深入解读 Palantir AIP：全球最具争议的人工智能平台究竟如何运作

专知会员服务

11+阅读 · 6月20日

ICML 2026 | 多任务贝叶斯上下文学习：让 Transformer 在测试时显式适应新先验

ICML 2026 | 多任务贝叶斯上下文学习：让 Transformer 在测试时显式适应新先验

专知会员服务

4+阅读 · 6月19日

ACL 2026综述 | 大规模手语数据集：资源、基准与标注标准

ACL 2026综述 | 大规模手语数据集：资源、基准与标注标准

专知会员服务

6+阅读 · 6月19日

ICML 2026 Spotlight | SmoothSMoE：解析稀疏 MoE 路由不连续

ICML 2026 Spotlight | SmoothSMoE：解析稀疏 MoE 路由不连续

专知会员服务

6+阅读 · 6月18日

综述 | 周期表视角下的大模型推理：范式、方法与失败模式

综述 | 周期表视角下的大模型推理：范式、方法与失败模式

专知会员服务

8+阅读 · 6月18日

《廉价自杀式无人机战争的军事战略影响：乌克兰和伊朗案例研究》

《廉价自杀式无人机战争的军事战略影响：乌克兰和伊朗案例研究》

专知会员服务

11+阅读 · 6月18日

《面向反无人机作战的联邦式可解释射频–光电/红外情报融合：边缘人工智能优化、电子战韧性及分布式监视验证》

《面向反无人机作战的联邦式可解释射频–光电/红外情报融合：边缘人工智能优化、电子战韧性及分布式监视验证》

专知会员服务

11+阅读 · 6月18日

ICML 2026 | FR3D：解耦自车运动的未来动态三维重建世界模型

ICML 2026 | FR3D：解耦自车运动的未来动态三维重建世界模型

专知会员服务

7+阅读 · 6月17日

【伯克利博士论文】迈向可扩展与自我演进的大语言模型智能体

【伯克利博士论文】迈向可扩展与自我演进的大语言模型智能体

专知会员服务

12+阅读 · 6月17日

学习数据的几何：形状空间分析数学综述

学习数据的几何：形状空间分析数学综述

专知会员服务

8+阅读 · 6月17日

《现代防空系统综述：架构、传感器、拦截器及新兴威胁环境对基础设施受限防御环境的影响》2026最新长综述

《现代防空系统综述：架构、传感器、拦截器及新兴威胁环境对基础设施受限防御环境的影响》2026最新长综述

专知会员服务

21+阅读 · 6月17日

定向能反无人机系统最新发展动态

定向能反无人机系统最新发展动态

专知会员服务

10+阅读 · 6月17日

从燃煤战舰到算法战争：水面指挥的永恒要求

从燃煤战舰到算法战争：水面指挥的永恒要求

专知会员服务

6+阅读 · 6月17日

《短程弹道再入飞行器拦截时间中的一项异常现象》

《短程弹道再入飞行器拦截时间中的一项异常现象》

专知会员服务

8+阅读 · 6月17日

《基于回归方法与任务上下文的对抗环境动态战术网络报文优先级排序》

《基于回归方法与任务上下文的对抗环境动态战术网络报文优先级排序》

专知会员服务

8+阅读 · 6月17日

相关VIP内容

《测试评估（T&E）与基于模型的系统工程（MBSE）的整合》最新120页

《测试评估（T&E）与基于模型的系统工程（MBSE）的整合》最新120页

专知会员服务

17+阅读 · 3月29日

【斯坦福博士论文】基础模型的数据分布视角，321页pdf

【斯坦福博士论文】基础模型的数据分布视角，321页pdf

专知会员服务

42+阅读 · 2024年7月8日

2024年中国大语言模型能力评析（一）：评测方法论与综合评测结果-AI变革行业创新发展

2024年中国大语言模型能力评析（一）：评测方法论与综合评测结果-AI变革行业创新发展

专知会员服务

42+阅读 · 2024年6月27日

清华大学《《SuperBench大模型综合能力评测报告》发布

清华大学《《SuperBench大模型综合能力评测报告》发布

专知会员服务

47+阅读 · 2024年4月20日

《模拟战争中的战斗评估》109页论文

《模拟战争中的战斗评估》109页论文

专知会员服务

113+阅读 · 2023年12月8日

事件抽取的再评价:过去、现在和未来的挑战

事件抽取的再评价:过去、现在和未来的挑战

专知会员服务

25+阅读 · 2023年11月28日

《防空反导作战中心的多级指挥和控制性能评估概念》

《防空反导作战中心的多级指挥和控制性能评估概念》

专知会员服务

96+阅读 · 2023年6月30日

《部分遮挡目标检测模型的基线评估》美陆军24页报告

《部分遮挡目标检测模型的基线评估》美陆军24页报告

专知会员服务

48+阅读 · 2023年6月26日

【2023新书】解释模型分析:探索、解释和检验预测模型，327页pdf

【2023新书】解释模型分析:探索、解释和检验预测模型，327页pdf

专知会员服务

88+阅读 · 2023年4月10日

【CIKM2020-北大】Set-Sequence-Graph:一种利用评论来获取推荐的多视图方法

专知会员服务

21+阅读 · 2020年9月22日

热门VIP内容

开通专知VIP会员享更多权益服务

深入解读 Palantir AIP：全球最具争议的人工智能平台究竟如何运作

ICML 2026 | 多任务贝叶斯上下文学习：让 Transformer 在测试时显式适应新先验

ACL 2026综述 | 大规模手语数据集：资源、基准与标注标准

相关资讯

国家标准《信息技术大数据数据资产价值评估》（征求意见稿）

国家标准《信息技术大数据数据资产价值评估》（征求意见稿）

专知

18+阅读 · 2022年9月9日

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

AINLP

19+阅读 · 2020年6月14日

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

专知

11+阅读 · 2020年3月17日

【WWW2020-新加坡国立大学】知识图谱强化负采样的推荐系统，Reinforced Negative Sampling

【WWW2020-新加坡国立大学】知识图谱强化负采样的推荐系统，Reinforced Negative Sampling

专知

22+阅读 · 2020年3月14日

多因素问题分析时，如何确立各因素权重？

多因素问题分析时，如何确立各因素权重？

人人都是产品经理

75+阅读 · 2020年3月4日

你的算法可靠吗？神经网络不确定性度量

你的算法可靠吗？神经网络不确定性度量

专知

40+阅读 · 2019年4月27日

深度 | 推荐系统评估

深度 | 推荐系统评估

AI100

24+阅读 · 2019年3月16日

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

机器学习研究会

19+阅读 · 2018年3月11日

推荐｜机器学习中的模型评价、模型选择和算法选择！

推荐｜机器学习中的模型评价、模型选择和算法选择！

全球人工智能

10+阅读 · 2018年2月5日

推荐算法：Match与Rank模型的交织配合

推荐算法：Match与Rank模型的交织配合

从0到1

15+阅读 · 2017年12月18日

相关论文

Beyond the Training Distribution: Evaluating Predictions Under Distribution Shift and Selection Bias

Arxiv

0+阅读 · 6月12日

Distributional Biases in Post-Training: A Markovian Analysis of Reasoning Trajectories

Arxiv

0+阅读 · 6月12日

Query-efficient model evaluation using cached responses

Arxiv

0+阅读 · 6月4日

Beyond Point Estimates: Reliable Evaluation of Prediction Performance Metrics under Clustered Data

Arxiv

0+阅读 · 6月3日

Beyond Point Estimates: Reliable Evaluation of Prediction Performance Metrics under Clustered Data

Arxiv

0+阅读 · 6月2日

A Theoretical Framework for Statistical Evaluability of Generative Models

Arxiv

0+阅读 · 6月1日

Beyond Point Estimates: Distributional Uncertainty in Machine Learning Performance Evaluation

Arxiv

0+阅读 · 5月12日

What should post-training optimize? A test-time scaling law perspective

Arxiv

0+阅读 · 5月11日

Post-Selection Distributional Model Evaluation

Arxiv

0+阅读 · 5月7日

Post-Selection Distributional Model Evaluation

Arxiv

0+阅读 · 4月10日

相关基金

测量误差数据下部分线性模型有约束统计推断理论

国家自然科学基金

2+阅读 · 2015年12月31日

高维回归模型的预测稳定性研究

国家自然科学基金

3+阅读 · 2015年12月31日

方差正则化的分类模型选择方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于异构信息网络的分类算法推荐方法研究

国家自然科学基金

7+阅读 · 2015年12月31日

试验设计中的模型选择

国家自然科学基金

6+阅读 · 2014年12月31日

测量误差数据下约束线性模型的有偏估计及变量选择研究

国家自然科学基金

0+阅读 · 2014年12月31日

广义线性模型的组变量选择及其在信用评分中的应用

国家自然科学基金

2+阅读 · 2014年12月31日

复杂数据下含指标项半参数模型结构的统计推断及应用

国家自然科学基金

0+阅读 · 2014年12月31日

基于第三方的APP软件质量度量和评估方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

具有可靠性增长的系统可靠性试验鉴定方法研究

国家自然科学基金

10+阅读 · 2013年12月31日

微信扫码咨询专知VIP会员