The Relative Instability of Model Comparison with Cross-validation

Cross-validation (CV) is known to provide asymptotically exact tests and confidence intervals for model improvement but only when the model comparison is relatively stable. Surprisingly, we prove that even simple, individually stable models can generate relatively unstable comparisons, calling into question the validity of CV inference. Specifically, we show that the Lasso and its close cousin, soft-thresholding, generate relatively unstable comparisons and invalid CV inferences, even in the most favorable of learning settings and when both models are individually stable. These findings highlight the importance of verifying relative stability before deploying CV for model comparison.

翻译：交叉验证（CV）已知能在模型比较相对稳定时提供渐近精确的检验和置信区间，以评估模型改进效果。然而，我们令人惊讶地证明，即使是简单且个体稳定的模型也可能产生相对不稳定的比较结果，这质疑了交叉验证推断的有效性。具体而言，我们表明Lasso及其近亲软阈值方法即使在最有利的学习环境下且两个模型个体稳定时，也会导致相对不稳定的比较和无效的交叉验证推断。这些发现强调了在运用交叉验证进行模型比较前验证相对稳定性的重要性。

相关内容

交叉验证

关注 2

交叉验证，有时也称为旋转估计或样本外测试，是用于评估统计结果如何的各种类似模型验证技术中的任何一种分析将概括为一个独立的数据集。它主要用于设置，其目的是预测，和一个想要估计如何准确地一个预测模型在实践中执行。在预测问题中，通常会给模型一个已知数据的数据集，在该数据集上进行训练（训练数据集）以及未知数据（或首次看到的数据）的数据集（根据该数据集测试模型）（称为验证数据集或测试集）。交叉验证的目标是测试模型预测未用于估计数据的新数据的能力，以发现诸如过度拟合或选择偏倚之类的问题，并提供有关如何进行建模的见解。该模型将推广到一个独立的数据集（例如，未知数据集，例如来自实际问题的数据集）。一轮交叉验证涉及分割一个样品的数据到互补的子集，在一个子集执行所述分析（称为训练集），以及验证在另一子集中的分析（称为验证集合或测试集）。为了减少可变性，在大多数方法中，使用不同的分区执行多轮交叉验证，并将验证结果组合（例如取平均值）在各轮中，以估计模型的预测性能。总而言之，交叉验证结合了预测中适用性的度量（平均），以得出模型预测性能的更准确估计。

【博士论文】基于不确定性的可靠性：现代机器学习中的选择性预测与可信部署

专知会员服务

24+阅读 · 2025年8月14日

【斯坦福博士论文】概率机器学习中的不确定性原理

专知会员服务

27+阅读 · 2025年8月4日

【牛津博士论文】大规模观测因果机器学习中的结构与统计不确定性

专知会员服务

30+阅读 · 2024年9月29日

【牛津大学博士论文】观察性因果机器学习中的结构性和统计不确定性

专知会员服务

32+阅读 · 2024年9月24日