PRADAS: PRior-Assisted DAta Splitting for False Discovery Rate Control - 专知论文

会员服务 ·

0

PRADAS: PRior-Assisted DAta Splitting for False Discovery Rate Control

翻译：标题：PRADAS：基于先验信息的数据分割方法用于错误发现率控制

Yuanchuan Guo,Buyu Lin,Jun S. Liu

from arxiv, 61 pages, 6 figures

In the FDR-controlling literature, mirror statistics offer a flexible alternative to $p$-value based procedures. When prior information is available, however, it is unclear how to incorporate mirror statistics in a principled way, and the standard equal split used by data-splitting methods can be inefficient. In this paper, we characterize a broader class of mirror statistics for any fixed splitting scheme and establish asymptotic FDR control under mild weak-dependence conditions using a two-stage procedure inspired by \cite{li2021whiteout}. Within this class, we derive a Bayes-optimal mirror statistic. Theoretically, we demonstrate its power advantage through analyses in the Rare/Weak signal model. Building upon this Bayes-optimal mirror statistic, we propose \textsc{PRADAS} (PRior-Assisted DAta Splitting) that treats split ratio as a stopping time and recasts the data-splitting as an optional stopping over a natural filtration; the optimal stopping rule is characterized by the Snell envelope and computed efficiently via a Longstaff--Schwartz regression approximation. Both simulations and real data examples demonstrate the effectiveness of our proposed framework.

翻译：摘要：在错误发现率（FDR）控制文献中，镜像统计量提供了基于$p$值方法的一种灵活替代方案。然而，当存在先验信息时，如何以原则性方式整合镜像统计量尚不明确，且数据分割方法中使用的标准等分策略可能效率低下。本文针对任意固定分割方案刻画了一类更广泛的镜像统计量，并借鉴\cite{li2021whiteout}的两阶段方法，在温和弱相依条件下建立了渐近FDR控制。在该类镜像统计量中，我们推导出贝叶斯最优镜像统计量。理论上，通过稀有/弱信号模型的分析，我们证明了其功率优势。基于此贝叶斯最优镜像统计量，我们提出\textsc{PRADAS}（基于先验信息辅助的数据分割），该方法将分割比例视为停时，并将数据分割重新表述为自然滤子上的可选停时；最优停时规则通过Snell包络刻画，并通过Longstaff-Schwartz回归近似高效计算。仿真实验和真实数据案例均验证了我们所提出框架的有效性。

0

相关内容

【CMU博士论文】分布偏移下的不确定性量化，226页pdf

【CMU博士论文】分布偏移下的不确定性量化，226页pdf

专知会员服务

31+阅读 · 2023年9月30日

错误信息检测《对错误信息、宣传和谬论的综合注释进行稳健且可解释的识别》美军2023最新88页报告

错误信息检测《对错误信息、宣传和谬论的综合注释进行稳健且可解释的识别》美军2023最新88页报告

专知会员服务

30+阅读 · 2023年9月14日

【牛津大学博士论文】使用深度学习在医学图像分割中保持已知的解剖结构拓扑

【牛津大学博士论文】使用深度学习在医学图像分割中保持已知的解剖结构拓扑

专知会员服务

27+阅读 · 2023年7月19日

【估计定位、导航和授时（PNT）传感器和系统的目标位置误差】《多用途通用简化目标位置误差（TLE）计算器（MUSTC）》2022最新112页技术报告，美国陆军研究实验室

【估计定位、导航和授时（PNT）传感器和系统的目标位置误差】《多用途通用简化目标位置误差（TLE）计算器（MUSTC）》2022最新112页技术报告，美国陆军研究实验室

专知会员服务

47+阅读 · 2022年10月25日

上海交大最新《标签高效深度分割》研究进展综述，全面阐述无监督、粗监督、不完全监督和噪声监督的深度分割方法

上海交大最新《标签高效深度分割》研究进展综述，全面阐述无监督、粗监督、不完全监督和噪声监督的深度分割方法

专知会员服务

42+阅读 · 2022年7月7日

《异构观测数据中的联合因果推理》美国艾莫利大学、微软、约翰霍普金斯大学、哈佛大学、斯坦福大学等联合发表最新论文63页PDF

《异构观测数据中的联合因果推理》美国艾莫利大学、微软、约翰霍普金斯大学、哈佛大学、斯坦福大学等联合发表最新论文63页PDF

专知会员服务

29+阅读 · 2022年4月28日

ICCV'21 Oral｜拒绝调参，显著提点！检测分割任务的新损失函数RS Loss开源

专知会员服务

16+阅读 · 2021年8月11日

【Mila】通用表示Transformer少样本图像分类

【Mila】通用表示Transformer少样本图像分类

专知会员服务

33+阅读 · 2020年9月7日

【论文推荐WWW2020-UIUC】修正排序系统中的选择偏差：Correcting for Selection Bias in Learning-to-rank Systems

【论文推荐WWW2020-UIUC】修正排序系统中的选择偏差：Correcting for Selection Bias in Learning-to-rank Systems

专知会员服务

32+阅读 · 2020年2月1日

【何恺明团队新论文】PointRend:将图像分割视作渲染问题，性能显著提升！

【何恺明团队新论文】PointRend:将图像分割视作渲染问题，性能显著提升！

专知会员服务

28+阅读 · 2019年12月19日

一文看尽15种语义分割损失函数（含代码解析）

一文看尽15种语义分割损失函数（含代码解析）

CVer

82+阅读 · 2020年7月2日

【WWW2020-新加坡国立大学】知识图谱强化负采样的推荐系统，Reinforced Negative Sampling

【WWW2020-新加坡国立大学】知识图谱强化负采样的推荐系统，Reinforced Negative Sampling

专知

22+阅读 · 2020年3月14日

【技术分享】算法是如何更智能地发现异常商业数据的？

【技术分享】算法是如何更智能地发现异常商业数据的？

AliData

19+阅读 · 2019年8月21日

【资源】图像分割/显著性检测数据集列表

【资源】图像分割/显著性检测数据集列表

专知

13+阅读 · 2019年5月22日

最新最权威《深度学习显著目标检测综述》论文代码数据发布，带你全面了解显著目标检测方法

最新最权威《深度学习显著目标检测综述》论文代码数据发布，带你全面了解显著目标检测方法

专知

79+阅读 · 2019年4月24日

数据分析师应该知道的16种回归方法：负二项回归

数据分析师应该知道的16种回归方法：负二项回归

数萃大数据

74+阅读 · 2018年9月16日

数据分析师应该知道的16种回归方法：泊松回归

数据分析师应该知道的16种回归方法：泊松回归

数萃大数据

35+阅读 · 2018年9月13日

数据分析师应该知道的16种回归技术：Lasso回归

数据分析师应该知道的16种回归技术：Lasso回归

数萃大数据

16+阅读 · 2018年8月13日

数据分析师应该知道的16种回归技术：分位数回归

数据分析师应该知道的16种回归技术：分位数回归

数萃大数据

29+阅读 · 2018年8月8日

【论文推荐】最新5篇图像分割（Image Segmentation）相关论文—多重假设、超像素分割、自监督、图、生成对抗网络

【论文推荐】最新5篇图像分割（Image Segmentation）相关论文—多重假设、超像素分割、自监督、图、生成对抗网络

专知

27+阅读 · 2018年2月7日

多重假设检验中的k-FWER控制

国家自然科学基金

0+阅读 · 2015年12月31日

基于确定性重演的多核程序并发错误消除方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

多标记文本数据流分类方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

满足差分隐私的频繁模式挖掘研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于形状信息和结果反馈的多图谱图像分割方法

国家自然科学基金

0+阅读 · 2015年12月31日

半参数回归模型中随机误差分布的检验问题

国家自然科学基金

2+阅读 · 2015年12月31日

方差正则化的分类模型选择方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

整数关系探测的误差可控算法与应用

国家自然科学基金

0+阅读 · 2015年12月31日

面向异分布数据的主动学习方法

国家自然科学基金

12+阅读 · 2015年12月31日

基于部分核实数据的统计推断及应用

国家自然科学基金

0+阅读 · 2014年12月31日

Resampling-based multi-resolution false discovery exceedance control

Arxiv

0+阅读 · 5月4日

Bi-Gaussian Mirrors for False Discovery Rate Control

Arxiv

0+阅读 · 4月27日

Confidence envelopes for the false discoveries with heterogeneous data

Arxiv

0+阅读 · 4月21日

Beyond Fixed False Discovery Rates: Post-Hoc Conformal Selection with E-Variables

Arxiv

0+阅读 · 4月17日

Beyond Fixed False Discovery Rates: Post-Hoc Conformal Selection with E-Variables

Arxiv

0+阅读 · 4月13日

Optimal multiple testing under family-wise error control: elementary symmetric polynomials and a scalable algorithm

Arxiv

0+阅读 · 4月13日

Setwise Hierarchical Variable Selection and the Generalized Linear Step-Up Procedure for False Discovery Rate Control

Arxiv

0+阅读 · 3月2日

Sensitivity Analysis for False Discovery Rate Estimation with Published p-Values

Arxiv

0+阅读 · 2月28日

Discover, Segment, and Select: A Progressive Mechanism for Zero-shot Camouflaged Object Segmentation

Arxiv

0+阅读 · 2月23日

Online FDR Controlling procedures for statistical SIS Model and its application to COVID19 data

Arxiv

0+阅读 · 2月20日

VIP会员

文章信息

相关主题

最新内容

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

专知会员服务

3+阅读 · 6月22日

综述 | 3D场景图：开放挑战与未来方向

综述 | 3D场景图：开放挑战与未来方向

专知会员服务

4+阅读 · 6月22日

《国防工业6.0：全自主作战系统、量子-人工智能融合与新一代战略威慑》

《国防工业6.0：全自主作战系统、量子-人工智能融合与新一代战略威慑》

专知会员服务

6+阅读 · 6月22日

21世纪的无人机战争

21世纪的无人机战争

专知会员服务

4+阅读 · 6月22日

《伊朗与以色列-美国热战及其对数字技术的影响》

《伊朗与以色列-美国热战及其对数字技术的影响》

专知会员服务

5+阅读 · 6月22日

《量子技术的军事任务技术适配与利用》

《量子技术的军事任务技术适配与利用》

专知会员服务

5+阅读 · 6月22日

《美国陆军军官学校（西点军校）本科生科研中生成式人工智能的使用》

《美国陆军军官学校（西点军校）本科生科研中生成式人工智能的使用》

专知会员服务

6+阅读 · 6月22日

美国从乌克兰无人机战争中学习经验

美国从乌克兰无人机战争中学习经验

专知会员服务

7+阅读 · 6月21日

ICML 2026 | 面向视觉语言模型的语义鲁棒性认证

ICML 2026 | 面向视觉语言模型的语义鲁棒性认证

专知会员服务

5+阅读 · 6月21日

综述 | 智能体电子设计自动化：从“交接有效性”重新理解Agentic EDA

综述 | 智能体电子设计自动化：从“交接有效性”重新理解Agentic EDA

专知会员服务

8+阅读 · 6月21日

深入解读 Palantir AIP：全球最具争议的人工智能平台究竟如何运作

深入解读 Palantir AIP：全球最具争议的人工智能平台究竟如何运作

专知会员服务

21+阅读 · 6月20日

ICML 2026 | 多任务贝叶斯上下文学习：让 Transformer 在测试时显式适应新先验

ICML 2026 | 多任务贝叶斯上下文学习：让 Transformer 在测试时显式适应新先验

专知会员服务

5+阅读 · 6月19日

ACL 2026综述 | 大规模手语数据集：资源、基准与标注标准

ACL 2026综述 | 大规模手语数据集：资源、基准与标注标准

专知会员服务

8+阅读 · 6月19日

ICML 2026 Spotlight | SmoothSMoE：解析稀疏 MoE 路由不连续

ICML 2026 Spotlight | SmoothSMoE：解析稀疏 MoE 路由不连续

专知会员服务

7+阅读 · 6月18日

综述 | 周期表视角下的大模型推理：范式、方法与失败模式

综述 | 周期表视角下的大模型推理：范式、方法与失败模式

专知会员服务

9+阅读 · 6月18日

相关VIP内容

【CMU博士论文】分布偏移下的不确定性量化，226页pdf

【CMU博士论文】分布偏移下的不确定性量化，226页pdf

专知会员服务

31+阅读 · 2023年9月30日

错误信息检测《对错误信息、宣传和谬论的综合注释进行稳健且可解释的识别》美军2023最新88页报告

错误信息检测《对错误信息、宣传和谬论的综合注释进行稳健且可解释的识别》美军2023最新88页报告

专知会员服务

30+阅读 · 2023年9月14日

【牛津大学博士论文】使用深度学习在医学图像分割中保持已知的解剖结构拓扑

【牛津大学博士论文】使用深度学习在医学图像分割中保持已知的解剖结构拓扑

专知会员服务

27+阅读 · 2023年7月19日

【估计定位、导航和授时（PNT）传感器和系统的目标位置误差】《多用途通用简化目标位置误差（TLE）计算器（MUSTC）》2022最新112页技术报告，美国陆军研究实验室

【估计定位、导航和授时（PNT）传感器和系统的目标位置误差】《多用途通用简化目标位置误差（TLE）计算器（MUSTC）》2022最新112页技术报告，美国陆军研究实验室

专知会员服务

47+阅读 · 2022年10月25日

上海交大最新《标签高效深度分割》研究进展综述，全面阐述无监督、粗监督、不完全监督和噪声监督的深度分割方法

上海交大最新《标签高效深度分割》研究进展综述，全面阐述无监督、粗监督、不完全监督和噪声监督的深度分割方法

专知会员服务

42+阅读 · 2022年7月7日

《异构观测数据中的联合因果推理》美国艾莫利大学、微软、约翰霍普金斯大学、哈佛大学、斯坦福大学等联合发表最新论文63页PDF

《异构观测数据中的联合因果推理》美国艾莫利大学、微软、约翰霍普金斯大学、哈佛大学、斯坦福大学等联合发表最新论文63页PDF

专知会员服务

29+阅读 · 2022年4月28日

ICCV'21 Oral｜拒绝调参，显著提点！检测分割任务的新损失函数RS Loss开源

专知会员服务

16+阅读 · 2021年8月11日

【Mila】通用表示Transformer少样本图像分类

【Mila】通用表示Transformer少样本图像分类

专知会员服务

33+阅读 · 2020年9月7日

【论文推荐WWW2020-UIUC】修正排序系统中的选择偏差：Correcting for Selection Bias in Learning-to-rank Systems

【论文推荐WWW2020-UIUC】修正排序系统中的选择偏差：Correcting for Selection Bias in Learning-to-rank Systems

专知会员服务

32+阅读 · 2020年2月1日

【何恺明团队新论文】PointRend:将图像分割视作渲染问题，性能显著提升！

【何恺明团队新论文】PointRend:将图像分割视作渲染问题，性能显著提升！

专知会员服务

28+阅读 · 2019年12月19日

热门VIP内容

开通专知VIP会员享更多权益服务

综述 | 3D场景图：开放挑战与未来方向

21世纪的无人机战争

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

《国防工业6.0：全自主作战系统、量子-人工智能融合与新一代战略威慑》

相关资讯

一文看尽15种语义分割损失函数（含代码解析）

一文看尽15种语义分割损失函数（含代码解析）

CVer

82+阅读 · 2020年7月2日

【WWW2020-新加坡国立大学】知识图谱强化负采样的推荐系统，Reinforced Negative Sampling

【WWW2020-新加坡国立大学】知识图谱强化负采样的推荐系统，Reinforced Negative Sampling

专知

22+阅读 · 2020年3月14日

【技术分享】算法是如何更智能地发现异常商业数据的？

【技术分享】算法是如何更智能地发现异常商业数据的？

AliData

19+阅读 · 2019年8月21日

【资源】图像分割/显著性检测数据集列表

【资源】图像分割/显著性检测数据集列表

专知

13+阅读 · 2019年5月22日

最新最权威《深度学习显著目标检测综述》论文代码数据发布，带你全面了解显著目标检测方法

最新最权威《深度学习显著目标检测综述》论文代码数据发布，带你全面了解显著目标检测方法

专知

79+阅读 · 2019年4月24日

数据分析师应该知道的16种回归方法：负二项回归

数据分析师应该知道的16种回归方法：负二项回归

数萃大数据

74+阅读 · 2018年9月16日

数据分析师应该知道的16种回归方法：泊松回归

数据分析师应该知道的16种回归方法：泊松回归

数萃大数据

35+阅读 · 2018年9月13日

数据分析师应该知道的16种回归技术：Lasso回归

数据分析师应该知道的16种回归技术：Lasso回归

数萃大数据

16+阅读 · 2018年8月13日

数据分析师应该知道的16种回归技术：分位数回归

数据分析师应该知道的16种回归技术：分位数回归

数萃大数据

29+阅读 · 2018年8月8日

【论文推荐】最新5篇图像分割（Image Segmentation）相关论文—多重假设、超像素分割、自监督、图、生成对抗网络

【论文推荐】最新5篇图像分割（Image Segmentation）相关论文—多重假设、超像素分割、自监督、图、生成对抗网络

专知

27+阅读 · 2018年2月7日

相关论文

Resampling-based multi-resolution false discovery exceedance control

Arxiv

0+阅读 · 5月4日

Bi-Gaussian Mirrors for False Discovery Rate Control

Arxiv

0+阅读 · 4月27日

Confidence envelopes for the false discoveries with heterogeneous data

Arxiv

0+阅读 · 4月21日

Beyond Fixed False Discovery Rates: Post-Hoc Conformal Selection with E-Variables

Arxiv

0+阅读 · 4月17日

Beyond Fixed False Discovery Rates: Post-Hoc Conformal Selection with E-Variables

Arxiv

0+阅读 · 4月13日

Optimal multiple testing under family-wise error control: elementary symmetric polynomials and a scalable algorithm

Arxiv

0+阅读 · 4月13日

Setwise Hierarchical Variable Selection and the Generalized Linear Step-Up Procedure for False Discovery Rate Control

Arxiv

0+阅读 · 3月2日

Sensitivity Analysis for False Discovery Rate Estimation with Published p-Values

Arxiv

0+阅读 · 2月28日

Discover, Segment, and Select: A Progressive Mechanism for Zero-shot Camouflaged Object Segmentation

Arxiv

0+阅读 · 2月23日

Online FDR Controlling procedures for statistical SIS Model and its application to COVID19 data

Arxiv

0+阅读 · 2月20日

相关基金

多重假设检验中的k-FWER控制

国家自然科学基金

0+阅读 · 2015年12月31日

基于确定性重演的多核程序并发错误消除方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

多标记文本数据流分类方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

满足差分隐私的频繁模式挖掘研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于形状信息和结果反馈的多图谱图像分割方法

国家自然科学基金

0+阅读 · 2015年12月31日

半参数回归模型中随机误差分布的检验问题

国家自然科学基金

2+阅读 · 2015年12月31日

方差正则化的分类模型选择方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

整数关系探测的误差可控算法与应用

国家自然科学基金

0+阅读 · 2015年12月31日

面向异分布数据的主动学习方法

国家自然科学基金

12+阅读 · 2015年12月31日

基于部分核实数据的统计推断及应用

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员