Nonparametric Empirical Bayes Estimation on Heterogeneous Data - 专知论文

会员服务 ·

0

Nonparametric Empirical Bayes Estimation on Heterogeneous Data

翻译：非参数经验贝叶斯估计在异质性数据上的应用

Trambak Banerjee,Luella J. Fu,Gareth M. James,Gourab Mukherjee,Wenguang Sun

from arxiv, Proof of Theorem 1 revised

The simultaneous estimation of many parameters based on data collected from corresponding studies is a key research problem that has received renewed attention in the high-dimensional setting. Many practical situations involve heterogeneous data where heterogeneity is captured by a nuisance parameter. Effectively pooling information across samples while correctly accounting for heterogeneity presents a significant challenge in large-scale estimation problems. We address this issue by introducing the ``Nonparametric Empirical Bayes Structural Tweedie" (NEST) estimator, which efficiently estimates the unknown effect sizes and properly adjusts for heterogeneity via a generalized version of Tweedie's formula. For the normal means problem, NEST simultaneously handles the two main selection biases introduced by heterogeneity: one, the selection bias in the mean, which cannot be effectively corrected without also correcting for, two, selection bias in the variance. We develop theory to show that NEST is asymptotically as good as the optimal Bayes rule that uniquely minimizes a weighted squared error loss. In our simulation studies NEST outperforms competing methods, with much efficiency gains in many settings. The proposed method is demonstrated on estimating the batting averages of baseball players and Sharpe ratios of mutual fund returns. Extensions to other members of the two-parameter exponential family are discussed.

翻译：基于对应研究收集的数据同时估计多个参数是一个关键的研究问题，在高维背景下重新引起关注。许多实际情境涉及异质性数据，其中异质性由一个冗余参数刻画。在大规模估计问题中，如何有效整合样本信息并正确考虑异质性构成了重大挑战。我们通过引入“非参数经验贝叶斯结构式Tweedie”（NEST）估计器来解决这一问题，该估计器能够高效估计未知效应大小，并通过Tweedie公式的广义版本合理调整异质性。对于正态均值问题，NEST同时处理了异质性引入的两种主要选择偏差：一是均值的选择偏差，若不纠正此偏差则无法有效校正；二是方差的选择偏差。我们发展了理论，证明NEST渐近地达到与唯一最小化加权平方误差损失的最优贝叶斯规则相同的性能。在模拟研究中，NEST优于竞争方法，在许多设置中实现了显著效率提升。该方法通过估算棒球运动员的击球率和共同基金回报的夏普比率进行了实证。文章还讨论了向双参数指数族其他成员的扩展。

0

相关内容

【牛津大学博士论文】流形假设下的贝叶斯非参数估计

【牛津大学博士论文】流形假设下的贝叶斯非参数估计

专知会员服务

19+阅读 · 2025年5月1日

【牛津大学博士论文】不确定性量化与因果考量在非策略决策制定中的应用

【牛津大学博士论文】不确定性量化与因果考量在非策略决策制定中的应用

专知会员服务

20+阅读 · 2025年2月24日

【牛津大学博士论文】通过贝叶斯实验设计实现自动化数据采集

【牛津大学博士论文】通过贝叶斯实验设计实现自动化数据采集

专知会员服务

31+阅读 · 2024年11月4日

【牛津大学博士论文】在不利情境下的贝叶斯优化，269页pdf

【牛津大学博士论文】在不利情境下的贝叶斯优化，269页pdf

专知会员服务

45+阅读 · 2024年3月17日

【NeurIPS2023教程】在分布变化下建模与利用数据异质性，128页ppt

【NeurIPS2023教程】在分布变化下建模与利用数据异质性，128页ppt

专知会员服务

42+阅读 · 2023年12月14日

【MIT博士论文】高维贝叶斯线性建模:层次建模、推理和评价的进展，250页pdf

【MIT博士论文】高维贝叶斯线性建模:层次建模、推理和评价的进展，250页pdf

专知会员服务

46+阅读 · 2022年10月1日

《用于工业设计异常检测和参数余量预测的无监督概率和核回归方法》234页博士论文

《用于工业设计异常检测和参数余量预测的无监督概率和核回归方法》234页博士论文

专知会员服务

20+阅读 · 2022年5月12日

异质信息网络分析与应用综述，软件学报-北京邮电大学

异质信息网络分析与应用综述，软件学报-北京邮电大学

专知会员服务

64+阅读 · 2020年7月9日

【O’Reilly讲座】基于深度学习的异常检测方法用于检测大型数据集的质量：Anomaly detection using deep learning to measure the quality of large datasets

【O’Reilly讲座】基于深度学习的异常检测方法用于检测大型数据集的质量：Anomaly detection using deep learning to measure the quality of large datasets

专知会员服务

31+阅读 · 2020年1月11日

【变分推断课件】Lectures on Variational Inference： Approximate Bayesian Inference in Machine Learning（附带pdf）

【变分推断课件】Lectures on Variational Inference： Approximate Bayesian Inference in Machine Learning（附带pdf）

专知会员服务

35+阅读 · 2019年11月30日

联邦学习如何处理异质性？港科大最新《异质联邦学习》综述，46页pdf全面阐述异质联邦学习的数据空间、统计、系统和模型异质性

联邦学习如何处理异质性？港科大最新《异质联邦学习》综述，46页pdf全面阐述异质联邦学习的数据空间、统计、系统和模型异质性

专知

11+阅读 · 2022年12月1日

综述 | 异质信息网络分析与应用综述

综述 | 异质信息网络分析与应用综述

专知

27+阅读 · 2020年8月8日

【技术分享】算法是如何更智能地发现异常商业数据的？

【技术分享】算法是如何更智能地发现异常商业数据的？

AliData

19+阅读 · 2019年8月21日

非平衡数据集 focal loss 多类分类

非平衡数据集 focal loss 多类分类

AI研习社

33+阅读 · 2019年4月23日

使用 Canal 实现数据异构

使用 Canal 实现数据异构

性能与架构

20+阅读 · 2019年3月4日

最新36页《贝叶斯非参学习综述》，机器学习内功修炼手册

最新36页《贝叶斯非参学习综述》，机器学习内功修炼手册

专知

26+阅读 · 2019年2月27日

数据分析师应该知道的16种回归技术：偏最小二乘回归

数据分析师应该知道的16种回归技术：偏最小二乘回归

数萃大数据

14+阅读 · 2018年8月29日

入门 | 什么是最大似然估计、最大后验估计以及贝叶斯参数估计

入门 | 什么是最大似然估计、最大后验估计以及贝叶斯参数估计

机器之心

11+阅读 · 2018年4月15日

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

机器学习研究会

19+阅读 · 2018年3月11日

概率论之概念解析：用贝叶斯推断进行参数估计

概率论之概念解析：用贝叶斯推断进行参数估计

专知

14+阅读 · 2018年1月8日

基于多源异构不确定数据的高效用信息挖掘的研究

国家自然科学基金

4+阅读 · 2015年12月31日

大规模参数估计的约束无导数优化信赖域方法

国家自然科学基金

1+阅读 · 2015年12月31日

处理效应差异中位数的有效估计

国家自然科学基金

0+阅读 · 2015年12月31日

贝叶斯柔性密度方法及其在高维金融数据中的应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于复杂数据的回归模型统计推断及其应用

国家自然科学基金

3+阅读 · 2015年12月31日

排序集抽样下随机删失数据的非参数估计

国家自然科学基金

1+阅读 · 2014年12月31日

复杂多元数据的半参数统计推断

国家自然科学基金

5+阅读 · 2014年12月31日

陆地碳数据同化中的模型“异参同效”问题研究

国家自然科学基金

0+阅读 · 2014年12月31日

变换结构方程模型的非参数贝叶斯分析

国家自然科学基金

4+阅读 · 2014年12月31日

基于狄利克雷过程的潜变量模型贝叶斯半参数分析

国家自然科学基金

2+阅读 · 2014年12月31日

Nonparametric Estimation of Isotropic Covariance Function

Arxiv

0+阅读 · 4月24日

Nonparametric f-Modeling for Empirical Bayes Inference with Unequal and Unknown Variances

Arxiv

0+阅读 · 4月23日

Bayesian Nonparametric Modeling for Multivariate Conditional Copula Regression with Varying Coefficients

Arxiv

0+阅读 · 4月14日

Bayesian nonparametric models for zero-inflated count-compositional data using ensembles of regression trees

Arxiv

0+阅读 · 4月9日

A Theory of Nonparametric Covariance Function Estimation for Discretely Observed Data

Arxiv

0+阅读 · 3月24日

Contrastive Bayesian Inference for Unnormalized Models

Arxiv

0+阅读 · 3月10日

A Bayesian approach to learning mixtures of nonparametric components

Arxiv

0+阅读 · 3月4日

Bayesian Variational Inference for Mixed Data Mixture Models

Arxiv

0+阅读 · 3月2日

Compound decisions and empirical Bayes via Bayesian nonparametrics

Arxiv

0+阅读 · 2月23日

Bayesian nonparametric boundary detection for multiple areal data

Arxiv

0+阅读 · 2月20日

VIP会员

文章信息

相关主题

最新内容

无人机自主控制与人工智能：系统性综述

无人机自主控制与人工智能：系统性综述

专知会员服务

10+阅读 · 今天7:25

巡飞弹与反无人机系统——现代战场的两大支柱

巡飞弹与反无人机系统——现代战场的两大支柱

专知会员服务

3+阅读 · 今天6:54

《打造“黄金舰队”》57页报告

《打造“黄金舰队”》57页报告

专知会员服务

3+阅读 · 今天6:52

《北约数字教官网络发展路径》128页报告

《北约数字教官网络发展路径》128页报告

专知会员服务

2+阅读 · 今天6:33

ECCV 2026 | MIMFlow：MIM与归一化流统一图像生成

ECCV 2026 | MIMFlow：MIM与归一化流统一图像生成

专知会员服务

7+阅读 · 6月25日

超越自回归边界：扩散模型、世界模型与SSM如何重塑代码智能

超越自回归边界：扩散模型、世界模型与SSM如何重塑代码智能

专知会员服务

6+阅读 · 6月25日

重塑决策优势：美军作战艺术与多域作战中联盟联合全域指挥控制（CJADC2）体系的融合

重塑决策优势：美军作战艺术与多域作战中联盟联合全域指挥控制（CJADC2）体系的融合

专知会员服务

9+阅读 · 6月25日

网状网络及其在军事领域的运用

网状网络及其在军事领域的运用

专知会员服务

7+阅读 · 6月25日

《意识即战场——全球安全体系中认知战的演进：乌克兰构建认知作战体系的展望》

《意识即战场——全球安全体系中认知战的演进：乌克兰构建认知作战体系的展望》

专知会员服务

8+阅读 · 6月25日

无美国参与的欧洲战争方式（万字长文）

无美国参与的欧洲战争方式（万字长文）

专知会员服务

8+阅读 · 6月25日

重构“下一场战争”的制胜理论：超越兰彻斯特方程与现代系统

重构“下一场战争”的制胜理论：超越兰彻斯特方程与现代系统

专知会员服务

10+阅读 · 6月25日

《国防工业中基于模型定义的实施：产品定义数字化转型的战略路径》90页

《国防工业中基于模型定义的实施：产品定义数字化转型的战略路径》90页

专知会员服务

9+阅读 · 6月25日

《国防领域敏感性分析白皮书》

《国防领域敏感性分析白皮书》

专知会员服务

9+阅读 · 6月25日

综述 | 从问答到任务完成：Agent系统与Harness设计

综述 | 从问答到任务完成：Agent系统与Harness设计

专知会员服务

10+阅读 · 6月24日

Agentic RL：框架、实践与长程智能体训练

Agentic RL：框架、实践与长程智能体训练

专知会员服务

10+阅读 · 6月24日

相关VIP内容

【牛津大学博士论文】流形假设下的贝叶斯非参数估计

【牛津大学博士论文】流形假设下的贝叶斯非参数估计

专知会员服务

19+阅读 · 2025年5月1日

【牛津大学博士论文】不确定性量化与因果考量在非策略决策制定中的应用

【牛津大学博士论文】不确定性量化与因果考量在非策略决策制定中的应用

专知会员服务

20+阅读 · 2025年2月24日

【牛津大学博士论文】通过贝叶斯实验设计实现自动化数据采集

【牛津大学博士论文】通过贝叶斯实验设计实现自动化数据采集

专知会员服务

31+阅读 · 2024年11月4日

【牛津大学博士论文】在不利情境下的贝叶斯优化，269页pdf

【牛津大学博士论文】在不利情境下的贝叶斯优化，269页pdf

专知会员服务

45+阅读 · 2024年3月17日

【NeurIPS2023教程】在分布变化下建模与利用数据异质性，128页ppt

【NeurIPS2023教程】在分布变化下建模与利用数据异质性，128页ppt

专知会员服务

42+阅读 · 2023年12月14日

【MIT博士论文】高维贝叶斯线性建模:层次建模、推理和评价的进展，250页pdf

【MIT博士论文】高维贝叶斯线性建模:层次建模、推理和评价的进展，250页pdf

专知会员服务

46+阅读 · 2022年10月1日

《用于工业设计异常检测和参数余量预测的无监督概率和核回归方法》234页博士论文

《用于工业设计异常检测和参数余量预测的无监督概率和核回归方法》234页博士论文

专知会员服务

20+阅读 · 2022年5月12日

异质信息网络分析与应用综述，软件学报-北京邮电大学

异质信息网络分析与应用综述，软件学报-北京邮电大学

专知会员服务

64+阅读 · 2020年7月9日

【O’Reilly讲座】基于深度学习的异常检测方法用于检测大型数据集的质量：Anomaly detection using deep learning to measure the quality of large datasets

【O’Reilly讲座】基于深度学习的异常检测方法用于检测大型数据集的质量：Anomaly detection using deep learning to measure the quality of large datasets

专知会员服务

31+阅读 · 2020年1月11日

【变分推断课件】Lectures on Variational Inference： Approximate Bayesian Inference in Machine Learning（附带pdf）

【变分推断课件】Lectures on Variational Inference： Approximate Bayesian Inference in Machine Learning（附带pdf）

专知会员服务

35+阅读 · 2019年11月30日

热门VIP内容

开通专知VIP会员享更多权益服务

巡飞弹与反无人机系统——现代战场的两大支柱

《北约数字教官网络发展路径》128页报告

无人机自主控制与人工智能：系统性综述

《打造“黄金舰队”》57页报告

相关资讯

联邦学习如何处理异质性？港科大最新《异质联邦学习》综述，46页pdf全面阐述异质联邦学习的数据空间、统计、系统和模型异质性

联邦学习如何处理异质性？港科大最新《异质联邦学习》综述，46页pdf全面阐述异质联邦学习的数据空间、统计、系统和模型异质性

专知

11+阅读 · 2022年12月1日

综述 | 异质信息网络分析与应用综述

综述 | 异质信息网络分析与应用综述

专知

27+阅读 · 2020年8月8日

【技术分享】算法是如何更智能地发现异常商业数据的？

【技术分享】算法是如何更智能地发现异常商业数据的？

AliData

19+阅读 · 2019年8月21日

非平衡数据集 focal loss 多类分类

非平衡数据集 focal loss 多类分类

AI研习社

33+阅读 · 2019年4月23日

使用 Canal 实现数据异构

使用 Canal 实现数据异构

性能与架构

20+阅读 · 2019年3月4日

最新36页《贝叶斯非参学习综述》，机器学习内功修炼手册

最新36页《贝叶斯非参学习综述》，机器学习内功修炼手册

专知

26+阅读 · 2019年2月27日

数据分析师应该知道的16种回归技术：偏最小二乘回归

数据分析师应该知道的16种回归技术：偏最小二乘回归

数萃大数据

14+阅读 · 2018年8月29日

入门 | 什么是最大似然估计、最大后验估计以及贝叶斯参数估计

入门 | 什么是最大似然估计、最大后验估计以及贝叶斯参数估计

机器之心

11+阅读 · 2018年4月15日

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

机器学习研究会

19+阅读 · 2018年3月11日

概率论之概念解析：用贝叶斯推断进行参数估计

概率论之概念解析：用贝叶斯推断进行参数估计

专知

14+阅读 · 2018年1月8日

相关论文

Nonparametric Estimation of Isotropic Covariance Function

Arxiv

0+阅读 · 4月24日

Nonparametric f-Modeling for Empirical Bayes Inference with Unequal and Unknown Variances

Arxiv

0+阅读 · 4月23日

Bayesian Nonparametric Modeling for Multivariate Conditional Copula Regression with Varying Coefficients

Arxiv

0+阅读 · 4月14日

Bayesian nonparametric models for zero-inflated count-compositional data using ensembles of regression trees

Arxiv

0+阅读 · 4月9日

A Theory of Nonparametric Covariance Function Estimation for Discretely Observed Data

Arxiv

0+阅读 · 3月24日

Contrastive Bayesian Inference for Unnormalized Models

Arxiv

0+阅读 · 3月10日

A Bayesian approach to learning mixtures of nonparametric components

Arxiv

0+阅读 · 3月4日

Bayesian Variational Inference for Mixed Data Mixture Models

Arxiv

0+阅读 · 3月2日

Compound decisions and empirical Bayes via Bayesian nonparametrics

Arxiv

0+阅读 · 2月23日

Bayesian nonparametric boundary detection for multiple areal data

Arxiv

0+阅读 · 2月20日

相关基金

基于多源异构不确定数据的高效用信息挖掘的研究

国家自然科学基金

4+阅读 · 2015年12月31日

大规模参数估计的约束无导数优化信赖域方法

国家自然科学基金

1+阅读 · 2015年12月31日

处理效应差异中位数的有效估计

国家自然科学基金

0+阅读 · 2015年12月31日

贝叶斯柔性密度方法及其在高维金融数据中的应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于复杂数据的回归模型统计推断及其应用

国家自然科学基金

3+阅读 · 2015年12月31日

排序集抽样下随机删失数据的非参数估计

国家自然科学基金

1+阅读 · 2014年12月31日

复杂多元数据的半参数统计推断

国家自然科学基金

5+阅读 · 2014年12月31日

陆地碳数据同化中的模型“异参同效”问题研究

国家自然科学基金

0+阅读 · 2014年12月31日

变换结构方程模型的非参数贝叶斯分析

国家自然科学基金

4+阅读 · 2014年12月31日

基于狄利克雷过程的潜变量模型贝叶斯半参数分析

国家自然科学基金

2+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员