When is the estimated propensity score better? High-dimensional analysis and bias correction - 专知论文

会员服务 ·

0

得分 · 发散 · 高维 · 规范化 · Learning ·

2023 年 3 月 30 日

When is the estimated propensity score better? High-dimensional analysis and bias correction

翻译：何时估计倾向得分更优？高维分析与偏差校正

Fangzhou Su,Wenlong Mou,Peng Ding,Martin Wainwright

from arxiv, Fangzhou Su and Wenlong Mou contributed equally to this work

Anecdotally, using an estimated propensity score is superior to the true propensity score in estimating the average treatment effect based on observational data. However, this claim comes with several qualifications: it holds only if propensity score model is correctly specified and the number of covariates $d$ is small relative to the sample size $n$. We revisit this phenomenon by studying the inverse propensity score weighting (IPW) estimator based on a logistic model with a diverging number of covariates. We first show that the IPW estimator based on the estimated propensity score is consistent and asymptotically normal with smaller variance than the oracle IPW estimator (using the true propensity score) if and only if $n \gtrsim d^2$. We then propose a debiased IPW estimator that achieves the same guarantees in the regime $n \gtrsim d^{3/2}$. Our proofs rely on a novel non-asymptotic decomposition of the IPW error along with careful control of the higher order terms.

翻译：经验表明，在基于观测数据估计平均处理效应时，使用估计倾向得分优于真实倾向得分。然而，这一结论存在若干限定条件：仅在倾向得分模型正确设定且协变量数量d相对于样本量n较小时成立。我们通过研究基于逻辑回归模型且协变量数量发散时的逆概率加权（IPW）估计量，重新审视了这一现象。首先证明，当且仅当n ≳ d²时，基于估计倾向得分的IPW估计量较之使用真实倾向得分的预言机IPW估计量具有更小方差且满足相合性与渐近正态性。随后，我们提出一种去偏IPW估计量，在n ≳ d^{3/2}的区间内能达成相同保证。我们的证明依赖于对IPW误差的新型非渐近分解以及对高阶项的精细控制。

0

相关内容

【ICML2023】序列反事实风险最小化

【ICML2023】序列反事实风险最小化

专知会员服务

21+阅读 · 2023年5月1日

【NeurIPS2022】时序解纠缠表示学习

【NeurIPS2022】时序解纠缠表示学习

专知会员服务

23+阅读 · 2022年10月30日

【ICML2022】Sharp-MAML:锐度感知的模型无关元学习

【ICML2022】Sharp-MAML:锐度感知的模型无关元学习

专知会员服务

17+阅读 · 2022年6月10日

【干货书】概率，统计与数据，513页pdf

【干货书】概率，统计与数据，513页pdf

专知会员服务

142+阅读 · 2021年11月27日

【ICML2021】用于对比表示学习的分解互信息估计

专知会员服务

26+阅读 · 2021年9月9日

因果推断，Causal Inference：The Mixtape

因果推断，Causal Inference：The Mixtape

专知会员服务

110+阅读 · 2021年8月27日

【Contextual Embedding】什么时候上下文嵌入值得使用?

【Contextual Embedding】什么时候上下文嵌入值得使用?

专知会员服务

16+阅读 · 2020年8月2日

【SIGIR2020】策略感知的无偏排序学习—Top-K排序，Policy-Aware Unbiased Learning to Rank for Top-𝑘 Rankings

【SIGIR2020】策略感知的无偏排序学习—Top-K排序，Policy-Aware Unbiased Learning to Rank for Top-𝑘 Rankings

专知会员服务

27+阅读 · 2020年6月10日

【哈佛大学】机器学习的层次局限性，A Hierarchy of Limitations in Machine Learning

【哈佛大学】机器学习的层次局限性，A Hierarchy of Limitations in Machine Learning

专知会员服务

47+阅读 · 2020年2月12日

【论文推荐WWW2020-UIUC】修正排序系统中的选择偏差：Correcting for Selection Bias in Learning-to-rank Systems

【论文推荐WWW2020-UIUC】修正排序系统中的选择偏差：Correcting for Selection Bias in Learning-to-rank Systems

专知会员服务

32+阅读 · 2020年2月1日

生成扩散模型漫谈：最优扩散方差估计（下）

生成扩散模型漫谈：最优扩散方差估计（下）

PaperWeekly

0+阅读 · 2022年10月10日

生成扩散模型漫谈：最优扩散方差估计（上）

生成扩散模型漫谈：最优扩散方差估计（上）

PaperWeekly

0+阅读 · 2022年9月25日

赛尔笔记 | 逻辑推理阅读理解任务及方法

赛尔笔记 | 逻辑推理阅读理解任务及方法

哈工大SCIR

1+阅读 · 2022年6月7日

论文浅尝｜简单高效的知识图谱表示学习负样本采样方法

论文浅尝｜简单高效的知识图谱表示学习负样本采样方法

开放知识图谱

14+阅读 · 2021年7月25日

已删除

德先生

53+阅读 · 2019年4月28日

论文浅尝 | 区分概念和实例的知识图谱嵌入方法

论文浅尝 | 区分概念和实例的知识图谱嵌入方法

开放知识图谱

17+阅读 · 2019年1月19日

用 LDA 和 LSA 两种方法来降维和做 Topic 建模

用 LDA 和 LSA 两种方法来降维和做 Topic 建模

AI研习社

13+阅读 · 2018年8月24日

线性回归：简单线性回归详解

线性回归：简单线性回归详解

专知

12+阅读 · 2018年3月10日

回归预测&时间序列预测

回归预测&时间序列预测

GBASE数据工程部数据团队

44+阅读 · 2017年5月17日

From Softmax to Sparsemax-ICML16（1）

From Softmax to Sparsemax-ICML16（1）

KingsGarden

74+阅读 · 2016年11月26日

基于广义部分线性单指标模型的高维纵向数据统计分析

国家自然科学基金

1+阅读 · 2015年12月31日

无界区域椭圆型和抛物型偏微分方程的人工边界条件数值方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于偏相关系数截断法的超高维模型的变量选择

国家自然科学基金

1+阅读 · 2013年12月31日

随机矩阵/数组形式高维数据的充分降维：统计理论、方法及其应用

国家自然科学基金

2+阅读 · 2013年12月31日

带约束推断的参数和半参数回归模型有偏估计及变量选择理论与方法研究

国家自然科学基金

1+阅读 · 2012年12月31日

超高维数据的变量筛选方法

国家自然科学基金

0+阅读 · 2012年12月31日

基于不完整数据的氧化铝蒸发过程故障诊断方法研究

国家自然科学基金

0+阅读 · 2012年12月31日

充分降维理论中基于分布加权思想的压缩估计

国家自然科学基金

2+阅读 · 2011年12月31日

混波室法电磁兼容测试的测量不确定度研究

国家自然科学基金

0+阅读 · 2011年12月31日

随机扰动下非线性动力系统的不确定行为及扰动敏感度的数值实验和分析

国家自然科学基金

0+阅读 · 2009年12月31日

The noise level in linear regression with dependent data

Arxiv

0+阅读 · 2023年5月18日

On true versus estimated propensity scores for treatment effect estimation with discrete controls

Arxiv

0+阅读 · 2023年5月18日

Optimality and complexity of classification by random projection

Arxiv

0+阅读 · 2023年5月18日

Sparse joint shift in multinomial classification

Arxiv

0+阅读 · 2023年5月18日

Unconfounded Propensity Estimation for Unbiased Ranking

Arxiv

0+阅读 · 2023年5月18日

Variational Classification

Arxiv

0+阅读 · 2023年5月17日

Consistency and asymptotic normality in a class of nearly unstable processes

Arxiv

0+阅读 · 2023年5月17日

Optimized Joint Beamforming for Wireless Powered Over-the-Air Computation

Arxiv

0+阅读 · 2023年5月17日

Consensus Based Medical Image Segmentation Using Semi-Supervised Learning And Graph Cuts

Arxiv

11+阅读 · 2018年5月21日

Multi-pseudo Regularized Label for Generated Samples in Person Re-Identification

Arxiv

12+阅读 · 2018年1月29日

VIP会员

文章信息

相关主题

最新内容

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

专知会员服务

5+阅读 · 今天8:00

重新思考无人机时代的生存能力

重新思考无人机时代的生存能力

专知会员服务

3+阅读 · 今天7:44

装甲突击旅：现代战争思考、战斗与组织

装甲突击旅：现代战争思考、战斗与组织

专知会员服务

2+阅读 · 今天7:28

在人工智能加速决策环境中拓展OODA循环

在人工智能加速决策环境中拓展OODA循环

专知会员服务

3+阅读 · 今天7:18

《廉价自杀式无人机战争的军事战略影响：乌克兰与伊朗案例研究》

《廉价自杀式无人机战争的军事战略影响：乌克兰与伊朗案例研究》

专知会员服务

4+阅读 · 今天7:07

军事欺骗：供作战战术指挥官使用的工具

军事欺骗：供作战战术指挥官使用的工具

专知会员服务

3+阅读 · 今天7:03

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

专知会员服务

4+阅读 · 6月23日

综述 | 世界动作模型：少做梦，多行动

综述 | 世界动作模型：少做梦，多行动

专知会员服务

5+阅读 · 6月23日

美以伊冲突：无人机与人工智能的运用

美以伊冲突：无人机与人工智能的运用

专知会员服务

10+阅读 · 6月23日

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

专知会员服务

4+阅读 · 6月23日

《特种部队在透明战场中的生存力》最新报告

《特种部队在透明战场中的生存力》最新报告

专知会员服务

5+阅读 · 6月23日

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

专知会员服务

8+阅读 · 6月23日

《人工智能生成的零日漏洞：对未来作战的影响》

《人工智能生成的零日漏洞：对未来作战的影响》

专知会员服务

7+阅读 · 6月23日

《理解伙伴国在防务能力选择中的偏好：探索美国解决方案的替代选择》美智库200页报告

《理解伙伴国在防务能力选择中的偏好：探索美国解决方案的替代选择》美智库200页报告

专知会员服务

4+阅读 · 6月23日

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

专知会员服务

6+阅读 · 6月22日

相关VIP内容

【ICML2023】序列反事实风险最小化

【ICML2023】序列反事实风险最小化

专知会员服务

21+阅读 · 2023年5月1日

【NeurIPS2022】时序解纠缠表示学习

【NeurIPS2022】时序解纠缠表示学习

专知会员服务

23+阅读 · 2022年10月30日

【ICML2022】Sharp-MAML:锐度感知的模型无关元学习

【ICML2022】Sharp-MAML:锐度感知的模型无关元学习

专知会员服务

17+阅读 · 2022年6月10日

【干货书】概率，统计与数据，513页pdf

【干货书】概率，统计与数据，513页pdf

专知会员服务

142+阅读 · 2021年11月27日

【ICML2021】用于对比表示学习的分解互信息估计

专知会员服务

26+阅读 · 2021年9月9日

因果推断，Causal Inference：The Mixtape

因果推断，Causal Inference：The Mixtape

专知会员服务

110+阅读 · 2021年8月27日

【Contextual Embedding】什么时候上下文嵌入值得使用?

【Contextual Embedding】什么时候上下文嵌入值得使用?

专知会员服务

16+阅读 · 2020年8月2日

【SIGIR2020】策略感知的无偏排序学习—Top-K排序，Policy-Aware Unbiased Learning to Rank for Top-𝑘 Rankings

【SIGIR2020】策略感知的无偏排序学习—Top-K排序，Policy-Aware Unbiased Learning to Rank for Top-𝑘 Rankings

专知会员服务

27+阅读 · 2020年6月10日

【哈佛大学】机器学习的层次局限性，A Hierarchy of Limitations in Machine Learning

【哈佛大学】机器学习的层次局限性，A Hierarchy of Limitations in Machine Learning

专知会员服务

47+阅读 · 2020年2月12日

【论文推荐WWW2020-UIUC】修正排序系统中的选择偏差：Correcting for Selection Bias in Learning-to-rank Systems

【论文推荐WWW2020-UIUC】修正排序系统中的选择偏差：Correcting for Selection Bias in Learning-to-rank Systems

专知会员服务

32+阅读 · 2020年2月1日

热门VIP内容

开通专知VIP会员享更多权益服务

重新思考无人机时代的生存能力

在人工智能加速决策环境中拓展OODA循环

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

装甲突击旅：现代战争思考、战斗与组织

相关资讯

生成扩散模型漫谈：最优扩散方差估计（下）

生成扩散模型漫谈：最优扩散方差估计（下）

PaperWeekly

0+阅读 · 2022年10月10日

生成扩散模型漫谈：最优扩散方差估计（上）

生成扩散模型漫谈：最优扩散方差估计（上）

PaperWeekly

0+阅读 · 2022年9月25日

赛尔笔记 | 逻辑推理阅读理解任务及方法

赛尔笔记 | 逻辑推理阅读理解任务及方法

哈工大SCIR

1+阅读 · 2022年6月7日

论文浅尝｜简单高效的知识图谱表示学习负样本采样方法

论文浅尝｜简单高效的知识图谱表示学习负样本采样方法

开放知识图谱

14+阅读 · 2021年7月25日

已删除

德先生

53+阅读 · 2019年4月28日

论文浅尝 | 区分概念和实例的知识图谱嵌入方法

论文浅尝 | 区分概念和实例的知识图谱嵌入方法

开放知识图谱

17+阅读 · 2019年1月19日

用 LDA 和 LSA 两种方法来降维和做 Topic 建模

用 LDA 和 LSA 两种方法来降维和做 Topic 建模

AI研习社

13+阅读 · 2018年8月24日

线性回归：简单线性回归详解

线性回归：简单线性回归详解

专知

12+阅读 · 2018年3月10日

回归预测&时间序列预测

回归预测&时间序列预测

GBASE数据工程部数据团队

44+阅读 · 2017年5月17日

From Softmax to Sparsemax-ICML16（1）

From Softmax to Sparsemax-ICML16（1）

KingsGarden

74+阅读 · 2016年11月26日

相关论文

The noise level in linear regression with dependent data

Arxiv

0+阅读 · 2023年5月18日

On true versus estimated propensity scores for treatment effect estimation with discrete controls

Arxiv

0+阅读 · 2023年5月18日

Optimality and complexity of classification by random projection

Arxiv

0+阅读 · 2023年5月18日

Sparse joint shift in multinomial classification

Arxiv

0+阅读 · 2023年5月18日

Unconfounded Propensity Estimation for Unbiased Ranking

Arxiv

0+阅读 · 2023年5月18日

Variational Classification

Arxiv

0+阅读 · 2023年5月17日

Consistency and asymptotic normality in a class of nearly unstable processes

Arxiv

0+阅读 · 2023年5月17日

Optimized Joint Beamforming for Wireless Powered Over-the-Air Computation

Arxiv

0+阅读 · 2023年5月17日

Consensus Based Medical Image Segmentation Using Semi-Supervised Learning And Graph Cuts

Arxiv

11+阅读 · 2018年5月21日

Multi-pseudo Regularized Label for Generated Samples in Person Re-Identification

Arxiv

12+阅读 · 2018年1月29日

相关基金

基于广义部分线性单指标模型的高维纵向数据统计分析

国家自然科学基金

1+阅读 · 2015年12月31日

无界区域椭圆型和抛物型偏微分方程的人工边界条件数值方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于偏相关系数截断法的超高维模型的变量选择

国家自然科学基金

1+阅读 · 2013年12月31日

随机矩阵/数组形式高维数据的充分降维：统计理论、方法及其应用

国家自然科学基金

2+阅读 · 2013年12月31日

带约束推断的参数和半参数回归模型有偏估计及变量选择理论与方法研究

国家自然科学基金

1+阅读 · 2012年12月31日

超高维数据的变量筛选方法

国家自然科学基金

0+阅读 · 2012年12月31日

基于不完整数据的氧化铝蒸发过程故障诊断方法研究

国家自然科学基金

0+阅读 · 2012年12月31日

充分降维理论中基于分布加权思想的压缩估计

国家自然科学基金

2+阅读 · 2011年12月31日

混波室法电磁兼容测试的测量不确定度研究

国家自然科学基金

0+阅读 · 2011年12月31日

随机扰动下非线性动力系统的不确定行为及扰动敏感度的数值实验和分析

国家自然科学基金

0+阅读 · 2009年12月31日

微信扫码咨询专知VIP会员