Exploiting Similarities in A/B Testing with Off-Policy Estimation - 专知论文

会员服务 ·

0

估计/估计量 · 相似度 · 基准 · Performer · CASES ·

Exploiting Similarities in A/B Testing with Off-Policy Estimation

翻译：利用离线策略估计发掘A/B测试中的相似性

Otmane Sakhi,Alexandre Gilotte,David Rohde

from arxiv, KDD '26

We study A/B testing, the standard protocol for measuring the performance gain of a new decision system relative to a baseline. Traditional A/B testing treats both systems as black boxes, ignoring potential similarities between them. In practice, however, new and baseline systems are rarely radically different and often share significant structure, which can be captured by their propensities to make similar decisions. We show that in such cases, the commonly used difference-in-means estimator, though unbiased, is statistically suboptimal. Leveraging off-policy estimation, we introduce a family of A/B testing estimators that exploit the propensities of the tested systems to achieve improved concentration properties. This family is flexible enough to be tailored to practical decision-making. The resulting estimators are simple, robust to propensities misspecification, substantially more accurate when the tested systems exhibit similarities, and gracefully fall back to the difference-in-means estimator when such similarities are absent. Our theoretical analysis and empirical studies confirm their efficiency and practicality.

翻译：我们研究A/B测试——衡量新决策系统相对于基线系统性能提升的标准协议。传统A/B测试将两个系统视为黑箱，忽略了它们之间潜在的相似性。然而在实践中，新系统与基线系统极少存在根本性差异，往往共享显著的结构特征，这种特征可通过它们做出相似决策的倾向性加以捕捉。研究表明，在此类情形下，常用的均值差异估计量虽然无偏，但在统计上并非最优。我们借助离线策略估计，引入一类利用测试系统倾向性来获得更优集中特性的A/B测试估计量族。该估计量族具有充分灵活性，可针对实际决策需求进行定制。由此产生的估计量结构简洁、对倾向性设定错误具有稳健性，在测试系统呈现相似性时能显著提高精度，且在缺乏此类相似性时可优雅地退化为均值差异估计量。我们的理论分析与实证研究均证实了其高效性与实用性。

0

相关内容

估计/估计量

估计/估计量

《测试评估（T&E）与基于模型的系统工程（MBSE）的整合》最新120页

《测试评估（T&E）与基于模型的系统工程（MBSE）的整合》最新120页

专知会员服务

17+阅读 · 3月29日

【博士论文】在离线、在线和策略设置下通过对偶性进行的近似

【博士论文】在离线、在线和策略设置下通过对偶性进行的近似

专知会员服务

11+阅读 · 2月25日

对抗性实验：利用敏感性分析、邻域搜索启发式算法和概率性想定生成来暴露人工智能弱点 | 2025最新83页

对抗性实验：利用敏感性分析、邻域搜索启发式算法和概率性想定生成来暴露人工智能弱点 | 2025最新83页

专知会员服务

30+阅读 · 2025年10月21日

【牛津大学博士论文】不确定性量化与因果考量在非策略决策制定中的应用

【牛津大学博士论文】不确定性量化与因果考量在非策略决策制定中的应用

专知会员服务

20+阅读 · 2025年2月24日

《综述：测试与评估中应用的人工智能工具》

《综述：测试与评估中应用的人工智能工具》

专知会员服务

75+阅读 · 2024年1月22日

【2023新书】实用A/B测试:创建实验驱动的产品，255页pdf

【2023新书】实用A/B测试:创建实验驱动的产品，255页pdf

专知会员服务

35+阅读 · 2023年11月7日

《学习型系统的测试与评估》

《学习型系统的测试与评估》

专知会员服务

61+阅读 · 2023年3月12日

《模拟空战团队态势感知精度测量技术——感知与绩效的曲线关系》芬兰国防大学

《模拟空战团队态势感知精度测量技术——感知与绩效的曲线关系》芬兰国防大学

专知会员服务

37+阅读 · 2022年6月20日

【博士论文】大数据相似查询关键技术研究

【博士论文】大数据相似查询关键技术研究

专知会员服务

24+阅读 · 2021年12月2日

语义相似性算法演化论文，29页pdf，Evolution of Semantic Similarity - A Survey

语义相似性算法演化论文，29页pdf，Evolution of Semantic Similarity - A Survey

专知会员服务

44+阅读 · 2020年4月30日

常见的距离算法和相似度计算方法

常见的距离算法和相似度计算方法

极市平台

18+阅读 · 2020年7月31日

AB实验在滴滴数据驱动中的应用

AB实验在滴滴数据驱动中的应用

DataFunTalk

15+阅读 · 2020年5月31日

机器学习计算距离和相似度的方法

机器学习计算距离和相似度的方法

极市平台

10+阅读 · 2019年9月20日

如何找到相似Graph？DeepMind提出超越GNN的图匹配网络

如何找到相似Graph？DeepMind提出超越GNN的图匹配网络

机器之心

24+阅读 · 2019年5月7日

论文浅尝 | Interaction Embeddings for Prediction and Explanation

论文浅尝 | Interaction Embeddings for Prediction and Explanation

开放知识图谱

11+阅读 · 2019年2月1日

计算文本相似度常用的四种方法

计算文本相似度常用的四种方法

论智

33+阅读 · 2018年5月18日

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

机器学习研究会

19+阅读 · 2018年3月11日

推荐算法：Match与Rank模型的交织配合

推荐算法：Match与Rank模型的交织配合

从0到1

15+阅读 · 2017年12月18日

文本分析 | 常用距离/相似度一览

文本分析 | 常用距离/相似度一览

数说工作室

26+阅读 · 2017年10月12日

各种相似性度量及Python实现

各种相似性度量及Python实现

机器学习算法与Python学习

11+阅读 · 2017年7月6日

群体偏好的敏感性度量方法研究和群决策方法的可实施性评价

国家自然科学基金

0+阅读 · 2017年12月31日

面向跨领域异构数据的患者相似性学习方法及应用

国家自然科学基金

23+阅读 · 2016年12月31日

组合测试用例优先排序算法及选择策略研究

国家自然科学基金

9+阅读 · 2015年12月31日

基于结构相似性的综合滤波器组优化设计理论及应用

国家自然科学基金

1+阅读 · 2015年12月31日

数据驱动的被动协议测试方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

试验设计中的模型选择

国家自然科学基金

6+阅读 · 2014年12月31日

相依回归模型与扩散过程的统计推断及其应用

国家自然科学基金

1+阅读 · 2014年12月31日

概率抽样设计及其统计推断方法

国家自然科学基金

6+阅读 · 2014年12月31日

基于似然函数的统计推断

国家自然科学基金

5+阅读 · 2014年12月31日

具有可靠性增长的系统可靠性试验鉴定方法研究

国家自然科学基金

10+阅读 · 2013年12月31日

Offline Preference-Based Trajectory Evaluation

Arxiv

0+阅读 · 6月16日

On Randomized Algorithms in Online Strategic Classification

Arxiv

0+阅读 · 6月15日

Experimentation for Different Scheduling Policies on Queues: Mixed Differences-in-Q Estimators Based on Little's Law

Arxiv

0+阅读 · 6月14日

Differences in Detection: Explainability Where it Matters

Arxiv

0+阅读 · 6月5日

Benchmarking covariate-adjustment strategies for randomized clinical trials

Arxiv

0+阅读 · 6月4日

Estimation of Treatment Effects Under Nonstationarity via the Truncated Policy Gradient Estimator

Arxiv

0+阅读 · 6月2日

Off-Policy Learning in Large Action Spaces: Optimization Matters More Than Estimation

Arxiv

0+阅读 · 6月1日

Experimentation for Different Scheduling Policies on Queues: Mixed Differences-in-Q Estimators Based on Little's Law

Arxiv

0+阅读 · 5月28日

Nesting a Target Study within a Target Trial: A Framework for Evaluating Intervention Effects on Disparities

Arxiv

0+阅读 · 5月15日

Two-sided Assortment Optimization: Adaptivity Gaps and Approximation Algorithms

Arxiv

0+阅读 · 5月6日

VIP会员

文章信息

相关主题

估计/估计量

最新内容

从采集到决策：美军视角下的战术情报范式重构

从采集到决策：美军视角下的战术情报范式重构

专知会员服务

0+阅读 · 今天2:42

乌克兰“德尔塔”系统揭示无人机、数据与领导力如何重塑现代安全格局

乌克兰“德尔塔”系统揭示无人机、数据与领导力如何重塑现代安全格局

专知会员服务

1+阅读 · 今天2:37

大规模作战中的参谋流程：作为联合兵种作战组成部分的目标锁定

大规模作战中的参谋流程：作为联合兵种作战组成部分的目标锁定

专知会员服务

2+阅读 · 今天2:23

《北约概念开发与实验（CD&E）手册：概念开发者工具箱》100页手册

《北约概念开发与实验（CD&E）手册：概念开发者工具箱》100页手册

专知会员服务

5+阅读 · 今天2:21

《履带式无人地面战车技术发展现状》

《履带式无人地面战车技术发展现状》

专知会员服务

2+阅读 · 今天1:46

《美国空军B-2“幽灵”隐身轰炸机系统工程案例研究》117页

《美国空军B-2“幽灵”隐身轰炸机系统工程案例研究》117页

专知会员服务

5+阅读 · 8月1日

隐身技术前沿综述：物理机理、工程实践与战略展望

隐身技术前沿综述：物理机理、工程实践与战略展望

专知会员服务

4+阅读 · 8月1日

《多变海洋环境下无人水面艇与自主水下机器人对接的最优路径规划》

《多变海洋环境下无人水面艇与自主水下机器人对接的最优路径规划》

专知会员服务

3+阅读 · 8月1日

《以机反机：基于无人机载麦克风的空中周界入侵检测》

《以机反机：基于无人机载麦克风的空中周界入侵检测》

专知会员服务

4+阅读 · 8月1日

《无人机脆弱性利用：网络空间力量的新域》

《无人机脆弱性利用：网络空间力量的新域》

专知会员服务

2+阅读 · 8月1日

美空军如何将人工智能从战场部署至后方机关

美空军如何将人工智能从战场部署至后方机关

专知会员服务

11+阅读 · 7月31日

《美战争部指令文件：网络空间效应与使能能力测试评估》

《美战争部指令文件：网络空间效应与使能能力测试评估》

专知会员服务

7+阅读 · 7月31日

《史诗怒火行动：多域前瞻评估》49页报告

《史诗怒火行动：多域前瞻评估》49页报告

专知会员服务

7+阅读 · 7月31日

《英国防部：未来空战系统数字化战略》33页

《英国防部：未来空战系统数字化战略》33页

专知会员服务

5+阅读 · 7月31日

《面向自主飞行网络的智能体人工智能架构》

《面向自主飞行网络的智能体人工智能架构》

专知会员服务

7+阅读 · 7月31日

相关VIP内容

《测试评估（T&E）与基于模型的系统工程（MBSE）的整合》最新120页

《测试评估（T&E）与基于模型的系统工程（MBSE）的整合》最新120页

专知会员服务

17+阅读 · 3月29日

【博士论文】在离线、在线和策略设置下通过对偶性进行的近似

【博士论文】在离线、在线和策略设置下通过对偶性进行的近似

专知会员服务

11+阅读 · 2月25日

对抗性实验：利用敏感性分析、邻域搜索启发式算法和概率性想定生成来暴露人工智能弱点 | 2025最新83页

对抗性实验：利用敏感性分析、邻域搜索启发式算法和概率性想定生成来暴露人工智能弱点 | 2025最新83页

专知会员服务

30+阅读 · 2025年10月21日

【牛津大学博士论文】不确定性量化与因果考量在非策略决策制定中的应用

【牛津大学博士论文】不确定性量化与因果考量在非策略决策制定中的应用

专知会员服务

20+阅读 · 2025年2月24日

《综述：测试与评估中应用的人工智能工具》

《综述：测试与评估中应用的人工智能工具》

专知会员服务

75+阅读 · 2024年1月22日

【2023新书】实用A/B测试:创建实验驱动的产品，255页pdf

【2023新书】实用A/B测试:创建实验驱动的产品，255页pdf

专知会员服务

35+阅读 · 2023年11月7日

《学习型系统的测试与评估》

《学习型系统的测试与评估》

专知会员服务

61+阅读 · 2023年3月12日

《模拟空战团队态势感知精度测量技术——感知与绩效的曲线关系》芬兰国防大学

《模拟空战团队态势感知精度测量技术——感知与绩效的曲线关系》芬兰国防大学

专知会员服务

37+阅读 · 2022年6月20日

【博士论文】大数据相似查询关键技术研究

【博士论文】大数据相似查询关键技术研究

专知会员服务

24+阅读 · 2021年12月2日

语义相似性算法演化论文，29页pdf，Evolution of Semantic Similarity - A Survey

语义相似性算法演化论文，29页pdf，Evolution of Semantic Similarity - A Survey

专知会员服务

44+阅读 · 2020年4月30日

热门VIP内容

开通专知VIP会员享更多权益服务

乌克兰“德尔塔”系统揭示无人机、数据与领导力如何重塑现代安全格局

《北约概念开发与实验（CD&E）手册：概念开发者工具箱》100页手册

从采集到决策：美军视角下的战术情报范式重构

大规模作战中的参谋流程：作为联合兵种作战组成部分的目标锁定

相关资讯

常见的距离算法和相似度计算方法

常见的距离算法和相似度计算方法

极市平台

18+阅读 · 2020年7月31日

AB实验在滴滴数据驱动中的应用

AB实验在滴滴数据驱动中的应用

DataFunTalk

15+阅读 · 2020年5月31日

机器学习计算距离和相似度的方法

机器学习计算距离和相似度的方法

极市平台

10+阅读 · 2019年9月20日

如何找到相似Graph？DeepMind提出超越GNN的图匹配网络

如何找到相似Graph？DeepMind提出超越GNN的图匹配网络

机器之心

24+阅读 · 2019年5月7日

论文浅尝 | Interaction Embeddings for Prediction and Explanation

论文浅尝 | Interaction Embeddings for Prediction and Explanation

开放知识图谱

11+阅读 · 2019年2月1日

计算文本相似度常用的四种方法

计算文本相似度常用的四种方法

论智

33+阅读 · 2018年5月18日

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

【机器学习基本理论】详解最大似然估计（MLE）、最大后验概率估计（MAP），以及贝叶斯公式的理解

机器学习研究会

19+阅读 · 2018年3月11日

推荐算法：Match与Rank模型的交织配合

推荐算法：Match与Rank模型的交织配合

从0到1

15+阅读 · 2017年12月18日

文本分析 | 常用距离/相似度一览

文本分析 | 常用距离/相似度一览

数说工作室

26+阅读 · 2017年10月12日

各种相似性度量及Python实现

各种相似性度量及Python实现

机器学习算法与Python学习

11+阅读 · 2017年7月6日

相关论文

Offline Preference-Based Trajectory Evaluation

Arxiv

0+阅读 · 6月16日

On Randomized Algorithms in Online Strategic Classification

Arxiv

0+阅读 · 6月15日

Experimentation for Different Scheduling Policies on Queues: Mixed Differences-in-Q Estimators Based on Little's Law

Arxiv

0+阅读 · 6月14日

Differences in Detection: Explainability Where it Matters

Arxiv

0+阅读 · 6月5日

Benchmarking covariate-adjustment strategies for randomized clinical trials

Arxiv

0+阅读 · 6月4日

Estimation of Treatment Effects Under Nonstationarity via the Truncated Policy Gradient Estimator

Arxiv

0+阅读 · 6月2日

Off-Policy Learning in Large Action Spaces: Optimization Matters More Than Estimation

Arxiv

0+阅读 · 6月1日

Experimentation for Different Scheduling Policies on Queues: Mixed Differences-in-Q Estimators Based on Little's Law

Arxiv

0+阅读 · 5月28日

Nesting a Target Study within a Target Trial: A Framework for Evaluating Intervention Effects on Disparities

Arxiv

0+阅读 · 5月15日

Two-sided Assortment Optimization: Adaptivity Gaps and Approximation Algorithms

Arxiv

0+阅读 · 5月6日

相关基金

群体偏好的敏感性度量方法研究和群决策方法的可实施性评价

国家自然科学基金

0+阅读 · 2017年12月31日

面向跨领域异构数据的患者相似性学习方法及应用

国家自然科学基金

23+阅读 · 2016年12月31日

组合测试用例优先排序算法及选择策略研究

国家自然科学基金

9+阅读 · 2015年12月31日

基于结构相似性的综合滤波器组优化设计理论及应用

国家自然科学基金

1+阅读 · 2015年12月31日

数据驱动的被动协议测试方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

试验设计中的模型选择

国家自然科学基金

6+阅读 · 2014年12月31日

相依回归模型与扩散过程的统计推断及其应用

国家自然科学基金

1+阅读 · 2014年12月31日

概率抽样设计及其统计推断方法

国家自然科学基金

6+阅读 · 2014年12月31日

基于似然函数的统计推断

国家自然科学基金

5+阅读 · 2014年12月31日

具有可靠性增长的系统可靠性试验鉴定方法研究

国家自然科学基金

10+阅读 · 2013年12月31日

微信扫码咨询专知VIP会员