Buying Data of Unknown Quality: Fisher Information Procurement Auctions - 专知论文

会员服务 ·

0

样本 · 报告 · 数据市场 · 数据质量 · 统计参数估计 ·

Buying Data of Unknown Quality: Fisher Information Procurement Auctions

翻译：购买未知质量的数据：费雪信息采购拍卖

Yuchen Hu,Martin J. Wainwright,Stephen Bates

We study statistical parameter estimation in the setting of data markets. A buyer seeks to estimate a parameter based on samples that can be purchased from competing providers that differ in their data quality and provision costs. When quality is known ex ante, we define a cost-per-information score that summarizes each provider's provision cost per unit of information about the buyer's estimation objective. We describe second-score procurement mechanism that ranks providers by this score, and endogenously chooses both a provider and a sample size while making truthful cost reports optimal. We then turn to the more realistic setting where data quality is private, and can only be indirectly observed via the delivered data. In this setting, we propose a simple mechanism that augments the second-score rule with a lenient ex post statistical test of the reported quality. We prove that under mild conditions, there exists an equilibrium in which sellers report costs truthfully and report quality up to deviations that vanish as the procured sample size grows. Our analysis highlights how the choice of verification test and the buyer's accuracy-cost tradeoff jointly shape participation and misreporting incentives in data markets.

翻译：我们研究了数据市场背景下的统计参数估计问题。买方需要根据可从竞争性供应商处购买的样本来估计参数，这些供应商在数据质量和供应成本上存在差异。当质量事先已知时，我们定义了一个每单位信息成本评分，该评分总结了每个供应商相对于买方估计目标每单位信息的供应成本。我们描述了一种二次评分采购机制，该机制根据此评分对供应商进行排名，并内生地选择供应商和样本量，同时使诚实的成本报告达到最优。随后，我们转向更现实的场景，即数据质量是私有的，只能通过交付的数据间接观察。在此场景中，我们提出了一种简单机制，该机制在二次评分规则基础上增加了针对所报告质量的宽松事后统计检验。我们证明，在温和条件下，存在一个均衡，其中卖方如实报告成本，并报告质量，其偏差随着采购样本量的增加而消失。我们的分析强调了验证测试的选择与买方的精度-成本权衡如何共同塑造数据市场中的参与和虚假报告激励。

0

相关内容

数据质量维度的实践展开：一项综述

数据质量维度的实践展开：一项综述

专知会员服务

20+阅读 · 2025年7月28日

《数据价值化与数据要素市场发展报告（2024年）》下载

《数据价值化与数据要素市场发展报告（2024年）》下载

专知会员服务

35+阅读 · 2024年10月6日

数据要素流通典型应用场景案例集（2023）

数据要素流通典型应用场景案例集（2023）

专知会员服务

49+阅读 · 2023年12月6日

数据要素行业深度报告：新型生产要素，新增长引擎

数据要素行业深度报告：新型生产要素，新增长引擎

专知会员服务

35+阅读 · 2023年11月28日

国家标准《物联网数据质量》（征求意见稿）

国家标准《物联网数据质量》（征求意见稿）

专知会员服务

52+阅读 · 2022年9月13日

国家标准《信息技术大数据数据资产价值评估》（征求意见稿）

国家标准《信息技术大数据数据资产价值评估》（征求意见稿）

专知会员服务

42+阅读 · 2022年9月9日

工信部发布《质量大数据白皮书》，178页pdf

工信部发布《质量大数据白皮书》，178页pdf

专知会员服务

95+阅读 · 2022年7月12日

《数据标准管理实践白皮书》，20页pdf，中国信息通信研究院云计算与大数据研究所

《数据标准管理实践白皮书》，20页pdf，中国信息通信研究院云计算与大数据研究所

专知会员服务

51+阅读 · 2022年5月31日

【O’Reilly讲座】基于深度学习的异常检测方法用于检测大型数据集的质量：Anomaly detection using deep learning to measure the quality of large datasets

【O’Reilly讲座】基于深度学习的异常检测方法用于检测大型数据集的质量：Anomaly detection using deep learning to measure the quality of large datasets

专知会员服务

31+阅读 · 2020年1月11日

【报告推荐】线上食品推荐中的数据分析（Computational Data Analytics on the Web for Better Food Decision Making）

【报告推荐】线上食品推荐中的数据分析（Computational Data Analytics on the Web for Better Food Decision Making）

专知会员服务

16+阅读 · 2019年10月2日

国家标准《信息技术大数据数据资产价值评估》（征求意见稿）

国家标准《信息技术大数据数据资产价值评估》（征求意见稿）

专知

18+阅读 · 2022年9月9日

置信学习：让样本中的"脏数据"原形毕露 ( 附开源实现 )

置信学习：让样本中的"脏数据"原形毕露 ( 附开源实现 )

DataFunTalk

12+阅读 · 2020年7月3日

【WWW2020-新加坡国立大学】知识图谱强化负采样的推荐系统，Reinforced Negative Sampling

【WWW2020-新加坡国立大学】知识图谱强化负采样的推荐系统，Reinforced Negative Sampling

专知

22+阅读 · 2020年3月14日

【资源推荐】公开数据集收集汇总

【资源推荐】公开数据集收集汇总

专知

19+阅读 · 2019年6月5日

20个安全可靠的免费数据源，各领域数据任你挑

20个安全可靠的免费数据源，各领域数据任你挑

机器学习算法与Python学习

14+阅读 · 2019年5月9日

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

专知

26+阅读 · 2019年2月12日

AI量化交易，盘点你不可不知的行业信息！

AI量化交易，盘点你不可不知的行业信息！

专知

17+阅读 · 2019年1月9日

【大数据】海量数据分析能力形成和大数据关键技术

【大数据】海量数据分析能力形成和大数据关键技术

产业智能官

17+阅读 · 2018年10月29日

【工业大数据】工业大数据始于业务止于业务、车间物联网数据管理、面向产品全寿期的xBOM、构建制造型企业新型能力

【工业大数据】工业大数据始于业务止于业务、车间物联网数据管理、面向产品全寿期的xBOM、构建制造型企业新型能力

产业智能官

12+阅读 · 2018年10月22日

不要担心没数据！史上最全数据集网站汇总

不要担心没数据！史上最全数据集网站汇总

数盟

14+阅读 · 2018年4月18日

大规模参数估计的约束无导数优化信赖域方法

国家自然科学基金

1+阅读 · 2015年12月31日

基于视频数据的消费者偏好测量研究

国家自然科学基金

2+阅读 · 2015年12月31日

信息不完全的双边匹配决策方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

以用户为中心的电子商务大数据偏好查询处理与优化

国家自然科学基金

0+阅读 · 2015年12月31日

基于在线消费者购买意向挖掘的个性化推荐研究

国家自然科学基金

0+阅读 · 2015年12月31日

前瞻性非财务信息披露质量研究

国家自然科学基金

0+阅读 · 2015年12月31日

大数据环境下基于量子计算的非结构化数据关键问题的研究

国家自然科学基金

2+阅读 · 2015年12月31日

上市公司文本信息分析研究：基于大数据的视角

国家自然科学基金

8+阅读 · 2014年12月31日

竞争供应链之间存在横向信息共享的采购策略与合同设计

国家自然科学基金

0+阅读 · 2014年12月31日

大数据环境下融合多源信息的推荐系统关键问题研究

国家自然科学基金

6+阅读 · 2014年12月31日

Private Private Information in Second-Price Auction

Arxiv

0+阅读 · 4月27日

Revenue-Optimal Pricing for Budget-Constrained Buyers in Data Markets

Arxiv

0+阅读 · 4月25日

Collusion-proof Auction Design using Side Information

Arxiv

0+阅读 · 4月5日

Optimal Pricing with Unreliable Signals

Arxiv

0+阅读 · 4月3日

How to Sell High-Dimensional Data Optimally

Arxiv

0+阅读 · 3月24日

Nonparametric Empirical Bayes Estimation on Heterogeneous Data

Arxiv

0+阅读 · 3月24日

A Robust Multi-Item Auction Design with Statistical Learning

Arxiv

0+阅读 · 3月7日

On the Monotonicity of Information Costs

Arxiv

0+阅读 · 3月5日

A semi-parametric approach for estimating consumer valuation distributions using second price auctions

Arxiv

0+阅读 · 2月20日

Learning from Biased and Costly Data Sources: Minimax-optimal Data Collection under a Budget

Arxiv

0+阅读 · 2月19日

VIP会员

文章信息

相关主题

统计参数估计

最新内容

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

专知会员服务

2+阅读 · 6月23日

综述 | 世界动作模型：少做梦，多行动

综述 | 世界动作模型：少做梦，多行动

专知会员服务

4+阅读 · 6月23日

美以伊冲突：无人机与人工智能的运用

美以伊冲突：无人机与人工智能的运用

专知会员服务

7+阅读 · 6月23日

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

专知会员服务

3+阅读 · 6月23日

《特种部队在透明战场中的生存力》最新报告

《特种部队在透明战场中的生存力》最新报告

专知会员服务

4+阅读 · 6月23日

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

专知会员服务

6+阅读 · 6月23日

《人工智能生成的零日漏洞：对未来作战的影响》

《人工智能生成的零日漏洞：对未来作战的影响》

专知会员服务

5+阅读 · 6月23日

《理解伙伴国在防务能力选择中的偏好：探索美国解决方案的替代选择》美智库200页报告

《理解伙伴国在防务能力选择中的偏好：探索美国解决方案的替代选择》美智库200页报告

专知会员服务

3+阅读 · 6月23日

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

专知会员服务

6+阅读 · 6月22日

综述 | 3D场景图：开放挑战与未来方向

综述 | 3D场景图：开放挑战与未来方向

专知会员服务

8+阅读 · 6月22日

《国防工业6.0：全自主作战系统、量子-人工智能融合与新一代战略威慑》

《国防工业6.0：全自主作战系统、量子-人工智能融合与新一代战略威慑》

专知会员服务

8+阅读 · 6月22日

21世纪的无人机战争

21世纪的无人机战争

专知会员服务

4+阅读 · 6月22日

《伊朗与以色列-美国热战及其对数字技术的影响》

《伊朗与以色列-美国热战及其对数字技术的影响》

专知会员服务

6+阅读 · 6月22日

《量子技术的军事任务技术适配与利用》

《量子技术的军事任务技术适配与利用》

专知会员服务

5+阅读 · 6月22日

《美国陆军军官学校（西点军校）本科生科研中生成式人工智能的使用》

《美国陆军军官学校（西点军校）本科生科研中生成式人工智能的使用》

专知会员服务

9+阅读 · 6月22日

相关VIP内容

数据质量维度的实践展开：一项综述

数据质量维度的实践展开：一项综述

专知会员服务

20+阅读 · 2025年7月28日

《数据价值化与数据要素市场发展报告（2024年）》下载

《数据价值化与数据要素市场发展报告（2024年）》下载

专知会员服务

35+阅读 · 2024年10月6日

数据要素流通典型应用场景案例集（2023）

数据要素流通典型应用场景案例集（2023）

专知会员服务

49+阅读 · 2023年12月6日

数据要素行业深度报告：新型生产要素，新增长引擎

数据要素行业深度报告：新型生产要素，新增长引擎

专知会员服务

35+阅读 · 2023年11月28日

国家标准《物联网数据质量》（征求意见稿）

国家标准《物联网数据质量》（征求意见稿）

专知会员服务

52+阅读 · 2022年9月13日

国家标准《信息技术大数据数据资产价值评估》（征求意见稿）

国家标准《信息技术大数据数据资产价值评估》（征求意见稿）

专知会员服务

42+阅读 · 2022年9月9日

工信部发布《质量大数据白皮书》，178页pdf

工信部发布《质量大数据白皮书》，178页pdf

专知会员服务

95+阅读 · 2022年7月12日

《数据标准管理实践白皮书》，20页pdf，中国信息通信研究院云计算与大数据研究所

《数据标准管理实践白皮书》，20页pdf，中国信息通信研究院云计算与大数据研究所

专知会员服务

51+阅读 · 2022年5月31日

【O’Reilly讲座】基于深度学习的异常检测方法用于检测大型数据集的质量：Anomaly detection using deep learning to measure the quality of large datasets

【O’Reilly讲座】基于深度学习的异常检测方法用于检测大型数据集的质量：Anomaly detection using deep learning to measure the quality of large datasets

专知会员服务

31+阅读 · 2020年1月11日

【报告推荐】线上食品推荐中的数据分析（Computational Data Analytics on the Web for Better Food Decision Making）

【报告推荐】线上食品推荐中的数据分析（Computational Data Analytics on the Web for Better Food Decision Making）

专知会员服务

16+阅读 · 2019年10月2日

热门VIP内容

开通专知VIP会员享更多权益服务

综述 | 世界动作模型：少做梦，多行动

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

美以伊冲突：无人机与人工智能的运用

相关资讯

国家标准《信息技术大数据数据资产价值评估》（征求意见稿）

国家标准《信息技术大数据数据资产价值评估》（征求意见稿）

专知

18+阅读 · 2022年9月9日

置信学习：让样本中的"脏数据"原形毕露 ( 附开源实现 )

置信学习：让样本中的"脏数据"原形毕露 ( 附开源实现 )

DataFunTalk

12+阅读 · 2020年7月3日

【WWW2020-新加坡国立大学】知识图谱强化负采样的推荐系统，Reinforced Negative Sampling

【WWW2020-新加坡国立大学】知识图谱强化负采样的推荐系统，Reinforced Negative Sampling

专知

22+阅读 · 2020年3月14日

【资源推荐】公开数据集收集汇总

【资源推荐】公开数据集收集汇总

专知

19+阅读 · 2019年6月5日

20个安全可靠的免费数据源，各领域数据任你挑

20个安全可靠的免费数据源，各领域数据任你挑

机器学习算法与Python学习

14+阅读 · 2019年5月9日

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

专知

26+阅读 · 2019年2月12日

AI量化交易，盘点你不可不知的行业信息！

AI量化交易，盘点你不可不知的行业信息！

专知

17+阅读 · 2019年1月9日

【大数据】海量数据分析能力形成和大数据关键技术

【大数据】海量数据分析能力形成和大数据关键技术

产业智能官

17+阅读 · 2018年10月29日

【工业大数据】工业大数据始于业务止于业务、车间物联网数据管理、面向产品全寿期的xBOM、构建制造型企业新型能力

【工业大数据】工业大数据始于业务止于业务、车间物联网数据管理、面向产品全寿期的xBOM、构建制造型企业新型能力

产业智能官

12+阅读 · 2018年10月22日

不要担心没数据！史上最全数据集网站汇总

不要担心没数据！史上最全数据集网站汇总

数盟

14+阅读 · 2018年4月18日

相关论文

Private Private Information in Second-Price Auction

Arxiv

0+阅读 · 4月27日

Revenue-Optimal Pricing for Budget-Constrained Buyers in Data Markets

Arxiv

0+阅读 · 4月25日

Collusion-proof Auction Design using Side Information

Arxiv

0+阅读 · 4月5日

Optimal Pricing with Unreliable Signals

Arxiv

0+阅读 · 4月3日

How to Sell High-Dimensional Data Optimally

Arxiv

0+阅读 · 3月24日

Nonparametric Empirical Bayes Estimation on Heterogeneous Data

Arxiv

0+阅读 · 3月24日

A Robust Multi-Item Auction Design with Statistical Learning

Arxiv

0+阅读 · 3月7日

On the Monotonicity of Information Costs

Arxiv

0+阅读 · 3月5日

A semi-parametric approach for estimating consumer valuation distributions using second price auctions

Arxiv

0+阅读 · 2月20日

Learning from Biased and Costly Data Sources: Minimax-optimal Data Collection under a Budget

Arxiv

0+阅读 · 2月19日

相关基金

大规模参数估计的约束无导数优化信赖域方法

国家自然科学基金

1+阅读 · 2015年12月31日

基于视频数据的消费者偏好测量研究

国家自然科学基金

2+阅读 · 2015年12月31日

信息不完全的双边匹配决策方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

以用户为中心的电子商务大数据偏好查询处理与优化

国家自然科学基金

0+阅读 · 2015年12月31日

基于在线消费者购买意向挖掘的个性化推荐研究

国家自然科学基金

0+阅读 · 2015年12月31日

前瞻性非财务信息披露质量研究

国家自然科学基金

0+阅读 · 2015年12月31日

大数据环境下基于量子计算的非结构化数据关键问题的研究

国家自然科学基金

2+阅读 · 2015年12月31日

上市公司文本信息分析研究：基于大数据的视角

国家自然科学基金

8+阅读 · 2014年12月31日

竞争供应链之间存在横向信息共享的采购策略与合同设计

国家自然科学基金

0+阅读 · 2014年12月31日

大数据环境下融合多源信息的推荐系统关键问题研究

国家自然科学基金

6+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员