A Catalog of Data Errors - 专知论文

会员服务 ·

0

A Catalog of Data Errors

翻译：数据错误目录

Divya Bhadauria,Hazar Harmouch,Felix Naumann,Divesh Srivastava,Lisa Ehrlinger

from arxiv, 34 pages, 3 figures, 2 tables

Data errors are widespread in real-world databases and severely impact downstream applications, such as machine learning pipelines or business analytics reports. Causes of such errors are manifold and can arise during both the design phase and the operational phase of a database. Some error types, such as missing values, duplicate tuples, or constraint violations, are widely recognized; others, such as disguised missing values or word transpositions, remain underexplored. Existing attempts to define and classify errors in data offer valuable but limited taxonomies, mostly informal and not covering the full range of error types. With the rise of AI, practitioners must increasingly detect and correct statistical errors such as bias and outliers, which are rarely considered within existing error taxonomies. This catalog presents a comprehensive list of 35 distinct error types, including both data errors (e.g., missing values, duplicate tuples) and error indicators (e.g., outliers, bias) for tabular data, classified into three non-overlapping categories: missing, incorrect, and redundant. For each error type, we provide a formal definition and practical example, and resolve terminological inconsistencies across related work. Our catalog enables researchers and practitioners to address various error types and systematically implement error-specific detection and cleaning strategies in data quality tools.

翻译：数据错误在实际数据库中普遍存在，并严重损害下游应用（如机器学习流水线或商业分析报告）。此类错误的成因复杂多样，可能源自数据库设计阶段与运行阶段。诸如缺失值、重复元组或约束违规等错误类型已被广泛认知；而伪装缺失值或词语换位等类型仍待深入探索。现有数据错误定义与分类的尝试虽具价值，但分类体系较为有限，大多为非正式定义且未覆盖全部错误类型。随着人工智能的兴起，从业者日益需要检测并修正统计性错误（如偏差与异常值），而这些内容在现有错误分类体系中鲜有涉及。本目录系统梳理了35种独立错误类型，涵盖表格数据的两种形态：数据错误（如缺失值、重复元组）与错误标识（如异常值、偏差），并将其归入三个互斥类别：缺失型、错误型与冗余型。针对每种错误类型，我们提供形式化定义与实践案例，并消解相关文献中的术语歧义。本目录旨在支持研究者与从业者系统应对各类数据错误，在数据质量工具中针对性实施错误检测与清洗策略。

0

相关内容

如何用机器学习损失函数？最新《机器学习损失函数》综述，详述其33个损失函数与分类法

如何用机器学习损失函数？最新《机器学习损失函数》综述，详述其33个损失函数与分类法

专知会员服务

70+阅读 · 2023年1月17日

【2022新书】金融服务中的数据质量工程:将制造技术应用于数据，245页pdf

【2022新书】金融服务中的数据质量工程:将制造技术应用于数据，245页pdf

专知会员服务

49+阅读 · 2022年10月30日

【Manning新书】如何掌握Go语言？这100个100个Go语言错误得避免，691页pdf

【Manning新书】如何掌握Go语言？这100个100个Go语言错误得避免，691页pdf

专知会员服务

41+阅读 · 2022年10月1日

如何处理数据缺失值？INRIA研究员Gael 《机器学习缺失值处理》54页ppt教程，为你讲解

如何处理数据缺失值？INRIA研究员Gael 《机器学习缺失值处理》54页ppt教程，为你讲解

专知会员服务

26+阅读 · 2022年4月21日

【数据科学导论书】Introduction to Datascience，253页pdf

【数据科学导论书】Introduction to Datascience，253页pdf

专知会员服务

50+阅读 · 2021年11月15日

【2020新书】数据结构与数据表示指南，112页pdf

【2020新书】数据结构与数据表示指南，112页pdf

专知会员服务

84+阅读 · 2020年10月6日

经济学中的数据科学，Data Science in Economics，附22页pdf

经济学中的数据科学，Data Science in Economics，附22页pdf

专知会员服务

36+阅读 · 2020年4月1日

缺失数据统计分析，第三版，462页pdf

缺失数据统计分析，第三版，462页pdf

专知会员服务

113+阅读 · 2020年2月28日

微软研究院新版书籍《数据科学基础》（Foundations of Data Science），附479页PDF下载

微软研究院新版书籍《数据科学基础》（Foundations of Data Science），附479页PDF下载

专知会员服务

137+阅读 · 2019年10月26日

最新49页《深度学习异常检测综述》论文，带你全面了解深度学习异常检测方法

最新49页《深度学习异常检测综述》论文，带你全面了解深度学习异常检测方法

专知会员服务

218+阅读 · 2019年10月18日

【干货书】数据科学手册，456页pdf

【干货书】数据科学手册，456页pdf

专知

15+阅读 · 2021年4月28日

缺失数据统计分析，第三版，462页pdf

缺失数据统计分析，第三版，462页pdf

专知

50+阅读 · 2020年2月28日

微软研究院新版书籍《数据科学基础》，附479页PDF下载

微软研究院新版书籍《数据科学基础》，附479页PDF下载

专知

47+阅读 · 2019年9月20日

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

AI100

14+阅读 · 2019年9月1日

一文教你如何处理不平衡数据集（附代码）

一文教你如何处理不平衡数据集（附代码）

大数据文摘

12+阅读 · 2019年6月2日

20个安全可靠的免费数据源，各领域数据任你挑

20个安全可靠的免费数据源，各领域数据任你挑

机器学习算法与Python学习

14+阅读 · 2019年5月9日

最新49页《深度学习异常检测综述》论文，带你全面了解深度学习异常检测方法

最新49页《深度学习异常检测综述》论文，带你全面了解深度学习异常检测方法

专知

137+阅读 · 2019年1月14日

最全数据科学学习资源：Python、线性代数、机器学习...

最全数据科学学习资源：Python、线性代数、机器学习...

人工智能头条

12+阅读 · 2018年5月14日

不要担心没数据！史上最全数据集网站汇总

不要担心没数据！史上最全数据集网站汇总

数盟

14+阅读 · 2018年4月18日

关于数据挖掘，有几本书推荐给你......

关于数据挖掘，有几本书推荐给你......

图灵教育

16+阅读 · 2017年10月11日

近似计算中基于概率图模型的软错误量化方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

数据驱动关键性能指标相关的故障诊断方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

含非正态及缺失数据的结构方程模型分析

国家自然科学基金

0+阅读 · 2015年12月31日

传感器故障下的数据驱动容错控制技术及其应用

国家自然科学基金

3+阅读 · 2015年12月31日

面向Bug报告的软件故障重现方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

多重排序数据的整合分析

国家自然科学基金

0+阅读 · 2015年12月31日

基于云计算平台的下一代测序数据错误修正算法研究与实现

国家自然科学基金

2+阅读 · 2015年12月31日

基于WEB信息的信息错误自动检测与修复技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

测量误差数据下约束线性模型的有偏估计及变量选择研究

国家自然科学基金

0+阅读 · 2014年12月31日

高维混合数据异常知识发现的粒计算模型关键问题研究

国家自然科学基金

1+阅读 · 2014年12月31日

Existence and Constructions of Strict Function-Correcting Codes with Data Protection

Arxiv

0+阅读 · 4月29日

An Interdisciplinary and Cross-Task Review on Missing Data Imputation

Arxiv

0+阅读 · 4月24日

Confidence envelopes for the false discoveries with heterogeneous data

Arxiv

0+阅读 · 4月21日

Is this chart lying to me? Automating the detection of misleading visualizations

Arxiv

0+阅读 · 4月17日

COBOLAssist: Analyzing and Fixing Compilation Errors for LLM-Powered COBOL Code Generation

Arxiv

0+阅读 · 4月5日

Toward Scalable Automated Repository-Level Datasets for Software Vulnerability Detection

Arxiv

0+阅读 · 3月18日

Learning Over Dirty Data with Minimal Repairs

Arxiv

0+阅读 · 3月18日

Query-Guided Analysis and Mitigation of Data Verification Errors (Extended Version)

Arxiv

0+阅读 · 3月9日

ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement

Arxiv

0+阅读 · 3月4日

Detecting Logic Bugs of Join Optimizations in DBMS

Arxiv

0+阅读 · 2月25日

VIP会员

文章信息

相关主题

最新内容

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

专知会员服务

0+阅读 · 18分钟前

综述 | 世界动作模型：少做梦，多行动

综述 | 世界动作模型：少做梦，多行动

专知会员服务

0+阅读 · 20分钟前

美以伊冲突：无人机与人工智能的运用

美以伊冲突：无人机与人工智能的运用

专知会员服务

1+阅读 · 32分钟前

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

专知会员服务

2+阅读 · 43分钟前

《特种部队在透明战场中的生存力》最新报告

《特种部队在透明战场中的生存力》最新报告

专知会员服务

1+阅读 · 52分钟前

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

专知会员服务

1+阅读 · 56分钟前

《人工智能生成的零日漏洞：对未来作战的影响》

《人工智能生成的零日漏洞：对未来作战的影响》

专知会员服务

1+阅读 · 刚刚

《理解伙伴国在防务能力选择中的偏好：探索美国解决方案的替代选择》美智库200页报告

《理解伙伴国在防务能力选择中的偏好：探索美国解决方案的替代选择》美智库200页报告

专知会员服务

1+阅读 · 今天13:59

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

专知会员服务

5+阅读 · 6月22日

综述 | 3D场景图：开放挑战与未来方向

综述 | 3D场景图：开放挑战与未来方向

专知会员服务

8+阅读 · 6月22日

《国防工业6.0：全自主作战系统、量子-人工智能融合与新一代战略威慑》

《国防工业6.0：全自主作战系统、量子-人工智能融合与新一代战略威慑》

专知会员服务

6+阅读 · 6月22日

21世纪的无人机战争

21世纪的无人机战争

专知会员服务

4+阅读 · 6月22日

《伊朗与以色列-美国热战及其对数字技术的影响》

《伊朗与以色列-美国热战及其对数字技术的影响》

专知会员服务

5+阅读 · 6月22日

《量子技术的军事任务技术适配与利用》

《量子技术的军事任务技术适配与利用》

专知会员服务

5+阅读 · 6月22日

《美国陆军军官学校（西点军校）本科生科研中生成式人工智能的使用》

《美国陆军军官学校（西点军校）本科生科研中生成式人工智能的使用》

专知会员服务

8+阅读 · 6月22日

相关VIP内容

如何用机器学习损失函数？最新《机器学习损失函数》综述，详述其33个损失函数与分类法

如何用机器学习损失函数？最新《机器学习损失函数》综述，详述其33个损失函数与分类法

专知会员服务

70+阅读 · 2023年1月17日

【2022新书】金融服务中的数据质量工程:将制造技术应用于数据，245页pdf

【2022新书】金融服务中的数据质量工程:将制造技术应用于数据，245页pdf

专知会员服务

49+阅读 · 2022年10月30日

【Manning新书】如何掌握Go语言？这100个100个Go语言错误得避免，691页pdf

【Manning新书】如何掌握Go语言？这100个100个Go语言错误得避免，691页pdf

专知会员服务

41+阅读 · 2022年10月1日

如何处理数据缺失值？INRIA研究员Gael 《机器学习缺失值处理》54页ppt教程，为你讲解

如何处理数据缺失值？INRIA研究员Gael 《机器学习缺失值处理》54页ppt教程，为你讲解

专知会员服务

26+阅读 · 2022年4月21日

【数据科学导论书】Introduction to Datascience，253页pdf

【数据科学导论书】Introduction to Datascience，253页pdf

专知会员服务

50+阅读 · 2021年11月15日

【2020新书】数据结构与数据表示指南，112页pdf

【2020新书】数据结构与数据表示指南，112页pdf

专知会员服务

84+阅读 · 2020年10月6日

经济学中的数据科学，Data Science in Economics，附22页pdf

经济学中的数据科学，Data Science in Economics，附22页pdf

专知会员服务

36+阅读 · 2020年4月1日

缺失数据统计分析，第三版，462页pdf

缺失数据统计分析，第三版，462页pdf

专知会员服务

113+阅读 · 2020年2月28日

微软研究院新版书籍《数据科学基础》（Foundations of Data Science），附479页PDF下载

微软研究院新版书籍《数据科学基础》（Foundations of Data Science），附479页PDF下载

专知会员服务

137+阅读 · 2019年10月26日

最新49页《深度学习异常检测综述》论文，带你全面了解深度学习异常检测方法

最新49页《深度学习异常检测综述》论文，带你全面了解深度学习异常检测方法

专知会员服务

218+阅读 · 2019年10月18日

热门VIP内容

开通专知VIP会员享更多权益服务

综述 | 世界动作模型：少做梦，多行动

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

美以伊冲突：无人机与人工智能的运用

相关资讯

【干货书】数据科学手册，456页pdf

【干货书】数据科学手册，456页pdf

专知

15+阅读 · 2021年4月28日

缺失数据统计分析，第三版，462页pdf

缺失数据统计分析，第三版，462页pdf

专知

50+阅读 · 2020年2月28日

微软研究院新版书籍《数据科学基础》，附479页PDF下载

微软研究院新版书籍《数据科学基础》，附479页PDF下载

专知

47+阅读 · 2019年9月20日

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

AI100

14+阅读 · 2019年9月1日

一文教你如何处理不平衡数据集（附代码）

一文教你如何处理不平衡数据集（附代码）

大数据文摘

12+阅读 · 2019年6月2日

20个安全可靠的免费数据源，各领域数据任你挑

20个安全可靠的免费数据源，各领域数据任你挑

机器学习算法与Python学习

14+阅读 · 2019年5月9日

最新49页《深度学习异常检测综述》论文，带你全面了解深度学习异常检测方法

最新49页《深度学习异常检测综述》论文，带你全面了解深度学习异常检测方法

专知

137+阅读 · 2019年1月14日

最全数据科学学习资源：Python、线性代数、机器学习...

最全数据科学学习资源：Python、线性代数、机器学习...

人工智能头条

12+阅读 · 2018年5月14日

不要担心没数据！史上最全数据集网站汇总

不要担心没数据！史上最全数据集网站汇总

数盟

14+阅读 · 2018年4月18日

关于数据挖掘，有几本书推荐给你......

关于数据挖掘，有几本书推荐给你......

图灵教育

16+阅读 · 2017年10月11日

相关论文

Existence and Constructions of Strict Function-Correcting Codes with Data Protection

Arxiv

0+阅读 · 4月29日

An Interdisciplinary and Cross-Task Review on Missing Data Imputation

Arxiv

0+阅读 · 4月24日

Confidence envelopes for the false discoveries with heterogeneous data

Arxiv

0+阅读 · 4月21日

Is this chart lying to me? Automating the detection of misleading visualizations

Arxiv

0+阅读 · 4月17日

COBOLAssist: Analyzing and Fixing Compilation Errors for LLM-Powered COBOL Code Generation

Arxiv

0+阅读 · 4月5日

Toward Scalable Automated Repository-Level Datasets for Software Vulnerability Detection

Arxiv

0+阅读 · 3月18日

Learning Over Dirty Data with Minimal Repairs

Arxiv

0+阅读 · 3月18日

Query-Guided Analysis and Mitigation of Data Verification Errors (Extended Version)

Arxiv

0+阅读 · 3月9日

ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement

Arxiv

0+阅读 · 3月4日

Detecting Logic Bugs of Join Optimizations in DBMS

Arxiv

0+阅读 · 2月25日

相关基金

近似计算中基于概率图模型的软错误量化方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

数据驱动关键性能指标相关的故障诊断方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

含非正态及缺失数据的结构方程模型分析

国家自然科学基金

0+阅读 · 2015年12月31日

传感器故障下的数据驱动容错控制技术及其应用

国家自然科学基金

3+阅读 · 2015年12月31日

面向Bug报告的软件故障重现方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

多重排序数据的整合分析

国家自然科学基金

0+阅读 · 2015年12月31日

基于云计算平台的下一代测序数据错误修正算法研究与实现

国家自然科学基金

2+阅读 · 2015年12月31日

基于WEB信息的信息错误自动检测与修复技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

测量误差数据下约束线性模型的有偏估计及变量选择研究

国家自然科学基金

0+阅读 · 2014年12月31日

高维混合数据异常知识发现的粒计算模型关键问题研究

国家自然科学基金

1+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员