Redundancy-Driven Top-$k$ Functional Dependency Discovery - 专知论文

会员服务 ·

0

函数依赖 · 冗余 · 属性 · 划分 · 算法 ·

Redundancy-Driven Top-$k$ Functional Dependency Discovery

翻译：基于冗余驱动的Top-$k$函数依赖发现

Xiaolong Wan,Xixian Han

Functional dependencies (FDs) are basic constraints in relational databases and are used for many data management tasks. Most FD discovery algorithms find all valid dependencies, but this causes two problems. First, the computational cost is prohibitive: computational complexity grows quadratically with the number of tuples and exponentially with the number of attributes, making discovery slow on large-scale and high-dimensional data. Second, the result set can be huge, making it hard to identify useful dependencies. We propose SDP (Selective-Discovery-and-Prune), which discovers the top-$k$ FDs ranked by redundancy count. Redundancy count measures how much duplicated information an FD explains and connects directly to storage overhead and update anomalies. SDP uses an upper bound on redundancy to prune the search space. It is proved that this upper bound is monotone: adding attributes refines partitions and thus decreases the bound. Once the bound falls below the top-$k$ threshold, the entire branch can be skipped. We improve SDP with three optimizations: ordering attributes by partition cardinality, using pairwise statistics in a Partition Cardinality Matrix to tighten bounds, and a global scheduler to explore promising branches first. Experiments on over 40 datasets show that SDP is much faster and uses less memory than exhaustive methods.

翻译：函数依赖是关系数据库中的基本约束，被用于许多数据管理任务。大多数函数依赖发现算法会找出所有有效的依赖，但这会导致两个问题。首先，计算成本过高：计算复杂度随元组数量呈二次增长，随属性数量呈指数增长，使得在大规模和高维数据上的发现过程缓慢。其次，结果集可能非常庞大，难以识别出有用的依赖。我们提出了SDP（选择性发现与剪枝）算法，该算法发现按冗余计数排序的Top-$k$函数依赖。冗余计数衡量了一个函数依赖所解释的重复信息量，并直接关联到存储开销和更新异常。SDP利用冗余的上界来剪枝搜索空间。我们证明了该上界是单调的：增加属性会细化划分，从而降低该上界。一旦该上界低于Top-$k$阈值，整个分支即可被跳过。我们通过三项优化改进了SDP：按划分基数对属性排序、在划分基数矩阵中使用成对统计以收紧上界，以及使用全局调度器优先探索有希望的分支。在超过40个数据集上的实验表明，SDP比穷举方法快得多，且内存使用更少。

0

相关内容

函数依赖

基于因果推断的推荐系统去偏研究

基于因果推断的推荐系统去偏研究

专知会员服务

21+阅读 · 2024年11月10日

【博士论文】深度神经网络的元学习损失函数，184页pdf

【博士论文】深度神经网络的元学习损失函数，184页pdf

专知会员服务

22+阅读 · 2024年6月17日

【MIT博士论文】鲁棒几何感知的数据关联算法与表示，176页pdf

【MIT博士论文】鲁棒几何感知的数据关联算法与表示，176页pdf

专知会员服务

31+阅读 · 2024年2月3日

西安交大最新《深度学习因果模型》综述论文，35页pdf涵盖292篇文献阐述三种数据范式因果模型

西安交大最新《深度学习因果模型》综述论文，35页pdf涵盖292篇文献阐述三种数据范式因果模型

专知会员服务

63+阅读 · 2023年11月5日

【KDD2023】发现动态因果空间进行DAG结构学习

【KDD2023】发现动态因果空间进行DAG结构学习

专知会员服务

33+阅读 · 2023年6月9日

【剑桥大学博士论文】具有关系结构的元学习表示，221页pdf

【剑桥大学博士论文】具有关系结构的元学习表示，221页pdf

专知会员服务

42+阅读 · 2023年2月21日

【牛津大学博士论文】关系数据的学习和推理，243页pdf

【牛津大学博士论文】关系数据的学习和推理，243页pdf

专知会员服务

54+阅读 · 2022年11月16日

【牛津大学博士论文】深度学习数据驱动发现偏微分方程，160页pdf

【牛津大学博士论文】深度学习数据驱动发现偏微分方程，160页pdf

专知会员服务

63+阅读 · 2022年11月1日

西安交大最新《深度学习因果发现》综述论文，26页pdf涵盖211篇文献阐述三种深度因果范式

西安交大最新《深度学习因果发现》综述论文，26页pdf涵盖211篇文献阐述三种深度因果范式

专知会员服务

117+阅读 · 2022年9月15日

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

专知会员服务

75+阅读 · 2019年10月19日

推荐！《基于多智能体学习的任务分配动态邻域优化》2022最新41页综述论文，伦敦国王学院

推荐！《基于多智能体学习的任务分配动态邻域优化》2022最新41页综述论文，伦敦国王学院

专知

17+阅读 · 2022年11月15日

最新「因果推断Causal Inference」综述论文38页pdf，阿里巴巴、Buffalo、Georgia、Virginia

最新「因果推断Causal Inference」综述论文38页pdf，阿里巴巴、Buffalo、Georgia、Virginia

专知

68+阅读 · 2020年2月11日

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

AI100

14+阅读 · 2019年9月1日

一行TensorFlow/Keras代码解决真实场景中数据不平衡(imbalanced)问题

一行TensorFlow/Keras代码解决真实场景中数据不平衡(imbalanced)问题

专知

78+阅读 · 2019年5月31日

开发 | 谷歌对无监督解耦方法进行了大规模评估，还开源了用来实验的开发库！

开发 | 谷歌对无监督解耦方法进行了大规模评估，还开源了用来实验的开发库！

AI科技评论

10+阅读 · 2019年5月13日

图神经网络开发必备组件，NetworkX、稀疏矩阵、稀疏Tensor等

图神经网络开发必备组件，NetworkX、稀疏矩阵、稀疏Tensor等

专知

48+阅读 · 2019年5月10日

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

专知

26+阅读 · 2019年2月12日

机器学习的Pytorch实现资源集合

机器学习的Pytorch实现资源集合

专知

11+阅读 · 2018年9月1日

Spark机器学习：矩阵及推荐算法

Spark机器学习：矩阵及推荐算法

LibRec智能推荐

16+阅读 · 2017年8月3日

各种相似性度量及Python实现

各种相似性度量及Python实现

机器学习算法与Python学习

11+阅读 · 2017年7月6日

基于多源异构不确定数据的高效用信息挖掘的研究

国家自然科学基金

4+阅读 · 2015年12月31日

基于多目标优化的约束模式挖掘方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

数据驱动关键性能指标相关的故障诊断方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

函数数据变换模型及降维方法的研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于Spark的大图数据最优子模式匹配查询方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

大数据环境下稀有类数据挖掘研究

国家自然科学基金

3+阅读 · 2015年12月31日

具有耦合性结构的多视图社交网络社区发现算法研究及其应用

国家自然科学基金

0+阅读 · 2015年12月31日

面向长尾现象的数据缓存技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

关联规则集上的知识发现

国家自然科学基金

9+阅读 · 2015年12月31日

复杂多元数据的半参数统计推断

国家自然科学基金

5+阅读 · 2014年12月31日

Finding a Fair Scoring Function for Top-$k$ Selection: From Hardness to Practice

Arxiv

0+阅读 · 2月19日

Improved Search-to-Decision Reduction for Random Local Functions

Arxiv

0+阅读 · 2月17日

Nexus: Inferring Join Graphs from Metadata Alone via Iterative Low-Rank Matrix Completion

Arxiv

0+阅读 · 2月9日

Mining Generalizable Activation Functions

Arxiv

0+阅读 · 2月5日

Differentiable Constraint-Based Causal Discovery

Arxiv

0+阅读 · 2月5日

Provably Data-driven Multiple Hyper-parameter Tuning with Structured Loss Function

Arxiv

0+阅读 · 2月2日

Exact Graph Learning via Integer Programming

Arxiv

0+阅读 · 1月28日

EAIFD: A Fast and Scalable Algorithm for Incremental Functional Dependency Discovery

Arxiv

0+阅读 · 1月22日

Cluster-Dags as Powerful Background Knowledge For Causal Discovery

Arxiv

0+阅读 · 1月19日

A new measure of dependence: Integrated $R^2$

Arxiv

0+阅读 · 1月13日

VIP会员

文章信息

相关主题

最新内容

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

专知会员服务

2+阅读 · 6月23日

综述 | 世界动作模型：少做梦，多行动

综述 | 世界动作模型：少做梦，多行动

专知会员服务

4+阅读 · 6月23日

美以伊冲突：无人机与人工智能的运用

美以伊冲突：无人机与人工智能的运用

专知会员服务

7+阅读 · 6月23日

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

专知会员服务

3+阅读 · 6月23日

《特种部队在透明战场中的生存力》最新报告

《特种部队在透明战场中的生存力》最新报告

专知会员服务

4+阅读 · 6月23日

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

专知会员服务

6+阅读 · 6月23日

《人工智能生成的零日漏洞：对未来作战的影响》

《人工智能生成的零日漏洞：对未来作战的影响》

专知会员服务

5+阅读 · 6月23日

《理解伙伴国在防务能力选择中的偏好：探索美国解决方案的替代选择》美智库200页报告

《理解伙伴国在防务能力选择中的偏好：探索美国解决方案的替代选择》美智库200页报告

专知会员服务

3+阅读 · 6月23日

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

专知会员服务

6+阅读 · 6月22日

综述 | 3D场景图：开放挑战与未来方向

综述 | 3D场景图：开放挑战与未来方向

专知会员服务

8+阅读 · 6月22日

《国防工业6.0：全自主作战系统、量子-人工智能融合与新一代战略威慑》

《国防工业6.0：全自主作战系统、量子-人工智能融合与新一代战略威慑》

专知会员服务

8+阅读 · 6月22日

21世纪的无人机战争

21世纪的无人机战争

专知会员服务

4+阅读 · 6月22日

《伊朗与以色列-美国热战及其对数字技术的影响》

《伊朗与以色列-美国热战及其对数字技术的影响》

专知会员服务

6+阅读 · 6月22日

《量子技术的军事任务技术适配与利用》

《量子技术的军事任务技术适配与利用》

专知会员服务

5+阅读 · 6月22日

《美国陆军军官学校（西点军校）本科生科研中生成式人工智能的使用》

《美国陆军军官学校（西点军校）本科生科研中生成式人工智能的使用》

专知会员服务

9+阅读 · 6月22日

相关VIP内容

基于因果推断的推荐系统去偏研究

基于因果推断的推荐系统去偏研究

专知会员服务

21+阅读 · 2024年11月10日

【博士论文】深度神经网络的元学习损失函数，184页pdf

【博士论文】深度神经网络的元学习损失函数，184页pdf

专知会员服务

22+阅读 · 2024年6月17日

【MIT博士论文】鲁棒几何感知的数据关联算法与表示，176页pdf

【MIT博士论文】鲁棒几何感知的数据关联算法与表示，176页pdf

专知会员服务

31+阅读 · 2024年2月3日

西安交大最新《深度学习因果模型》综述论文，35页pdf涵盖292篇文献阐述三种数据范式因果模型

西安交大最新《深度学习因果模型》综述论文，35页pdf涵盖292篇文献阐述三种数据范式因果模型

专知会员服务

63+阅读 · 2023年11月5日

【KDD2023】发现动态因果空间进行DAG结构学习

【KDD2023】发现动态因果空间进行DAG结构学习

专知会员服务

33+阅读 · 2023年6月9日

【剑桥大学博士论文】具有关系结构的元学习表示，221页pdf

【剑桥大学博士论文】具有关系结构的元学习表示，221页pdf

专知会员服务

42+阅读 · 2023年2月21日

【牛津大学博士论文】关系数据的学习和推理，243页pdf

【牛津大学博士论文】关系数据的学习和推理，243页pdf

专知会员服务

54+阅读 · 2022年11月16日

【牛津大学博士论文】深度学习数据驱动发现偏微分方程，160页pdf

【牛津大学博士论文】深度学习数据驱动发现偏微分方程，160页pdf

专知会员服务

63+阅读 · 2022年11月1日

西安交大最新《深度学习因果发现》综述论文，26页pdf涵盖211篇文献阐述三种深度因果范式

西安交大最新《深度学习因果发现》综述论文，26页pdf涵盖211篇文献阐述三种深度因果范式

专知会员服务

117+阅读 · 2022年9月15日

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

专知会员服务

75+阅读 · 2019年10月19日

热门VIP内容

开通专知VIP会员享更多权益服务

综述 | 世界动作模型：少做梦，多行动

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

美以伊冲突：无人机与人工智能的运用

相关资讯

推荐！《基于多智能体学习的任务分配动态邻域优化》2022最新41页综述论文，伦敦国王学院

推荐！《基于多智能体学习的任务分配动态邻域优化》2022最新41页综述论文，伦敦国王学院

专知

17+阅读 · 2022年11月15日

最新「因果推断Causal Inference」综述论文38页pdf，阿里巴巴、Buffalo、Georgia、Virginia

最新「因果推断Causal Inference」综述论文38页pdf，阿里巴巴、Buffalo、Georgia、Virginia

专知

68+阅读 · 2020年2月11日

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

AI100

14+阅读 · 2019年9月1日

一行TensorFlow/Keras代码解决真实场景中数据不平衡(imbalanced)问题

一行TensorFlow/Keras代码解决真实场景中数据不平衡(imbalanced)问题

专知

78+阅读 · 2019年5月31日

开发 | 谷歌对无监督解耦方法进行了大规模评估，还开源了用来实验的开发库！

开发 | 谷歌对无监督解耦方法进行了大规模评估，还开源了用来实验的开发库！

AI科技评论

10+阅读 · 2019年5月13日

图神经网络开发必备组件，NetworkX、稀疏矩阵、稀疏Tensor等

图神经网络开发必备组件，NetworkX、稀疏矩阵、稀疏Tensor等

专知

48+阅读 · 2019年5月10日

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

WSDM 2019教程—李航、何向南等，深度学习匹配在搜索和推荐中的应用

专知

26+阅读 · 2019年2月12日

机器学习的Pytorch实现资源集合

机器学习的Pytorch实现资源集合

专知

11+阅读 · 2018年9月1日

Spark机器学习：矩阵及推荐算法

Spark机器学习：矩阵及推荐算法

LibRec智能推荐

16+阅读 · 2017年8月3日

各种相似性度量及Python实现

各种相似性度量及Python实现

机器学习算法与Python学习

11+阅读 · 2017年7月6日

相关论文

Finding a Fair Scoring Function for Top-$k$ Selection: From Hardness to Practice

Arxiv

0+阅读 · 2月19日

Improved Search-to-Decision Reduction for Random Local Functions

Arxiv

0+阅读 · 2月17日

Nexus: Inferring Join Graphs from Metadata Alone via Iterative Low-Rank Matrix Completion

Arxiv

0+阅读 · 2月9日

Mining Generalizable Activation Functions

Arxiv

0+阅读 · 2月5日

Differentiable Constraint-Based Causal Discovery

Arxiv

0+阅读 · 2月5日

Provably Data-driven Multiple Hyper-parameter Tuning with Structured Loss Function

Arxiv

0+阅读 · 2月2日

Exact Graph Learning via Integer Programming

Arxiv

0+阅读 · 1月28日

EAIFD: A Fast and Scalable Algorithm for Incremental Functional Dependency Discovery

Arxiv

0+阅读 · 1月22日

Cluster-Dags as Powerful Background Knowledge For Causal Discovery

Arxiv

0+阅读 · 1月19日

A new measure of dependence: Integrated $R^2$

Arxiv

0+阅读 · 1月13日

相关基金

基于多源异构不确定数据的高效用信息挖掘的研究

国家自然科学基金

4+阅读 · 2015年12月31日

基于多目标优化的约束模式挖掘方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

数据驱动关键性能指标相关的故障诊断方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

函数数据变换模型及降维方法的研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于Spark的大图数据最优子模式匹配查询方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

大数据环境下稀有类数据挖掘研究

国家自然科学基金

3+阅读 · 2015年12月31日

具有耦合性结构的多视图社交网络社区发现算法研究及其应用

国家自然科学基金

0+阅读 · 2015年12月31日

面向长尾现象的数据缓存技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

关联规则集上的知识发现

国家自然科学基金

9+阅读 · 2015年12月31日

复杂多元数据的半参数统计推断

国家自然科学基金

5+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员