Unified representation learning for multi-source data integration faces two important challenges: blockwise missingness and blockwise signal heterogeneity. The former arises from sources observing different, yet potentially overlapping, feature sets, while the latter involves varying signal strengths across subject groups and feature sets. While existing methods perform well with fully observed data or uniform signal strength, their performance degenerates when these two challenges coincide, which is common in practice. To address this, we propose Anchor Projected Principal Component Analysis (APPCA), a general framework for representation learning with structured blockwise missingness that is robust to signal heterogeneity. APPCA first recovers robust group-specific column spaces using all observed feature sets, and then aligns them by projecting shared "anchor" features onto these subspaces before performing PCA. This projection step induces a significant denoising effect. We establish estimation error bounds for embedding reconstruction through a fine-grained perturbation analysis. In particular, using a novel spectral slicing technique, our bound eliminates the standard dependency on the signal strength of subject embeddings, relying instead solely on the signal strength of integrated feature sets. We validate the proposed method through extensive simulation studies and an application to multimodal single-cell sequencing data.


翻译:多源数据整合的统一表示学习面临两大挑战:块缺失与块信号异质性。前者源于不同数据源观测到可能重叠但非完全一致的特征集合,后者则涉及不同样本组与特征集合间信号强度的差异。现有方法在数据完全可观测或信号强度均匀时表现良好,但当这两种挑战同时出现时——这在实践中十分常见——其性能会显著下降。为解决这一问题,我们提出锚点投影主成分分析(APPCA),这是一个针对结构化块缺失的表示学习通用框架,对信号异质性具有鲁棒性。APPCA首先利用所有可观测特征集合恢复鲁棒的组特异性列空间,然后通过将共享的“锚点”特征投影到这些子空间中进行对齐,最后执行PCA。该投影步骤能产生显著的降噪效果。我们通过细粒度扰动分析建立了嵌入重构的估计误差界。特别地,借助新颖的谱切片技术,我们的误差界消除了传统方法对样本嵌入信号强度的依赖,转而仅依赖于整合后特征集合的信号强度。我们通过大量模拟研究及在多模态单细胞测序数据上的应用验证了所提方法的有效性。

0
下载
关闭预览

相关内容

【剑桥大学博士论文】基于注意力的图表示学习
专知会员服务
25+阅读 · 2025年11月3日
【MIT博士论文】异构医疗数据表示学习,193页pdf
专知会员服务
60+阅读 · 2022年9月3日
【ICML2022】几何多模态对比表示学习
专知会员服务
45+阅读 · 2022年7月17日
【AAAI2022】不确定性感知的多视角表示学习
专知会员服务
47+阅读 · 2022年1月25日
专知会员服务
38+阅读 · 2021年8月2日
异质信息网络分析与应用综述,软件学报-北京邮电大学
【国防科大】复杂异构数据的表征学习综述
专知会员服务
85+阅读 · 2020年4月23日
多模态视觉语言表征学习研究综述
专知
27+阅读 · 2020年12月3日
华为分享 异质图表示学习(异质图神经网络)
图与推荐
14+阅读 · 2020年9月10日
综述 | 异质信息网络分析与应用综述
专知
27+阅读 · 2020年8月8日
深度多模态表示学习综述论文,22页pdf
专知
33+阅读 · 2020年6月21日
「PPT」深度学习中的不确定性估计
专知
27+阅读 · 2019年7月20日
使用 Canal 实现数据异构
性能与架构
20+阅读 · 2019年3月4日
KDD 18 & AAAI 19 | 异构信息网络表示学习论文解读
PaperWeekly
21+阅读 · 2019年2月25日
网络表示学习介绍
人工智能前沿讲习班
18+阅读 · 2018年11月26日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
16+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
12+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2014年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
VIP会员
相关VIP内容
【剑桥大学博士论文】基于注意力的图表示学习
专知会员服务
25+阅读 · 2025年11月3日
【MIT博士论文】异构医疗数据表示学习,193页pdf
专知会员服务
60+阅读 · 2022年9月3日
【ICML2022】几何多模态对比表示学习
专知会员服务
45+阅读 · 2022年7月17日
【AAAI2022】不确定性感知的多视角表示学习
专知会员服务
47+阅读 · 2022年1月25日
专知会员服务
38+阅读 · 2021年8月2日
异质信息网络分析与应用综述,软件学报-北京邮电大学
【国防科大】复杂异构数据的表征学习综述
专知会员服务
85+阅读 · 2020年4月23日
相关资讯
相关基金
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
16+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
12+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2014年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
Top
微信扫码咨询专知VIP会员