综述 | 动态异质图表示学习:方法谱系、数据集与未来方向

论文首页与摘要。本文系统梳理动态异质图表示学习,关注如何同时建模多类型实体关系与随时间演化的网络结构。

导读

现实世界中的图很少是静态、同质和整齐的。社交网络里有用户、帖子、话题和互动;推荐系统里有用户、商品、行为和时间序列;交通、金融、网络安全和学术网络也同时包含多类型节点、多类型边和不断变化的交互关系。动态异质图正是为这类复杂系统提供建模框架:既保留异质语义,又追踪时间演化。 这篇综述《Dynamic Heterogeneous Graph Representation Learning: A Survey》聚焦动态异质图表示学习,试图填补一个长期缺口:过去已有动态图综述、异质图综述和图基础模型综述,但专门围绕“动态性与异质性如何耦合”的系统梳理仍然不足。论文首先给出统一形式化定义,覆盖离散时间与连续时间两类动态异质图;随后提出以算法为中心的分类体系,将现有方法组织为嵌入式、图神经网络式、Transformer 式和应用导向四类;最后整理常用开源数据集与基准,并讨论效率、泛化性和可信性三条未来方向。 这篇文章适合关注图表示学习、时序图、异质图、推荐系统、网络安全、交通预测、多模态学习和图基础模型的读者。它的核心信息很清晰:动态异质图不是把“动态模型”和“异质模型”简单拼起来,而是要在时间粒度、关系语义、结构演化和计算效率之间做联合设计。

Introduction | 引言

为什么需要动态异质图

图表示学习已经成为建模复杂网络的基础范式。通过把节点、边和关系映射到低维向量空间,模型可以支持节点分类、链路预测、关系预测、聚类、推荐和风险检测等任务。然而,现实系统中的图结构往往同时具有两个特征:一是异质性,即节点和边有不同类型与语义;二是动态性,即关系和结构随时间不断变化。 论文指出,这两个特征并不是相互独立的。不同类型的实体可能以不同节奏演化,不同关系也可能呈现突发、周期性或长期累积效应。比如学术网络中作者、论文、会议之间的关系会随发表周期变化;推荐系统中用户兴趣、商品热度和购买行为具有明显时间模式;网络安全场景中攻击者、设备、事件之间的联系可能突然变化。若只建模异质性而忽略时间,模型会丢失演化规律;若只建模动态性而忽略类型,模型又会混淆不同语义关系。 现有研究面临四个主要挑战。第一,异质语义与时间动态高度耦合,简单串接异质图模型和序列模型难以捕捉关系特定的演化行为。第二,多类型交互具有不同时间模式,统一同质建模无法同时刻画突发变化、周期变化和长期积累。第三,离散时间图和连续时间图对应不同粒度,前者适合粗粒度快照,后者适合异步事件流。第四,显式建模多关系、多时间和多类型参数会带来高计算开销,限制大规模图学习。 本文的贡献是提出第一个面向动态异质图表示学习的系统综述:给出统一定义,建立算法中心分类,分析代表方法的建模偏置,并总结应用、数据集和未来研究方向。

Preliminaries and Notations | 预备知识与符号

统一定义

动态异质图可以理解为随时间变化的多类型图。它包含节点类型、边类型、时间信息和属性特征,并在不同时间粒度下呈现不同形式。离散时间动态异质图通常由一系列图快照组成,每个快照描述某一时间段内的结构与关系;连续时间动态异质图则把交互看作带时间戳的事件流,更适合表达异步、局部、快速发生的关系变化。 论文强调,时间粒度不是细节问题,而是模型选择的关键。快照方法便于捕捉全局演化,但可能掩盖事件级细节;连续时间方法能够追踪精确交互,却需要处理长事件序列和更高计算成本。一个好的表示学习方法,需要根据任务需要决定保留哪种粒度,并避免把时间噪声误当成结构规律。

任务与评价

动态异质图表示通常用于节点分类、链路预测、时间链路预测、关系预测、节点回归和聚类等任务。不同任务关注的信息不同:节点分类更依赖节点语义和局部邻域,时间链路预测更依赖事件顺序与关系演化,推荐和扩散预测则需要同时建模长期偏好与短期变化。 因此,论文后续分类并不只按模型名称划分,而是特别关注每类方法对时间粒度、关系类型和结构归纳偏置的处理方式。

DHG Representation Learning Taxonomy | 动态异质图表示学习分类

总体框架

论文提出一个算法中心分类,将动态异质图表示学习方法分为四类:嵌入式方法、图神经网络式方法、Transformer 式方法和应用导向方法。前三类主要对应建模机制,第四类则按实际应用场景组织相关工作。 动态异质图表示学习分类框架。论文从嵌入式、图神经网络式、Transformer 式和应用导向四个层面组织代表方法。

嵌入式方法

嵌入式方法是较早的一类路线,目标是在保留结构接近性和异质语义的同时,让表示随时间更新。论文进一步将其分为随机游走式、增量更新式和时间点过程式。 随机游走式方法通常依赖元路径或关系特定路径,在动态网络中捕捉共现和可达性模式。它们适合保留局部结构与语义路径,但对复杂属性、高阶结构和任务监督信号的利用有限。增量更新式方法不每次重新训练整张图,而是根据局部扰动更新节点表示,具有较好的效率优势;但它们往往依赖平滑演化假设,对突然结构变化或长时间跨度累积误差较敏感。时间点过程式方法把动态异质图看作异步事件流,用条件强度函数刻画特定关系事件发生的概率,适合连续时间场景,但模型复杂度和采样成本更高。

图神经网络式方法

图神经网络式方法把消息传递扩展到动态异质图中,通过关系特定聚合、元结构约束或循环单元同时建模空间结构与时间演化。关系特定方法会为不同边类型或元关系设计不同传播机制,以保留类型语义;元结构引导方法借助元路径、元图或高阶语义模式约束信息传播;循环式方法则将图聚合与时间状态更新结合,捕捉跨快照演化。 这类方法的优势是表达能力强,能够整合属性、邻域、关系和时间信息。但问题也很明显:关系类型越多,参数与消息传递成本越高;快照越密,时间建模越重;若元路径或元结构预定义不充分,模型可能遗漏关键语义。

基于变换器的方法

Transformer 式方法是近年的重点方向。论文将其分为结构导向、交互导向和大模型增强三类。结构导向方法主要把注意力机制用于异质邻域和关系结构,结合关系类型编码、时间编码或元关系参数;交互导向方法则把节点历史交互视为时间序列,用自注意力捕捉事件级动态;大模型增强方法进一步引入语言模型语义或统一注意力机制,尝试增强跨类型、跨时间的表示能力。 Transformer 的优势是能统一处理长距离依赖、异质关系和时间顺序,适合复杂动态场景。但它也面临可扩展性瓶颈:对全邻域、多关系和长事件序列做注意力计算会带来高显存和高时间复杂度。论文因此强调,未来动态异质图 Transformer 需要更高效的稀疏化、线性注意力或事件压缩机制。 动态异质图表示学习方法对比。表格从类别、方法、时间粒度、核心技术、任务和代码可用性等角度整理代表工作。

面向应用的方法

应用导向方法说明动态异质图为何重要。网络安全中,模型需要追踪设备、用户、进程和攻击事件的异质关系,以发现异常和内部威胁。交通预测中,路网、站点、车辆、区域和时间之间存在复杂依赖,需要同时建模空间异质性与时间波动。推荐系统中,用户、商品、行为和上下文共同演化,动态异质图可以捕捉短期兴趣与长期偏好。 多模态学习和信息扩散也是重要场景。前者需要把图像、文本、三维对象、情感或行为信号组织成随时间变化的跨模态图;后者关注引用、舆情、金融 contagion 或社会影响如何在不同类型主体之间传播。论文认为,这些应用的共同难题是不同类型实体具有不同时间尺度,统一建模扩散过程仍然开放。

Open-source Datasets and Benchmarks | 开源数据集与基准

数据集现状

论文整理了常用开源动态异质图数据集,覆盖学术网络、评论平台、社交网络、疫情传播、推荐系统和软件生态等领域。表中记录了节点类型数、关系类型数、时间快照或时间戳数量、是否有节点标签以及数据链接。常见数据集包括 DBLP、AMiner、Yelp、Twitter、COVID、Movielens、Ecomm、MAG、Alibaba、Math-Overflow,以及 TGB 2.0 中的软件、论坛、GitHub 和 Myket 数据。 开源动态异质图数据集与基准。论文按领域、数据集、类型数量、时间规模和标签可用性整理常用资源。

基准可比性问题

虽然许多研究使用相同公开来源,但图构建规则、时间离散方式和评估协议经常不同,导致结果难以复现和横向比较。论文特别提到,TGB 2.0 通过统一预处理和评估管线,为动态异质图基准化提供了更一致的基础。不过,当前基准仍主要集中在链路预测,覆盖任务和基线方法相对有限。 另一个问题是固定划分评估可能过于乐观。若只在最后一个时间段的边上测试,模型未必真正捕捉了动态异质图的长期演化。未来需要更丰富的任务覆盖、增量学习协议和标准化评估管线,才能准确衡量模型在真实动态环境中的表现。

Conclusion and Future Directions | 结论与未来方向

三条未来主线

论文最后总结,动态异质图表示学习仍面临三类关键挑战:效率、泛化性和可信性。 效率方面,许多方法显式耦合消息传递与时间聚合,复杂度较高,难以扩展到网络规模图。虽然事件分块、增量传播和局部更新可以缓解部分成本,但表达能力与效率之间的张力仍未解决。未来需要探索线性注意力、核近似、图稀疏化和面向动态异质图的可扩展训练机制,并进一步研究该领域的规模规律。 泛化性方面,当前方法多依赖任务特定监督训练,尚未形成类似视觉或语言基础模型的迁移能力。未来值得发展面向动态异质图的预训练目标、自监督任务、少样本适配、持续学习和跨领域迁移机制,使模型能在不同图模式、不同时间分布和不同关系模式之间复用知识。 可信性方面,动态异质图模型越来越可能用于网络安全、金融、医疗、交通等高风险场景,但现有解释方法多停留在事后子图识别,缺少忠实性保证和因果扎根。未来需要更可解释的架构,例如注意力瓶颈、人类可理解概念层,以及结构因果模型与图学习的结合,从而区分真实因果关系和虚假相关。

结语

这篇综述的关键贡献,是把动态异质图表示学习从分散方法整理为一个清晰谱系:嵌入式方法强调结构近似与高效更新,图神经网络式方法强调关系感知消息传递,Transformer 式方法强调长程依赖与事件序列建模,应用导向方法则展示了这一范式在安全、交通、推荐、多模态和信息扩散中的实际价值。 更重要的是,论文提醒我们:动态异质图的核心难点不只是“图会变”或“图有多种类型”,而是不同类型实体、关系和事件以不同时间尺度共同演化。下一阶段的突破,很可能来自更统一的时间粒度建模、更可扩展的注意力与消息传递、更强的预训练迁移能力,以及面向高风险应用的可解释和因果可信机制。

成为VIP会员查看完整内容
0

相关内容

【LoG2024】异质图学习进展
专知会员服务
25+阅读 · 2024年11月30日
多模态知识图谱表示学习综述
专知会员服务
72+阅读 · 2024年7月4日
异质图学习:进展和未来
专知会员服务
48+阅读 · 2024年1月19日
专知会员服务
38+阅读 · 2021年8月2日
专知会员服务
39+阅读 · 2020年6月7日
华为分享 异质图表示学习(异质图神经网络)
图与推荐
14+阅读 · 2020年9月10日
综述 | 异质信息网络分析与应用综述
专知
27+阅读 · 2020年8月8日
深度多模态表示学习综述论文,22页pdf
专知
33+阅读 · 2020年6月21日
网络表示学习概述
机器学习与推荐算法
20+阅读 · 2020年3月27日
图数据表示学习综述论文
专知
52+阅读 · 2019年6月10日
综述 | 知识图谱向量化表示
PaperWeekly
19+阅读 · 2017年10月25日
国家自然科学基金
1+阅读 · 2016年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
4+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
12+阅读 · 2015年12月31日
国家自然科学基金
16+阅读 · 2013年12月31日
Arxiv
11+阅读 · 2023年5月15日
Arxiv
58+阅读 · 2021年5月3日
VIP会员
最新内容
机器的崛起:美海军陆战队组建机器人营思考
专知会员服务
2+阅读 · 今天15:44
无面之战:人工智能如何重绘权力版图
专知会员服务
1+阅读 · 今天15:25
《最强大的军事网状网络》
专知会员服务
8+阅读 · 9月7日
《预测陆军征兵任务分配》110页
专知会员服务
7+阅读 · 9月7日
相关VIP内容
相关资讯
华为分享 异质图表示学习(异质图神经网络)
图与推荐
14+阅读 · 2020年9月10日
综述 | 异质信息网络分析与应用综述
专知
27+阅读 · 2020年8月8日
深度多模态表示学习综述论文,22页pdf
专知
33+阅读 · 2020年6月21日
网络表示学习概述
机器学习与推荐算法
20+阅读 · 2020年3月27日
图数据表示学习综述论文
专知
52+阅读 · 2019年6月10日
综述 | 知识图谱向量化表示
PaperWeekly
19+阅读 · 2017年10月25日
相关基金
国家自然科学基金
1+阅读 · 2016年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
4+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
12+阅读 · 2015年12月31日
国家自然科学基金
16+阅读 · 2013年12月31日
微信扫码咨询专知VIP会员