关于《Heterogeneous Graph Transformer》一文的学习

一.摘要

       随着图神经网络(GNNs)在结构化数据建模中的广泛应用,传统同构 GNN 因无法处理节点和边类型多样的异构图而受限。本文围绕 2020 年 WWW 会议提出的异构图 Transformer 展开学习系统分析其针对异构图三大核心挑战 ——异质性建模、动态性捕捉、大规模训练的创新解决方案。HGT 通过 “元关系驱动的参数化” 实现异构特征区分,基于相对时间编码RTE捕捉动态依赖,结合异构子图采样HGSampling支持 Web 级数据训练。在包含 1.79 亿节点、20 亿边的OAG上的实验表明,HGT 在论文领域预测、期刊预测、作者消歧等任务上,较现有 SOTA GNN 基线提升 9%-21%,为大规模异构图表示学习提供了高效范式。

二.引言

2.1研究背景

       图结构是现实世界复杂系统的重要抽象,而异构图(Heterogeneous Graph)因包含多种类型的节点与边(如学术图中的 “论文 - 作者 - 机构” 关系、社交图中的 “用户 - 内容 - 标签” 关系),比同构图更贴近实际场景。例如:Open Academic Graph(OAG):包含 5 类节点(论文、作者、机构、期刊、领域)和多类边(作者署名、论文引用、期刊发表等),节点规模超 17 亿,时间跨度从 1900 年至 2019 年。传统 GNN(如 GCN、GAT)假设所有节点 / 边共享同一特征空间,无法适配异构图的类型差异;现有异构 GNN(如 RGCN、HAN)则存在依赖人工设计元路径、忽略动态性、难以处理大规模数据等缺陷。因此,设计一种能自适应建模异质性、动态性且支持 Web 级训练的 GNN 架构,成为亟待解决的问题。

2.2HGT的核心目标

       HGT 旨在解决现有方法的四大局限,实现以下目标:无需人工设计元路径,自动学习异构结构的 “软元路径”;为不同类型节点 / 边维护专属表示空间,同时支持跨类型信息交互;捕捉异构图的动态演化(如学术会议主题变迁);高效处理 Web 级异构图数据,支持千亿级边的训练。

三.相关背景与问题提出

3.1基础概念定义

3.2现有方法的局限性

四.HGT模型核心设计

         HGT 的核心思想是以元关系为中心,将注意力机制、消息传递、时间编码与采样策略深度耦合,实现 “异构感知、动态捕捉、高效训练”。模型整体架构如图 1 所示,分为三大模块:异构交互层(注意力 + 消息传递 + 聚合)、相对时间编码(RTE)、异构采样(HGSampling)。

4.1整体架构

4.2异构互注意力机制

解决 “如何区分不同元关系的重要性” 问题,核心是基于元关系分解权重矩阵,实现 “参数共享 + 类型特异性” 平衡。

多头注意力设计:对每条边计算 h 个注意力头并拼接,公式如下:

优势:与 GAT(单一权重矩阵)、RGCN(每个关系独立权重)相比,HGT 通过 “源类型 + 边类型 + 目标类型” 的参数分解:避免参数爆炸(如 “第一作者” 与 “第二作者” 共享 “作者→论文” 的节点投影权重);精准捕捉异构语义(如 “论文引用” 与 “作者署名” 的边交互矩阵不同)。

4.3异构消息传递

4.4目标特异性聚合

将注意力加权后的消息聚合到目标节点,并映射回目标类型的特征空间:

加权聚合:利用注意力权重对消息加权求和,得到临时表示:

类型适配与残差连接:通过目标节点类型的线性投影适配分布,并加入残差连接缓解梯度消失:

4.5相对时间编码:捕捉动态性

       传统动态 GNN 通过 “时间切片” 划分图,易丢失跨时间依赖;HGT 的 RTE 直接建模节点间的相对时间差,支持任意时长的动态依赖:

基础编码:采用正弦函数作为时间编码基,确保对未见过的时间差的泛化性:

线性适配:通过可学习的线性层调整编码,融入节点表示:

4.6HGSampling:Web 级训练的关键

现有同构采样(如 GraphSAGE)易导致异构图采样失衡(如 “论文” 节点过多,“机构” 节点过少)。HGSampling 通过 “分类型预算 + 重要性采样” 解决该问题:

(1)核心策略:

分类型节点预算:为每种节点类型 \(\tau\) 分配独立采样预算 \(B[\tau]\),确保采样后各类型节点比例均衡;

重要性采样:基于节点的 “归一化度累积值” 计算采样概率(概率与累积值平方成正比),避免高 degree 节点主导采样,同时保持子图密度(减少信息丢失)。

(2)算法步骤

1.以目标节点集(如待预测领域的论文)为初始采样集;

2.对每个已采样节点,将其邻居按类型加入对应预算,并累积归一化度;

3.按预算和重要性采样概率,迭代采样 L 层邻居;

4.重构采样子图的邻接矩阵,用于 Mini-Batch 训练。

(3)归纳式时间戳分配

       对无固定时间戳的 “普通节点”(如会议),通过其关联的 “事件节点”(如会议发表的论文)继承时间戳(如 “WWW@2020” 继承该年发表论文的时间),确保动态建模的完整性。

五.实验验证

5.1实验设置

5.1.1数据集

OAG:17.87 亿节点,223.6 亿边,时间跨度 1900-2019;

CS/Med 子图:从 OAG 中提取的计算机科学(1.17 亿节点)、医学(5.1 亿节点)领域子图,验证模型泛化性。

5.1.2下游任务与评价指标

Paper-Field 预测:预测论文所属的 L1/L2 层级领域;

Paper-Venue 预测:预测论文发表的期刊 / 会议;

作者消歧:对同名作者,预测其与论文的关联(链接预测)。

评价指标:采用排序任务常用指标 NDCG(归一化折损累积增益)和 MRR(平均 reciprocal 排名)。

5.1.3基线模型

同构 GNN:GCN、GAT;

异构 GNN:RGCN(按关系设权重)、HetGNN(按节点类型设 RNN)、HAN(元路径注意力)。

5.2核心实验结果

5.2.1性能对比

HGT 在所有任务和数据集上均显著优于基线,以 OAG 的 Paper-Field(L1)任务为例:

NDCG:HGT(0.615)较 HAN(0.544)提升 13%,较 GAT(0.534)提升 15%;

MRR:HGT(0.702)较 HAN(0.622)提升 13%,较 RGCN(0.616)提升 14%。

整体来看,HGT 较现有 SOTA 平均提升 9%-21%,且参数规模更小(如 HGT 参数 8.2M,小于 RGCN 的 8.8M、HAN 的 9.45M)。

5.2.2消融实验

      为验证核心组件的有效性,实验设计两类消融模型:HGT-RTE(移除相对时间编码)和 HGT-Heter(移除异构权重参数化)。以 CS 子图的 Paper-Field(L₁)任务为例,HGT-RTE 的 NDCG 值从 0.823 降至 0.799,性能下降 2.9%;HGT-Heter 的 NDCG 值降至 0.779,性能下降 5.3%,表明异构权重参数化对模型性能的影响更显著,而相对时间编码能有效捕捉动态依赖。

六.结论与展望

6.1研究结论

       HGT 通过三大核心创新,有效解决异构图建模的关键问题:一是基于元关系的异构互注意力,实现参数高效共享与类型特异性的平衡;二是相对时间编码,无需时间切片即可捕捉任意时长的动态依赖;三是 HGSampling 算法,解决异构图采样失衡问题,支持 Web 级数据训练。在 OAG 等大规模数据集上的实验证明,HGT 在节点分类、链接预测等下游任务中表现优异,且具备高效性与可扩展性。

6.2未来展望

异构图生成:探索基于 HGT 预测新节点(如未来发表的论文)及其特征(如论文标题),拓展模型在生成式任务中的应用。

预训练范式:在大规模异构图上对 HGT 进行预训练,为小样本、低资源场景的异构图任务提供通用表示,提升模型泛化能力。

跨领域扩展:将 HGT 应用于社交网络、推荐系统、生物医药等领域的异构图场景,验证模型在不同领域的适应性与有效性。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值