02vault树模型知识图谱More基于图卷积网络的关系数据建模

基于图卷积网络的关系数据建模 (R-GCN)

基本信息

项目内容
作者Michael Schlichtkrull, Thomas N. Kipf, Peter Bloem, Rianne van den Berg, Ivan Titov, Max Welling
年份2018 (ESWC 2018)
来源Extended Semantic Web Conference (ESWC 2018), LNCS 10843, pp. 593-607 / arXiv:1703.06103
主题多关系图卷积神经网络与知识库补全 (Relational Graph Convolutional Networks for Multi-Relational Data)
链接Fulltext Markdown · Zotero 条目 · Zotero PDF · DOI: 10.48550/arXiv.1703.06103

一句话摘要

针对标准 GCN 仅能处理同质单关系图的局限,本文提出 R-GCN 模型,通过为每类有向关系分配独立变换矩阵并结合基底分解与块对角分解控制参数爆炸,构建了可端到端聚合多跳关系路径特征的编码器架构,在实体分类及 FB15k-237 链接预测上取得高达 29.8% 的大幅突破。

研究对象

  • 研究对象:现实世界中高度不完整的多关系有向图(Directed Labeled Multigraphs)与知识库,形式化表示为包含主语-谓词-宾语的三元组集合 (s,r,o)∈E(s, r, o) \in \mathcal{E},其中节点为实体 vi∈Vv_i \in \mathcal{V},带标签的有向边代表具体关系类型 r∈Rr \in \mathcal{R}。
  • 核心问题:
    1. 真实知识图谱通常拥有数十至数千种不同语义的关系,直接为每个关系训练全尺寸转换矩阵会导致参数量随关系数线性暴增,稀疏长尾关系极易严重过拟合;
    2. 传统的张量分解模型(如 DistMult、ComplEx)仅作为浅层“解码器”独立对单条三元组进行局部内积打分,无法在图谱的多跳邻域中有效积累结构化证据(Accumulate evidence over multiple inference steps)。
  • 研究情境/范围:统计关系学习的两大基础任务——实体分类(Entity Classification,推断未知实体的属性与类型)与链接预测(Link Prediction,推断缺失的关系边),并在消除捷径泄漏的硬核数据集 FB15k-237 上进行深度检验。

研究方法

方法概述

  • 方法类型:深度图神经网络架构创新 + 矩阵张量低秩正则化 + 编码器-解码器自编码框架。
  • 总体思路:
    1. 关系特定传播规则:将 GCN 的无向邻域聚合推广至带类型有向图,每个关系 rr 具有独立的聚合投影矩阵 Wr(l)W_r^{(l)},同时引入专用自环变换矩阵 W0(l)W_0^{(l)};
    2. 关系权重参数化约束:设计两种结构化分解机制以控制参数量:(a)基底分解(Basis-decomposition),将关系矩阵表示为少量公共基底矩阵的线性组合;(b)块对角分解(Block-diagonal-decomposition),将关系矩阵约束为块稀疏直和;
    3. 任务适应架构:实体分类直接接节点 Softmax;链接预测构建自编码器,由 R-GCN 作为编码器生成实体嵌入,DistMult 作为解码器计算三元组能量并使用负采样交叉熵优化。
  • 为什么用这种方法:知识图谱中实体属性与其局部多跳多关系邻居紧密相关(例如“某人毕业于某大学”蕴含该实体为“人”且可能“居住于该大学所在国”);通过 R-GCN 堆叠两层卷积,节点表征能够显式吸收 2 阶多跳关系路径的丰富上下文,弥补浅层因式分解模型的推理短板。

方法分析

  • 分析单位:图中的节点 viv_i 及其在特定关系 r∈Rr \in \mathcal{R} 下的入边邻居集合 Nir\mathcal{N}_i^r。
  • 关键变量/概念:
    • 节点隐藏特征向量 hi(l)∈Rd(l)h_i^{(l)} \in \mathbb{R}^{d^{(l)}};
    • 关系变换矩阵 Wr(l)∈Rd(l+1)×d(l)W_r^{(l)} \in \mathbb{R}^{d^{(l+1)} \times d^{(l)}};
    • 归一化常数 ci,rc_{i,r}(通常设为关系入度 ∣Nir∣|\mathcal{N}_i^r| 或对称归一化);
    • 自环特征变换矩阵 W0(l)W_0^{(l)};
    • 基底矩阵 Vb(l)V_b^{(l)} 与系数 arb(l)a_{rb}^{(l)}。
  • 识别/推断逻辑:
    • 基底分解假设不同关系共享底层潜在语义子空间(如“出生于”与“逝世于”共享地理空间变换模式),通过基底矩阵权重共享显著增强了罕见关系的泛化鲁棒性;
    • 块对角分解假设潜在维度之间解耦成多个独立子群,限制维度间交叉干扰。
  • 具体步骤:
    1. 为每个有向边附加反向关系,将关系集合扩展为 R∪Rinv\mathcal{R} \cup \mathcal{R}_{\text{inv}};
    2. 节点初始特征 hi(0)h_i^{(0)} 若有属性则使用属性,若无属性则采用 One-hot 编码或可学习 Embedding 查找表;
    3. 计算各层 R-GCN 消息传递与累加,经过非线性激活 σ(⋅)\sigma(\cdot);
    4. 链接预测任务中,使用小批量负采样,真实三元组标记为 1,负三元组标记为 0,最小化二元交叉熵损失:L=−1(1+ω)∣E^∣∑(s,r,o,y)∈T(ylog⁡σ(s(s,r,o))+(1−y)log⁡(1−σ(s(s,r,o))))\mathcal{L} = -\frac{1}{(1+\omega)|\hat{\mathcal{E}}|} \sum_{(s,r,o,y) \in \mathcal{T}} \left( y \log \sigma(s(s,r,o)) + (1-y) \log(1 - \sigma(s(s,r,o))) \right)。

  • 核心公式/指标 1:R-GCN 关系特定层级前向传播规则 (Relational Layer-wise Propagation)
hi(l+1)=σ(W0(l)hi(l)+∑r∈R∑j∈Nir1ci,rWr(l)hj(l))h_i^{(l+1)} = \sigma\left( W_0^{(l)} h_i^{(l)} + \sum_{r \in \mathcal{R}} \sum_{j \in \mathcal{N}_i^r} \frac{1}{c_{i,r}} W_r^{(l)} h_j^{(l)} \right)
  • 公式拆解 1:
    • 这条公式表示什么:节点 viv_i 在第 l+1l+1 层的状态更新公式。不仅聚合各关系 rr 下所有邻居节点 jj 经由 Wr(l)W_r^{(l)} 变换后的信息,而且通过 W0(l)hi(l)W_0^{(l)} h_i^{(l)} 保留自身当前层的状态信息。
    • 其中关键符号分别代表什么:Nir\mathcal{N}_i^r 为节点 ii 在关系 rr 下的邻居集合;ci,rc_{i,r} 为归一化项(可设为 ∣Nir∣|\mathcal{N}_i^r|);Wr(l)W_r^{(l)} 为关系专用权重矩阵;W0(l)W_0^{(l)} 为自连接权重。
    • 这条公式对应方法中的哪一步:前向传播中关系邻域特征汇聚的核心数学定义。

  • 核心公式/指标 2:基底分解与块对角分解正则化 (Basis and Block-Diagonal Regularization)
基底分解:Wr(l)=∑b=1Barb(l)Vb(l)\text{基底分解:} \quad W_r^{(l)} = \sum_{b=1}^B a_{rb}^{(l)} V_b^{(l)} 块对角分解:Wr(l)=diag⁡(Qr1(l),Qr2(l),…,QrB(l))=⨁b=1BQrb(l)\text{块对角分解:} \quad W_r^{(l)} = \operatorname{diag}\left(Q_{r1}^{(l)}, Q_{r2}^{(l)}, \dots, Q_{rB}^{(l)}\right) = \bigoplus_{b=1}^B Q_{rb}^{(l)}
  • 公式拆解 2:
    • 这条公式表示什么:防止在具有成百上千种关系的知识图谱中发生参数爆炸的矩阵降维约束方案。
    • 其中关键符号分别代表什么:Vb(l)∈Rd(l+1)×d(l)V_b^{(l)} \in \mathbb{R}^{d^{(l+1)} \times d^{(l)}} 为第 bb 个公共基底矩阵;arb(l)a_{rb}^{(l)} 为关系 rr 在基底上的线性组合系数;Qrb(l)∈R(d(l+1)/B)×(d(l)/B)Q_{rb}^{(l)} \in \mathbb{R}^{(d^{(l+1)}/B) \times (d^{(l)}/B)} 为小块低维矩阵。
    • 这条公式对应方法中的哪一步:模型参数初始化与网络结构压缩步骤。

  • 方法优势:
    1. 原生支持多关系异质图谱:打破了同质 GNN 的限制,使图神经网络正式具备处理复杂三元组语义的能力;
    2. 多跳上下文推断能力:通过卷积层堆叠,使实体嵌入能够融合两跳甚至三跳外的结构拓扑线索;
    3. 基底分解防过拟合:即使某些关系仅有极少数训练样本,借助公共基底矩阵仍能学到高质量表征。
  • 方法局限:
    1. 全图多关系扩展性与显存开销极大:为每个关系分别维护稀疏邻接矩阵并在 GPU 上广播,显存开销随图谱规模剧增,难以直接全图加载超大知识图谱;
    2. 平坦欧氏聚合:未能考虑关系在层级深度上的弯曲特性,在纯树状层次关系上容易产生度规失真。

数据来源

  • 数据类型:开放域知识图谱与语义网络标准基准。
  • 样本来源:
    • 实体分类:
      • AIFB:学术图谱,2,440 实体,46 关系,58,621 三元组;
      • MUTAG:分子生物图谱,23,644 实体,46 关系,742,267 三元组;
      • BGS:地质学图谱,333,845 实体,103 关系,916,199 三元组;
      • AM:阿姆斯特丹博物馆馆藏图谱,1,666,764 实体,133 关系,5,988,321 三元组;
    • 链接预测:
      • WN18:40,943 实体,18 关系,151,442 三元组;
      • FB15k:14,951 实体,1,345 关系,592,213 三元组;
      • FB15k-237:移除所有反向关系捷径泄露的经典硬核数据集,14,541 实体,237 关系,310,116 三元组。
  • 时间范围:语义网与知识图谱 2012–2018 年经典评测标准。
  • 样本量/案例数:从小型学术图谱(几千节点)到大型博物馆图谱(百万节点),三元组从 5 万条跨越至 600 万条。
  • 数据局限:FB15k-237 节点度数分布极不均匀,对长尾稀疏节点极其苛刻。

研究结论

  • 主要发现 1:R-GCN 在多关系知识图谱实体分类任务上全面战胜或持平顶尖的传统 RDF 特征与核方法。 在 AIFB、MUTAG、BGS 与 AM 数据集上分类准确率分别达到 95.83%、73.23%、83.10% 与 89.29%,证明多关系消息传递能够端到端捕获复杂语义类型。
  • 原文引用 1:

“We demonstrate the effectiveness of R-GCNs as a stand-alone model for entity classification… Results for entity classification are shown in Table 1… On all datasets, R-GCN achieves competitive results, matching or outperforming the baselines.” (Page 1 & 5)

  • 主要发现 2:作为编码器配合 DistMult 解码器,R-GCN 在消除逆向泄漏的 FB15k-237 基准上实现了 29.8% 的巨幅链接预测性能跃升。 证明在复杂多跳且无捷径可抄的真实场景下,多跳图卷积累加的结构拓扑线索是实现精准链接预测的决定性因素。
  • 原文引用 2:

“We further show that factorization models for link prediction such as DistMult can be significantly improved by enriching them with an encoder model to accumulate evidence over multiple inference steps in the relational graph, demonstrating a large improvement of 29.8% on FB15k-237 over a decoder-only baseline.” (Page 1, Abstract)
“On FB15k-237, the R-GCN+DistMult model outperforms the baseline DistMult by a large margin (MRR 0.248 vs 0.191, Hits@10 41.7% vs 35.8%).” (Page 6, Table 4)

  • 主要发现 3:基底分解对于参数控制与泛化具有显著效果。 在关系种类极多的数据集上,将全矩阵约束在少量共享基底(B=10∼30B=10 \sim 30)不仅没有损失表达力,反而大幅抑制了参数过拟合。
  • 原文引用 3:

“The basis-decomposition (Eq. 3) can be seen as a form of effective weight sharing between different relation types. This addresses the parameter explosion issue on multi-relational graphs… and strongly regularizes the representations of rare relations.” (Page 3, Section 2.1)

我的判断

  • 最有启发的点:
    1. 图神经网络从同质向异质多关系的理论跨越:将简单的邻接加权升级为关系条件矩阵聚合,奠定了知识图谱与图神经网络融合的通用基座;
    2. “图卷积编码器 + 几何因式分解解码器”自编码范式:把图卷积负责的高阶拓扑信息聚合与能量函数负责的三元组几何交互清晰解耦,这一架构至今仍是图谱嵌入的主流骨架。
  • 可借鉴的方法:
    1. 关系矩阵公共基底分解(Basis Sharing)正则化方法;
    2. 自连接自环与有向逆向边双向扩展策略;
    3. 基于图采样的二元交叉熵链接预测优化流程。
  • 可继续追问的问题:
    1. R-GCN 虽能处理多关系,但其消息传递依然深植于欧几里得平坦空间,对于树状无标度图谱的层级膨胀依然面临维数灾难与表达失真;
    2. 如何将关系图卷积的拓扑聚合能力拓展至具有非零曲率的黎曼流形(如双曲流形)中?(后续由 HGCN 与 HMEA 解决)。
  • 与我的研究关联:
    • 本文是多关系图神经网络的开创性文献,为后续阶段三(多关系双曲嵌入)与阶段四(多模态实体对齐 HMEA)提供了直接的方法论前身。
Built with LogoFlowershow