02vault树模型知识图谱多关系庞加莱图嵌入 (MuRP)

多关系庞加莱图嵌入 (MuRP)

基本信息

项目内容
作者Ivana Balažević, Carl Allen, Timothy Hospedales (University of Edinburgh, Samsung AI Centre)
年份2019
来源Advances in Neural Information Processing Systems 32 (NeurIPS 2019)
主题多关系知识图谱的非欧双曲嵌入、多重共存层级建模、莫比乌斯陀螺矢量变换与链接预测
链接Zotero 条目 | Zotero PDF 原文 | 本地全文 Markdown | DOI 链接

一句话摘要

本文针对多关系知识图谱中实体在不同关系下呈现多重甚至颠倒层级结构的难题,首次在庞加莱球中结合莫比乌斯对角矩阵乘法(动态拉伸层级深度)与莫比乌斯加法(关系平移),提出了多关系双曲嵌入模型 MuRP,以极低维数在层次化知识图谱补全基准上刷新了最优性能。

研究对象

  • 研究对象:多关系知识图谱(Multi-Relational Knowledge Graphs),形式化为事实三元组集合 F={(es,r,eo)}⊂E×R×E\mathcal{F} = \{(e_s, r, e_o)\} \subset \mathcal{E} \times \mathcal{R} \times \mathcal{E}。
  • 核心问题:
    1. 多重层级冲突:现实知识图谱包含多种不同语义的有向关系,同一实体在不同关系下处于截然不同的层级位置。例如实体“狮子(lion)”在食物链(food chain)关系中处于捕食树的顶层根节点,但在生物分类系统(taxonomic type)关系中却处于哺乳动物树的底层叶子节点。过去单曲率、静态的单关系双曲模型无法让实体同时适配多种拓扑结构。
    2. 双曲内积缺失:DistMult、ComplEx、TuckER 等欧氏双线性模型极度依赖向量内积 ⟨u,v⟩\langle u, v \rangle,但在非欧双曲流形上不存在直接对应的双曲内积,传统平移模型(TransE)在负曲率空间中缺乏数学自洽的变换算子。
  • 研究情境/范围:层次化基准数据集 WN18RR(40,943 实体、11 种关系,包含上位词、组成部分等深层树结构)、非层次图谱 FB15k-237(14,541 实体、237 种关系)以及部分分层的 NELL-995。

研究方法

方法概述

  • 方法类型:非欧流形群代数建模与知识图谱链接预测(Möbius Gyrovector Algebra & Knowledge Graph Completion)
  • 总体思路:在曲率为 cc 的庞加莱球 Bcd\mathcal{B}_c^d 中定义实体表征。利用陀螺矢量空间(Gyrovector Spaces)的莫比乌斯代数体系,针对每个关系 rr 赋予一个对角缩放矩阵 R∈Rd×d\mathbf{R} \in \mathbb{R}^{d \times d} 和一个双曲平移向量 rh∈Bcd\mathbf{r}_h \in \mathcal{B}_c^d。对头实体执行莫比乌斯矩阵乘法 R⊗chs\mathbf{R} \otimes_c \mathbf{h}_s(在原点切空间通过对角阵放缩坐标后再投影回双曲球,实现关系的深度/层级自适应重塑);对尾实体执行莫比乌斯向量加法 ho⊕crh\mathbf{h}_o \oplus_c \mathbf{r}_h;再结合可学习的实体标量偏置 bs,bob_s, b_o(充当实体的影响球半径),通过黎曼随机梯度下降(RSGD)最小化伯努利交叉熵损失。
  • 为什么用这种方法:利用庞加莱球对树状分支的指数容积红利;通过引入关系依赖的对角变换矩阵,赋予了模型在保持实体底层几何不变的前提下,动态调整实体沿测地线向球心靠拢(抽象化)或向球壁发散(特化)的能力,从而优雅解决了“单一实体兼具多种层级身份”的理论死结。

方法分析

  • 分析单位:三元组 (es,r,eo)(e_s, r, e_o) 及其对应的双曲流形向量 hs,rh,ho∈Bcd\mathbf{h}_s, \mathbf{r}_h, \mathbf{h}_o \in \mathcal{B}_c^d。

  • 关键变量/概念:

    • 曲率可调庞加莱球(Poincaré Ball of Radius 1/c1/\sqrt{c}):\mathcal{B}_c^d = \{x \in \mathbb{R}^d \mid c\|x\|^2 < 1\},度量张量共形因子为 λxc=21−c∥x∥2\lambda_x^c = \frac{2}{1 - c\|x\|^2}。
    • 莫比乌斯加法(Möbius Addition ⊕c\oplus_c):双曲空间中向量平移的非交换、非结合闭式代数算子。
    • 莫比乌斯矩阵向量乘法(Möbius Matrix-Vector Multiplication ⊗c\otimes_c):将点通过对数映射投至欧氏切空间,经对角矩阵 R\mathbf{R} 线性变换后再经指数映射投回流形。
    • 影响球(Spheres of Influence):标量偏置 bs,bob_s, b_o 构成的自适应判定边界半径 bs+bo\sqrt{b_s + b_o},范数越大的节点在稀疏边缘拥有更大的影响球,范数越小的密集节点拥有紧凑影响球。
  • 识别/推断逻辑:

    • 若三元组 (es,r,eo)(e_s, r, e_o) 真实成立,则变换后的头实体 hs(r)\mathbf{h}_s^{(r)} 与变换后的尾实体 ho(r)\mathbf{h}_o^{(r)} 在庞加莱球内的双曲测地线平方距离必然落入双方影响球构成的半径阈值内;
    • 关系矩阵 R\mathbf{R} 负责针对该特定关系重构整棵树的相对层级,关系向量 rh\mathbf{r}_h 负责引导实体在球内向正确的语义簇平移。
  • 具体步骤:

    1. 数据增强:对每个三元组增加倒数逆关系 (eo,r−1,es)(e_o, r^{-1}, e_s)。
    2. 非线性几何变换:
      • 头实体:hs(r)=R⊗chs=exp⁡0c(Rlog⁡0c(hs))\mathbf{h}_s^{(r)} = \mathbf{R} \otimes_c \mathbf{h}_s = \exp_0^c(\mathbf{R} \log_0^c(\mathbf{h}_s));
      • 尾实体:ho(r)=ho⊕crh\mathbf{h}_o^{(r)} = \mathbf{h}_o \oplus_c \mathbf{r}_h。
    3. 计算双曲打分:代入庞加莱测地距离公式计算 ϕMuRP(es,r,eo)=−dB(hs(r),ho(r))2+bs+bo\phi_{\text{MuRP}}(e_s, r, e_o) = -d_\mathcal{B}(\mathbf{h}_s^{(r)}, \mathbf{h}_o^{(r)})^2 + b_s + b_o。
    4. 负采样与反向传播:每条正例随机替换头/尾实体抽取 50 个负例,通过 RSGD 沿切空间测地线更新所有双曲实体与关系参数。
  • 核心公式/指标 1:MuRP 核心双曲打分函数

ϕMuRP(es,r,eo)=−dB(exp⁡0c(Rlog⁡0c(hs)),ho⊕crh)2+bs+bo\phi_{\text{MuRP}}(e_s, r, e_o) = -d_\mathcal{B}(\exp_0^c(\mathbf{R} \log_0^c(\mathbf{h}_s)), \mathbf{h}_o \oplus_c \mathbf{r}_h)^2 + b_s + b_o
  • 公式拆解 1:

    • hs,ho∈Bcd\mathbf{h}_s, \mathbf{h}_o \in \mathcal{B}_c^d 为头、尾实体的静态双曲基座表征;
    • R∈Rd×d\mathbf{R} \in \mathbb{R}^{d \times d} 是对角矩阵,对数映射 log⁡0c(hs)=2cartanh(c∥hs∥)hs∥hs∥\log_0^c(\mathbf{h}_s) = \frac{2}{\sqrt{c}} \text{artanh}(\sqrt{c}\|\mathbf{h}_s\|)\frac{\mathbf{h}_s}{\|\mathbf{h}_s\|} 将双曲点拉平到原点切空间;乘以 R\mathbf{R} 后,指数映射 exp⁡0c(v)=tanh⁡(c∥v∥2)vc∥v∥\exp_0^c(\mathbf{v}) = \tanh(\frac{\sqrt{c}\|\mathbf{v}\|}{2})\frac{\mathbf{v}}{\sqrt{c}\|\mathbf{v}\|} 重新压回双曲球。若 R\mathbf{R} 的分量小于 1,实体被拉向原点成为更抽象的高层父节点;若大于 1,则被推向边界成为叶子节点;
    • rh∈Bcd\mathbf{r}_h \in \mathcal{B}_c^d 为双曲关系平移向量,⊕c\oplus_c 为莫比乌斯加法;
    • bs,bob_s, b_o 充当双曲距离的偏移补偿,形成非对称决策边界。
  • 核心公式/指标 2:莫比乌斯加法定义公式

x⊕cy=(1+2c⟨x,y⟩+c∥y∥2)x+(1−c∥x∥2)y1+2c⟨x,y⟩+c2∥x∥2∥y∥2x \oplus_c y = \frac{(1 + 2c\langle x, y \rangle + c\|y\|^2)x + (1 - c\|x\|^2)y}{1 + 2c\langle x, y \rangle + c^2\|x\|^2\|y\|^2}
  • 公式拆解 2:

    • 该式由 Ungar 的陀螺矢量理论导出,是狭义相对论中爱因斯坦速度加法定理向负曲率空间的直接推广;
    • 分母 1+2c⟨x,y⟩+c2∥x∥2∥y∥21 + 2c\langle x, y \rangle + c^2\|x\|^2\|y\|^2 严格确保了只要 \|x\|, \|y\| < 1/\sqrt{c},相加后的结果仍恒处于庞加莱球内部;
    • 注意该加法不满足交换律(x⊕cy≠y⊕cxx \oplus_c y \ne y \oplus_c x),这种内在的非对称性天然对知识图谱中有向不对称事实提供了强大的归纳偏置。
  • 核心公式/指标 3:基于莫比乌斯加法的双曲测地线距离

dB(x,y)=2cartanh(c∥−x⊕cy∥)d_\mathcal{B}(x, y) = \frac{2}{\sqrt{c}} \text{artanh}(\sqrt{c} \|-x \oplus_c y\|)
  • 公式拆解 3:

    • 该公式将传统的庞加莱距离统一表示为“相加差向量的双曲模长”;
    • 与欧氏空间距离 d(x,y)=∥y−x∥d(x, y) = \|y - x\| 形成完美的数学对偶;当曲率 c→0c \to 0 时,lim⁡c→0dB(x,y)=∥x−y∥\lim_{c \to 0} d_\mathcal{B}(x, y) = \|x - y\|,平滑退化为经典欧氏距离。
  • 方法优势:

    1. 多层级兼容性:通过对角矩阵自适应拉伸切向量模长,完美支持同一实体在不同关系中的多重拓扑角色转换;
    2. 参数紧凑线性化:矩阵 R\mathbf{R} 为纯对角阵,模型总参数量仅随实体与关系数呈线性 O(∣E∣d+∣R∣d)\mathcal{O}(|\mathcal{E}|d + |\mathcal{R}|d) 增长,完全没有 RESCAL/TuckER 的二次方或张量组合爆炸;
    3. 低维高泛化:在 40 维下的链接预测准确率即可匹敌并超越 200 维欧氏全量模型。
  • 方法局限:

    1. 仅支持对角拉伸和平移,无法显式建模复数域的对称/反对称置换旋转(这也引发了后续 RotH / ATTH 引入双曲 Givens 旋转的探索);
    2. 固定曲率 c=1c=1 贯穿全图,无法针对不同关系的树深自适应调整局部曲率。

数据来源

  • 数据类型:多关系知识图谱基准评测集。
  • 样本来源:
    • WN18RR:剔除数据泄露(逆关系逆向泄露)后的 WordNet 知识图谱子集,含 40,943 个实体与 11 种关系(主要是 hypernym、has_part、member_meronym 等深度层次关系);
    • FB15k-237:剔除逆关系的 Freebase 真实常识三元组子集,含 14,541 个实体与 237 种关系(绝大多数子图平均最长路径仅 1.14,缺乏深层树结构);
    • NELL-995:卡内基梅隆大学永恒语言学习系统抽取的知识图谱,包含 75,492 个实体与 200 种关系(约 22% 关系具备显式层级性)。
  • 时间范围:2015–2018 年知识补全领域最主流的标准测试集。
  • 样本量/案例数:三元组数量数十万条,全实体负例生成(Filtered Setting 协议)。
  • 数据局限:FB15k-237 几乎全为浅层点对关系,无法凸显双曲树模型的结构优势。

研究结论

  • 主要发现 1:在具备显著层次结构的多关系知识图谱 WN18RR 上,MuRP 全面超越了过去所有最强的欧氏双线性与平移模型,且极低维度即可达到最优水平。在 40 维时,MuRP 的 MRR 达到 0.477,Hits@10 达到 0.555;在 200 维时 MRR 进一步达到 0.481,Hits@10 达到 0.566,大幅刷新了 ComplEx(0.440)、ConvE(0.430)和 TuckER(0.470)的纪录。

  • 原文引用 1:

    “Both MuRE and MuRP outperform previous state-of-the-art models on WN18RR on all metrics apart from hits@1, where MuRP obtains second best overall result. In fact, even at relatively low embedding dimensionality (d=40), this is maintained, demonstrating the ability of hyperbolic models to succinctly represent multiple hierarchies.” (Page 6) “WN18RR MRR: ComplEx .440, ConvE .430, TuckER .470 vs MuRP d=40 .477, MuRP d=200 .481. Hits@10: TuckER .526 vs MuRP d=200 .566.” (Page 6, Table 1)

  • 主要发现 2:双曲嵌入的性能增益与关系所诱导树结构的深度直接正相关。通过 Krackhardt 层次得分(Khs)与关系子图平均最长路径分析,对于具有深层分支的层次关系(如 has_part、member_meronym、hypernym,平均路径 2.2–4.5),MuRP 相对欧氏模型 MuRE 取得了巨大的 Hits@10 提升(如 has_part 从 0.215 提升至 0.282,hypernym 从 0.161 提升至 0.228);而在对称非层次关系(如 similar_to, verb_group)上两者表现持平。

  • 原文引用 2:

    “From Table 3 we see that both models achieve comparable performance on non-hierarchical, symmetric relations with the Krackhardt hierarchy score 0, such as verb_group, whereas MuRP generally outperforms MuRE on hierarchical relations. We also see that the difference between the performances of MuRE and MuRP is generally larger for relations that form deeper trees, fitting the hypothesis that hyperbolic space is of most benefit for modelling hierarchical relations.” (Page 7) “Table 3 (d=20): hypernym MuRE .161 vs MuRP .228 (∆=+.067); has_part MuRE .215 vs MuRP .282 (∆=+.067); member_meronym MuRE .272 vs MuRP .346 (∆=+.074).” (Page 7)

  • 主要发现 3:实体标量偏置 bs,bob_s, b_o(影响球)是双曲多关系评分函数不可或缺的几何组成部分。消融实验证实,移除偏置或用静态范数代替偏置会导致模型 MRR 发生严重断崖式下跌(从 0.477 跌至 0.414),这是因为偏置为远离原点的稀疏边界实体提供了与其局部空间容积相适应的半径容差。

  • 原文引用 3:

    “We note that any change to the current model architecture has a negative effect on performance of both MuRE and MuRP. Replacing biases by the (transformed) entity embedding norms leads to a significant reduction in performance of MuRP, in part because norms are constrained to [0, 1), whereas the biases they replace are unbounded.” (Page 6, 7) “Table 2: bs & bo MRR .477; bo only .460; bx = ||ex||^2 MRR .414.” (Page 7)

  • 主要发现 4:双曲模型收敛速度显著优于欧氏模型,且低维鲁棒性极高。在 WN18RR 训练过程中,MuRP 仅需约 50 轮即可达到验证集 MRR 峰值,而欧氏模型需要 200 轮以上;在维度低至 5 维和 10 维时,双曲模型与欧氏模型的性能差距达到最大化。

  • 原文引用 4:

    “Figure 2b shows the MRR per epoch for MuRE and MuRP on the WN18RR training and validation sets, showing that MuRP also converges faster… The difference is greatest at lower embedding dimensionality.” (Page 6)

关联精读笔记

我的判断

  • 最有启发的点: “实体在原点切空间中被对角矩阵拉伸,从而动态改变其在流形上的层级深度”这一设计堪称点睛之笔。它绕过了在流形表面难以定义非线性坐标缩放的几何限制,利用指数映射/对数映射作为桥梁,巧妙地在欧氏切空间完成了灵活的线性调整,然后原样送回双曲流形维持树状测地线性质。
  • 可借鉴的方法:
    1. 在多关系图神经网络中,不同关系对节点的抽象度要求不同,可以通过关系特异的切空间缩放对角阵 diag(r)\text{diag}(\mathbf{r}) 来实现动态的“概念泛化/特化”;
    2. 采用“双曲测地线距离 + 双侧自适应标量偏置”的形式作为链路分类器,赋予密集区与稀疏区节点不同的容错阈值。
  • 可继续追问的问题:
    1. 为什么对角矩阵 R\mathbf{R} 的元素必须是非负的还是可正可负?正负符号对方向有何物理影响?
    2. 为什么在 FB15k-237 这种弱层级图谱上,双曲模型的优势无法显现甚至略逊于欧氏 TuckER?这是否意味着单纯负曲率对非树状图谱存在几何“强扭”的负面归纳偏置?
  • 与我的研究关联: 本篇论文是知识图谱领域真正意义上的“多关系双曲开山作”。它厘清了多关系与单关系层次建模的本质鸿沟,其评分函数结构成为后续所有先进双曲模型评测的标准参考系。
Built with LogoFlowershow