低维双曲知识图谱嵌入 (ATTH)

基本信息

项目内容
作者Ines Chami, Adva Wolf, Da-Cheng Juan, Frederic Sala, Sujith Ravi, Christopher Ré (Stanford University, Google Research, Amazon Alexa)
年份2020
来源Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics (ACL 2020)
主题知识图谱双曲等距保距变换(旋转与反射)、切空间双曲注意力机制、可学习关系曲率与逻辑模式建模
链接Zotero 条目 | Zotero PDF 原文 | 本地全文 Markdown | DOI 链接

一句话摘要

本文针对现有双曲知识图谱模型(如 MuRP)仅能依赖平移而无法建模对称/反对称等复杂逻辑模式的缺陷,在庞加莱球中构造了基于吉文斯旋转与反射的双曲等距保距变换,并利用双曲注意力机制与关系级可学习曲率,首次在极低维数下实现了对树形层次结构与丰富符号逻辑模式的兼收并蓄。

研究对象

  • 研究对象:蕴含多重层次结构(Hierarchical Patterns)与复杂关系逻辑模式(Logical Patterns,如对称性、反对称性、反演关系、传递组合)的大规模知识图谱。
  • 核心问题:
    1. 逻辑表达力缺失:双曲嵌入(如 MuRP)虽然天然适合树结构,但本质上仅是平移模型(Translational Models),无法建模对称关系(如“结婚”、“相邻”)和复杂的旋转组合关系;而欧氏/复数域旋转模型(如 RotatE、ComplEx)虽然擅长逻辑模式,却受困于平坦空间的维度诅咒,必须依赖几百甚至上千维度才能缓解层次拥挤。
    2. 固定曲率刚性瓶颈:先前的双曲图谱强制全图共享固定的常数曲率(c=1c=1),导致在嵌入维度增加时,双曲边界处发生严重的浮点精度崩溃和点群边缘聚簇,使双曲模型在高维时反而被欧氏模型反超。
  • 研究情境/范围:树状拓扑显著的 WN18RR(ξG=−2.54\xi_G = -2.54)、弱层级实体网状的 FB15k-237(ξG=−0.65\xi_G = -0.65)以及实体超 12 万的大规模关系库 YAGO3-10(ξG=−0.54\xi_G = -0.54)。

研究方法

方法概述

  • 方法类型:李群等距几何代数、多流形自适应曲率与注意力融合(Lie Group Isometry Algebra & Curvature-Adaptive Multi-Relational Learning)
  • 总体思路:在可调曲率 −cr-c_r 的庞加莱球 Bd,cr\mathcal{B}^{d, c_r} 中构建表征体系。利用吉文斯(Givens)正交矩阵在双曲空间中严格参数化两类保距变换(Isometries):用 2×22 \times 2 块对角旋转矩阵 Rot(Θr)\text{Rot}(\Theta_r) 建模反对称与反演逻辑,用反射矩阵 Ref(Φr)\text{Ref}(\Phi_r) 建模严格对称逻辑。设计基于原点切空间加权平均的双曲注意力机制(Hyperbolic Attention),让模型自主决定旋转与反射的融合配比以捕捉混合逻辑模式。引入每种关系特异的可训练曲率 crc_r,允许网络自主决定该关系应当嵌入为强弯曲树状空间(cr≫0c_r \gg 0)还是平坦欧氏空间(cr→0c_r \to 0)。
  • 为什么用这种方法:等距保距变换保证了变换前后双曲流形局部的度量性质与测地距离结构不发生畸变,将逻辑命题严格映射为几何刚体转动/镜像;可训练曲率使得双曲几何在低维时充分释放指数容量优势,在高维时能平滑退化为平坦欧氏几何,兼顾了低维极致压缩与高维巅峰表达。

方法分析

  • 分析单位:三元组 (h,r,t)(h, r, t) 及其在曲率为 crc_r 的庞加莱球切空间中的李代数变换。

  • 关键变量/概念:

    • 双曲旋转(Hyperbolic Rotations, RotH):块对角吉文斯旋转矩阵 G+(θ)=[cos⁡θ−sin⁡θsin⁡θcos⁡θ]G_+(\theta) = \begin{bmatrix} \cos\theta & -\sin\theta \\ \sin\theta & \cos\theta \end{bmatrix},行列式为 +1+1,参数化反对称性与反演。
    • 双曲反射(Hyperbolic Reflections, RefH):吉文斯反射矩阵 G−(ϕ)=[cos⁡ϕsin⁡ϕsin⁡ϕ−cos⁡ϕ]G_-(\phi) = \begin{bmatrix} \cos\phi & \sin\phi \\ \sin\phi & -\cos\phi \end{bmatrix},行列式为 −1-1,其二次幂等于单位阵(Ref2=I\text{Ref}^2 = \mathbf{I}),天然诱导对称双向推理。
    • 切空间双曲注意力(Tangent Space Hyperbolic Attention):将旋转与反射变换后的双曲点通过对数映射投影至切空间,经全连接打分 Softmax 归一化后执行线性加权,再经指数映射返回双曲流形。
    • 关系特异可训练曲率(Relation-Specific Trainable Curvature crc_r):通过重参数化 cr=softplus(c~r)c_r = \text{softplus}(\tilde{c}_r) 确保严格非负,伴随网络反向传播动态自适应更新。
  • 识别/推断逻辑:

    • 对于头实体 ehH\mathbf{e}_h^H,先独立应用旋转与反射变换得到 qRotH\mathbf{q}_{\text{Rot}}^H 与 qRefH\mathbf{q}_{\text{Ref}}^H;
    • 经注意力仲裁器聚合成综合查询点,再通过莫比乌斯加法叠加平移向量 rH\mathbf{r}_H 实现跨层级迁移:Q(h,r)=Att(qRotH,qRefH;ar)⊕crrH\mathbf{Q}(h, r) = \text{Att}(\mathbf{q}_{\text{Rot}}^H, \mathbf{q}_{\text{Ref}}^H; \mathbf{a}_r) \oplus_{c_r} \mathbf{r}_H;
    • 最终打分由双曲测地线距离平方与头尾实体偏置联合决定。
  • 具体步骤:

    1. 切空间参数优化(Tangent Space Optimization):实体与关系参数定义在原点切空间,利用欧氏 Adam 优化器更新,避免繁复的黎曼边界投影溢出。
    2. 前向映射:通过指数映射 exp⁡0cr\exp_0^{c_r} 映射到流形,应用正交块对角矩阵。
    3. 注意力聚合与双曲平移:切空间注意力平均后再施加莫比乌斯关系位移。
    4. 全负采样交叉熵优化:对尾实体扰动均匀采样负例,联合更新实体、关系角度矩阵、平移偏置及曲率标量。
  • 核心公式/指标 1:ATTH 整体评分函数

s(h,r,t)=−dcr(Q(h,r),etH)2+bh+bts(h, r, t) = -d_{c_r}(\mathbf{Q}(h, r), \mathbf{e}_t^H)^2 + b_h + b_t
  • 公式拆解 1:

    • etH∈Bd,cr\mathbf{e}_t^H \in \mathcal{B}^{d, c_r} 为尾实体的双曲嵌入;
    • Q(h,r)=Att(Rot(Θr)ehH,Ref(Φr)ehH;ar)⊕crrrH\mathbf{Q}(h, r) = \text{Att}(\text{Rot}(\Theta_r)\mathbf{e}_h^H, \text{Ref}(\Phi_r)\mathbf{e}_h^H; \mathbf{a}_r) \oplus_{c_r} \mathbf{r}_r^H 为融合了旋转、反射与平移的查询表征;
    • dcr(x,y)=2crartanh(cr∥−x⊕cry∥)d_{c_r}(x, y) = \frac{2}{\sqrt{c_r}} \text{artanh}(\sqrt{c_r}\|-x \oplus_{c_r} y\|) 为曲率受控的庞加莱测地距离;
    • bh,btb_h, b_t 为实体自适应阈值偏置。
  • 核心公式/指标 2:块对角吉文斯保距变换矩阵构造

Rot(Θr)=diag(G+(θr,1),…,G+(θr,d/2)),Ref(Φr)=diag(G−(ϕr,1),…,G−(ϕr,d/2))\text{Rot}(\Theta_r) = \text{diag}(G_+(\theta_{r, 1}), \dots, G_+(\theta_{r, d/2})), \quad \text{Ref}(\Phi_r) = \text{diag}(G_-(\phi_{r, 1}), \dots, G_-(\phi_{r, d/2}))
  • 公式拆解 2:

    • 将 dd 维空间两两配对分解为 d/2d/2 个正交的 2 维二维平面;
    • G±(θ)=[cos⁡θ∓sin⁡θsin⁡θ±cos⁡θ]G_\pm(\theta) = \begin{bmatrix} \cos\theta & \mp\sin\theta \\ \sin\theta & \pm\cos\theta \end{bmatrix} 为二维吉文斯算子。当取负号时为旋转矩阵,满足 G+(θ)G+(−θ)=IG_+(\theta)G_+(-\theta) = \mathbf{I};当取正号时为反射矩阵,满足 G−(ϕ)2=IG_-(\phi)^2 = \mathbf{I};
    • 由于正交矩阵保欧氏范数(∥Gx∥=∥x∥\|G x\| = \|x\|),根据庞加莱度量定义,该变换严格保持任意点到原点的双曲距离不变,属于严格的双曲保距同构映射(Hyperbolic Isometries)。
  • 核心公式/指标 3:切空间双曲注意力聚合

Att(xH,yH;a)=exp⁡0c(αxlog⁡0c(xH)+αylog⁡0c(yH))\text{Att}(x_H, y_H; \mathbf{a}) = \exp_0^{c}\left( \alpha_x \log_0^c(x_H) + \alpha_y \log_0^c(y_H) \right)
  • 公式拆解 3:

    • (αx,αy)=Softmax(aTlog⁡0c(xH),aTlog⁡0c(yH))(\alpha_x, \alpha_y) = \text{Softmax}(\mathbf{a}^T \log_0^c(x_H), \mathbf{a}^T \log_0^c(y_H)) 为基于切空间投射的自适应注意力权重;
    • 它克服了双曲流形上无法直接对两点进行凸组合求和(加法非封闭)的理论障碍,通过“双曲点 →\to 切向量 →\to 凸加权 →\to 测地线返回”的标准流程,实现了流形上平滑可微的特征融合。
  • 方法优势:

    1. 逻辑与层次双重闭环:旋转完美捕获反对称/反演,反射完美捕获对称,平移完美捕获树深迁移,三者合一实现全模式覆盖;
    2. 维度可伸缩性:可训练曲率解决了双曲模型在高维下的数值崩溃与能力饱和,在高低维度均能自适应达到最优几何形态;
    3. 参数极度紧凑:旋转和反射仅需学习角度标量 θ,ϕ\theta, \phi,每种关系参数量仅为 O(d)\mathcal{O}(d),远轻量于稠密矩阵模型。
  • 方法局限:

    1. 依然基于单曲率庞加莱球基底(尽管每种关系有独立曲率),无法在单个流形内部局部自适应混合正负曲率(如超双曲空间);
    2. 2 维吉文斯分块限制了跨分块维度之间的全维密集交叉交互。

数据来源

  • 数据类型:多模式多关系知识图谱基准集。
  • 样本来源:
    • WN18RR:40,943 实体、11 关系、9.3 万三元组;全局树性曲率 ξG=−2.54\xi_G = -2.54(极其强烈的类树分层结构);
    • FB15k-237:14,541 实体、237 关系、31 万三元组;全局树性曲率 ξG=−0.65\xi_G = -0.65(稠密图网络,树性弱);
    • YAGO3-10:123,182 实体、37 关系、100 万三元组;全局树性曲率 ξG=−0.54\xi_G = -0.54(兼具人物组织层级与人际对称关系)。
  • 时间范围:涵盖从 2013 年经典 Freebase 衍生集到百万级实体库。
  • 样本量/案例数:三元组规模达百万级,采用全实体负例过滤评测。
  • 数据局限:FB15k-237 缺乏长链层次,主要检验模型的通用关系建模能力。

研究结论

  • 主要发现 1:在低维度(32 维)下,ATTH / RotH 凭借双曲几何的强归纳偏置大幅击溃所有欧氏与复数域基线,在层级图谱上展现出压倒性优势。在 32 维设置下,ATTH 在 WN18RR 上取得 0.466 MRR 和 0.551 Hits@10,比欧氏模型 RotatE(0.387 MRR)高出近 8 个百分点;在百万级三元组的 YAGO3-10 上,ATTH 取得 0.397 MRR,相比欧氏模型 MuRE(0.283 MRR)提升高达 40% 以上。

  • 原文引用 1:

    “In low (32) dimensions, we improve over Euclidean-based models by up to 6.1% in the mean reciprocal rank (MRR) metric… In low dimensions, hyperbolic embeddings offer much better representations for hierarchical relations, confirming our hypothesis. ATTH improves over previous Euclidean and hyperbolic methods by 0.7% and 6.1% points in MRR on WN18RR and YAGO3-10 respectively.” (Page 1, 7) “Table 2 (d=32): WN18RR MRR: RotatE .387, MuRE .458, ComplEx-N3 .420 vs RotH .472, ATTH .466. YAGO3-10 MRR: MuRE .283, MuRP .230 vs RotH .393, ATTH .397.” (Page 6, Table 2)

  • 主要发现 2:双曲保距变换与离散逻辑属性严格对偶:旋转精确捕获反对称性,反射精确捕获对称性。在 YAGO3-10 单关系消融实验中,对于严格对称关系(如 hasNeighbor, isMarriedTo),纯反射模型 RefH 取得了 1.00 的 Hits@10 满分,显著优于旋转模型(hasNeighbor 上 RotH 仅 0.75);而对于严格反对称关系(如 graduatedFrom, wroteMusicFor),纯旋转模型 RotH 显著优于 RefH(graduatedFrom 上 RotH 0.262 对比 RefH 0.167)。而结合了双曲注意力的 ATTH 能够自主对每个关系学会正确的算子融合,全面包揽各关系的最优表现。

  • 原文引用 2:

    “We study symmetric and anti-symmetric patterns and find that reflections capture symmetric relations while rotations capture anti-symmetry… For instance, we observe that ATTH recovers reflections for symmetric relations and rotations for the anti-symmetric ones… For relations that are neither symmetric nor anti-symmetric, we find that ATTH can outperform rotations and reflections, suggesting that combining multiple operators with attention can learn more expressive operators to model mixed logical patterns.” (Page 1, 8) “Table 4: hasNeighbor: RotH .750, RefH 1.00, ATTH 1.00. graduatedFrom: RotH .262, RefH .167, ATTH .274.” (Page 7, Table 4)

  • 主要发现 3:在层级深厚的关系子图上,双曲模型相对欧氏模型的性能增益高达 24.7%。在 WN18RR 中,对于树性曲率最负、完全单向的层级关系 member_meronym(ξG=−2.90\xi_G = -2.90)和 hypernym(ξG=−2.46\xi_G = -2.46),RotH 相对欧氏模型 RotE 的 Hits@10 分别取得了 24.7%(从 0.320 提升至 0.399)和 16.5%(从 0.237 提升至 0.276)的相对跃升。

  • 原文引用 3:

    “Hierarchical relationships, such as WordNet’s hypernym and member meronym, significantly benefit from hyperbolic space; we observe a 16% to 24% relative improvement versus Euclidean baselines.” (Page 2) “Table 3: member meronym RotE .320 vs RotH .399 (+24.7%); hypernym RotE .237 vs RotH .276 (+16.5%); has part RotE .291 vs RotH .346 (+18.9%).” (Page 7, Table 3)

  • 主要发现 4:可学习曲率 crc_r 是双曲模型打破高维天花板的根本机制。先前固定曲率的 MuRP 在维度升至 500 维时出现严重性能滑坡(WN18RR MRR 仅为 0.481,甚至不如 32 维);而配备可训练曲率的 RotH 在 500 维下曲率自动平滑趋向于 0(回归欧氏平坦流形),成功化解了数值溢出,一举创下 WN18RR 49.6% MRR 和 YAGO3-10 57.7% MRR 的当时全行业最高纪录。

  • 原文引用 4:

    “In high dimensions, our approach yields new state-of-the-art MRRs of 49.6% on WN18RR and 57.7% on YAGO3-10… In contrast, fixed curvature degrades performance in high dimensions (Figure 5a), confirming the importance of trainable curvatures and its impact on precision and capacity… As the dimension increases, the learned curvature of hierarchical relationships tends to zero.” (Page 1, 8) “Table 5: WN18RR MRR RotH .496, YAGO3-10 MRR RefE .577 / RotH .570 / RefH .576.” (Page 9, Table 5)

关联精读笔记

  • 多关系庞加莱图嵌入 (MuRP):Balažević et al. (2019) 仅探索了平移与对角缩放,本文指出其无法建模复杂逻辑模式与固定曲率高维崩溃的弱点,全面升级为保距旋转/反射与可训练曲率。
  • 超双曲知识图谱嵌入 (UltraE):Xiong et al. (2022) 进一步指出,即使配备了可训练曲率,单个流形依然受限于单一恒定正/负曲率的约束;对于同一图谱内混合共存的“树 + 环 + 网”拓扑,必须拓展至伪黎曼超双曲空间。

我的判断

  • 最有启发的点: 将抽象的代数对称性(群论)与微分流形保距变换(李群正交变换)进行一一对应,是极具数学美感的突破。它回答了“为什么在欧氏空间做旋转能推断关系、而在双曲空间同样能做旋转且效果更好”的深层本质:旋转保证了测地距离的不变量性质,平移则实现了沿层级树轴线的纵向穿梭。
  • 可借鉴的方法:
    1. 在实现双曲嵌入时,切忌写死固定常数曲率(如 c=1c=1),务必将曲率设为可导的可学习参数,让损失反向传播自动平衡几何弯曲度与维度容量;
    2. 运用吉文斯旋转(G+G_+)与吉文斯反射(G−G_-)作为基础元构件,通过注意力机制实现不同逻辑算子的软选择。
  • 可继续追问的问题:
    1. 为什么在 YAGO3-10 这种含大量属性和人员关系的数据集上,反射算子(RefH)的表现反而优于旋转算子?现实世界知识图谱中有多少比例的关系在几何上更偏好轴对称而非中心旋转?
    2. 切空间注意力加权虽然数学上可行,但当切向量模长极大时,在原点切空间取平均是否会导致严重的测地线距离失真?
  • 与我的研究关联: ATTH 确立了现代“双曲几何 + 逻辑推理”的基准架构。在处理具有深度分层概念与复杂逻辑制约的知识图谱推理系统时,ATTH 的可训练曲率与保距正交算子是最标准的实现范式。
Built with LogoFlowershow