基于生物医学知识图谱双曲图表征学习的鉴别诊断 (Bio-HKG)

基本信息

项目内容
作者Pietro Miotto, Lucia Mellini, Tommaso Marzi, Cesare Alippi, Elena Casiraghi, Alberto Paccanaro, Giorgio Valentini, Mauricio Soto-Gomez
年份2026 (arXiv:2609.18481, Sep 2026)
来源arXiv preprint arXiv:2609.18481, 2026
主题生物医学知识图谱双曲图表征学习与临床鉴别诊断 (Hyperbolic KG Representation Learning for Differential Diagnosis)
链接Fulltext Markdown · Zotero 条目 · Zotero PDF · DOI: 10.48550/arXiv.2609.18481

一句话摘要

针对现实生物医学知识图谱兼具纵向树状本体层次(如 HPO 表型树与 MONDO 疾病树)与横向异质临床关联(患者表型与疾病映射)的复杂混合结构,本文系统评估了双曲几何方法在孟德尔罕见病鉴别诊断中的有效性,证明双曲模型在纯本体层级上展现出极低维碾压优势,而具备关系特异性曲率与正交等距变换的双曲模型(AttH)在真实多关系患者诊断排序中取得全维度最佳性能。

研究对象

  • 研究对象:整合了患者真实表型记录与深层生物医学本体知识库的大规模异质图谱(Patient-Integrated Biomedical Knowledge Graph),涵盖 Person、Phenotype、Disease 三类实体及层级与横向关联。
  • 核心问题:
    1. 双曲嵌入天然擅长建模纯树状层次,但在同时包含严格树状 DAG 与复杂横向非分层关联(如表型-疾病、患者-表型跨域关联)的混合拓扑图中,双曲几何的优势是否依然成立?
    2. 针对临床迫切且极具挑战性的孟德尔罕见病鉴别诊断(罕见病影响全球约 5% 人口,涉及上万种疾病),双曲几何的归纳偏置能否转化为更优的候选疾病排序准确率?
    3. 浅层关系等距模型(AttH)与深层消息传递模型(HGCN)在此类混合异质生物图谱上的适应性差异何在?
  • 研究情境/范围:基于 PheKnowLator 框架构建真实临床患者图谱(2.88万节点、17.8万边),分别评估孤立本体层级子图的二元链接预测与完整异质图上模拟临床排查的患者-疾病排序推断(Link Prediction / Differential Diagnosis)。

研究方法

方法概述

  • 方法类型:真实临床异质图谱构建 + 双曲图表示学习算法评测(直推式 AttH vs 归纳式 HGCN) + 临床鉴别诊断模拟。
  • 总体思路:
    1. 构建临床集成知识图谱:提取人类表型本体(HPO)与疾病本体(MONDO/DOID)的 SubClassOf 树状层级,结合 Phenopacket 数据库中真实罕见病患者的临床表型与确诊疾病标签,构建统一三元组异质网络;
    2. 基准设定一:孤立本体分层链接预测:检验纯分层树(Low δ\delta-hyperbolicity)下,HGCN 相对于欧氏 GCN 和 GAT 的表征保真度;
    3. 基准设定二:真实患者-疾病鉴别诊断排序:将鉴别诊断形式化为 (Person, HasDisease, ?) 尾实体排序链接预测,对比双曲模型 AttH 与其欧氏对偶 AttE 以及深度模型 HGCN 在不同维度下的表现。
  • 为什么用这种方法:生物医学本体深度极大,概念逐级细化分化呈现强烈的指数体积膨胀;双曲空间的负曲率特性允许低维紧凑地编码表型解剖学父子包含关系,同时利用等距几何算子处理横向临床诊断关联。

方法分析

  • 分析单位:患者实体 h∈VPersonh \in \mathcal{V}_{\text{Person}} 与候选疾病目标 t∈VDiseaset \in \mathcal{V}_{\text{Disease}} 构成的诊断事实三元组 (h,HasDisease,t)(h, \text{HasDisease}, t)。
  • 关键变量/概念:
    • 关系特异性曲率 crc_r;
    • 纪文斯旋转算子 Rot⁡(Θr)\operatorname{Rot}(\Theta_r) 与反射算子 Ref⁡(Φr)\operatorname{Ref}(\Phi_r);
    • 庞加莱球莫比乌斯平移 qH(h,r)=Att⁡H(qRotE,qRefE)⊕crrrHq^H(h, r) = \operatorname{Att}^H(q_{\text{Rot}}^E, q_{\text{Ref}}^E) \oplus_{c_r} r_r^H;
    • 诊断排序评估指标:Mean Rank (MR), Mean Reciprocal Rank (MRR), Hits@10。
  • 识别/推断逻辑:
    • 若模型能够借助本体层次结构准确传递病理表型包含关系,患者与真实疾病在潜空间中的几何测度应当最小;
    • 评测中对每个测试患者,对全图候选疾病进行全局似然打分排序,记录确诊疾病的排名序号。
  • 具体步骤:
    1. 从 Phenopacket 提取患者特征与疾病标签,结合 HPO 与 MONDO 构建多重关系有向图;
    2. 针对纯层级子图,计算传递闭包并按照 8:1:1 切分测试集,训练 HGCN/GCN/GAT 计算 ROC-AUC;
    3. 针对全图鉴别诊断,保留 10% 的 HasDisease 边作为测试集,利用 50 个随机负采样三元组计算交叉熵逻辑损失训练 AttH 与 AttE;
    4. 测试阶段,输入患者查询 (h,HasDisease,?)(h, \text{HasDisease}, ?),遍历候选疾病库计算能量分值,统计前 10 命中率(Hits@10)与平均倒数排名(MRR)。

  • 核心公式/指标 1:AttH 关系注意力与庞加莱空间打分函数 (AttH Scoring Function)
qRotE=Rot⁡(Θr)ehE,qRefE=Ref⁡(Φr)ehEq^E_{\text{Rot}} = \operatorname{Rot}(\Theta_r) e_h^E, \quad q^E_{\text{Ref}} = \operatorname{Ref}(\Phi_r) e_h^E qH(h,r)=exp⁡ocr(αRotqRotE+αRefqRefE)⊕crrrHq^H(h, r) = \exp_o^{c_r}\left( \alpha_{\text{Rot}} q^E_{\text{Rot}} + \alpha_{\text{Ref}} q^E_{\text{Ref}} \right) \oplus_{c_r} r_r^H s(h,r,t)=−(dBcr(qH(h,r),etH))2+bh+bts(h, r, t) = - \left( d_{\mathcal{B}}^{c_r}(q^H(h, r), e_t^H) \right)^2 + b_h + b_t
  • 公式拆解 1:
    • 这条公式表示什么:在原点欧氏切空间通过纪文斯旋转与反射生成两个变换视图,通过关系注意力加权后经由指数映射提升至曲率为 crc_r 的庞加莱球上,再通过莫比乌斯加法与关系向量平移生成查询向量,最终以负双曲测地线距离平方加偏差项作为三元组得分。
    • 其中关键符号分别代表什么:crc_r 为关系专属可学习曲率;⊕cr\oplus_{c_r} 为莫比乌斯陀螺矢量加法;dBcrd_{\mathcal{B}}^{c_r} 为曲率为 crc_r 的庞加莱测地线距离;bh,btb_h, b_t 为实体偏置。
    • 这条公式对应方法中的哪一步:多关系双曲推理的核心打分与测试排序机制。

  • 核心公式/指标 2:临床鉴别诊断排序评估度量 (MRR and Hits@10)
MRR=1∣Q∣∑q∈Q1rank⁡q,Hits@10=1∣Q∣∑q∈QI(rank⁡q≤10)\text{MRR} = \frac{1}{|Q|} \sum_{q \in Q} \frac{1}{\operatorname{rank}_q}, \quad \text{Hits@10} = \frac{1}{|Q|} \sum_{q \in Q} \mathbb{I}(\operatorname{rank}_q \le 10)
  • 公式拆解 2:
    • 这条公式表示什么:量化模拟临床诊断中医生排查疑似罕见病候选名单的命中效率。
    • 其中关键符号分别代表什么:QQ 为待诊断的测试患者查询集合;rank⁡q\operatorname{rank}_q 为模型将真实确诊疾病排在候选列表中的名次;I\mathbb{I} 为指示函数。
    • 这条公式对应方法中的哪一步:下游临床推理任务的核心验证度量。

  • 方法优势:
    1. 极佳的本体分层拟合力:纯本体层次任务中,仅需 4 维即可达到 0.90 以上的 ROC-AUC,彻底规避了欧氏 GNN 在高维下出现的过度拟合与高置信度误判;
    2. 关系专属曲率自适应:AttH 允许层级关系(如 SubClassOf)拥有高曲率双曲结构,同时允许横向关系(如 HasDisease)拥有趋于平坦的曲率,在多关系异质图中展现出绝佳的几何自适应平衡。
  • 方法局限:
    1. HGCN 作为非浅层消息传递网络,在全图包含海量高连通枢纽节点(如核心表型)时,邻域扩展剧烈且对非分层关系的建模能力弱于关系特定的等距变换模型;
    2. 目前评测受限于计算复杂度,疾病节点仅限于患者队列所涉及的疾病及其祖先。

数据来源

  • 数据类型:多源融合的大规模临床生物医学知识图谱。
  • 样本来源:
    • 核心构建工具:PheKnowLator(Phenotype Knowledge Translator)框架;
    • 实体与关系:包含 28,811 个节点 与 178,320 条边;
    • 三类主体节点:
      • Person:来源于 Phenopacket Store 的真实患者病例临床观察记录;
      • Phenotype:来源于 人类表型本体 (Human Phenotype Ontology, HPO);
      • Disease:来源于 Disease Ontology (DOID) 与 Mondo Disease Ontology (MONDO);
    • 关系类型:包含纵向本体 SubClassOf 树、横向 HasPhenotype(患者与表型、疾病与表型)及待预测的核心诊断边 HasDisease。
  • 时间范围:2024–2026 年最新公开发布的生物信息学本体切片与临床病例库。
  • 样本量/案例数:覆盖千余名罕见病真实患者与数万级标准医学本体概念。
  • 数据局限:罕见病长尾稀疏性显著,部分罕见疾病仅有极个别已知患者案例。

研究结论

  • 主要发现 1:在纯生物医学本体分层子图(HPO 与 Disease 树)的链接预测中,双曲图卷积 (HGCN) 展现出压倒性的绝对优势,在极低维度 (d=4) 下即可取得大于 0.90 的 ROC-AUC,而欧氏模型最高仅能勉强达到 0.80。
  • 原文引用 1:

“The experimental results (see Figure 2) provide strong evidence for the advantage of the hyperbolic approach: HGCN consistently outperforms GCN and GAT, achieving ROC-AUC > 0.90 even with low-dimensional embeddings across both the Disease and HPO hierarchies. In contrast, the Euclidean models achieve at most a ROC-AUC of 0.8… Euclidean loss remains consistently higher, particularly in the Phenotype ontology…” (Page 8, Section 3.1)

  • 主要发现 2:在面向患者的真实临床鉴别诊断排序任务中,结合了关系自适应曲率与旋转/反射算子的双曲模型 AttH 在所有维度上全面超越欧氏对偶模型 AttE 以及深度模型 HGCN。 当维度达到 d=26d=26 时,AttH 取得全局最佳的 MRR、MR 与 Hits@10 成绩。
  • 原文引用 2:

“Figure 3 shows that AttH outperforms AttE and HGCN across embedding dimensions on all three metrics (MRR, MR, and H@10), with best results at d = 26… HGCN remains the weakest of the three across all dimensions and metrics, although its H@10 at d = 10 (0.459) nearly matches AttE (0.464).” (Page 9, Section 3.2)

  • 主要发现 3:揭示了混合几何异质图中的架构选型分水岭:当图谱从纯层级树扩展到包含海量横向临床关联的多关系图谱时,基于关系特定曲率与等距变换的浅层模型(AttH)展现出比未经关系细化约束的深层图卷积(HGCN)更强的推理稳健性。
  • 原文引用 3:

“These results confirm a clear advantage of the hyperbolic approach on hierarchical structured data and motivate its exploration on larger, mixed-geometry environments… Results suggest that hyperbolic embeddings can exploit biomedical hierarchical structure while supporting diagnostic reasoning over heterogeneous patient-level graphs.” (Page 1 & 8)

我的判断

  • 最有启发的点:
    1. 将双曲几何由纯算法评测推进到高价值的罕见病鉴别诊断真实场景:以往双曲文献多集中在 WordNet、引文网等玩具数据集,本文将其直接嵌入到真实的医学决策链条中,为计算机辅助医学推理提供了全新的几何视角;
    2. 回答了“混合几何图谱是否仍需双曲流形”的关键争论:实证表明,即便图谱中存在大量非层次横向关联,只要图谱的骨干网络(如医学本体)具备深层树状结构,双曲几何的低维高保真归纳偏置就能显著提升下游临床推理精度。
  • 可借鉴的方法:
    1. 采用 PheKnowLator 融合医学本体与患者多模态临床表型数据的图谱构建规范;
    2. 将鉴别诊断形式化为跨实体链接预测与候选排序的标准化评测协议;
    3. 利用 AttH 的关系特异性曲率 crc_r 解耦不同关系层次密度的方案。
  • 可继续追问的问题:
    1. HGCN 在全图诊断中表现不及 AttH 的主要原因在于其缺乏关系特异性参数化(单关系聚合),若将 R-GCN 的关系基底分解引入双曲图卷积(构建 Hyperbolic R-GCN),能否进一步战胜 AttH?
    2. 临床中患者症状往往随时间发生动态演进,如何将时序动态图表征引入双曲医学图谱?
  • 与我的研究关联:
    • 本文作为 2026 年最新前沿研究,将“树模型知识图谱”的理论(Poincaré、HGCN、AttH)在生物医疗与罕见病鉴别诊断这一极其注重层次分类的垂直领域中完成了深度的落地验证。
Built with LogoFlowershow