知识图谱综述 (Knowledge Graphs)
知识图谱综述 (Knowledge Graphs)
基本信息
| 项目 | 内容 |
|---|---|
| 作者 | Aidan Hogan, Eva Blomqvist, Michael Cochez, Claudia d’Amato, Gerard de Melo, Claudio Gutierrez, José Emilio Labra Gayo, Sabrina Kirrane, Sebastian Neumaier, Axel Polleres, Roberto Navigli, Axel-Cyrille Ngonga Ngomo, Sabbir M. Rashid, Anisa Rula, Lukas Schmelzeisen, Juan Sequeda, Steffen Staab, Antoine Zimmermann (智利大学、林雪平大学、阿姆斯特丹自由大学、巴里大学、罗格斯大学、维也纳经济大学、罗马第一大学、帕德博恩大学、RPI 等 17 位国际权威学者) |
| 年份 | 2021/2022 (ACM Computing Surveys, Vol. 54, No. 4, Article 71) |
| 来源 | ACM Computing Surveys (CSUR 2021), 135 pages / DOI: 10.1145/3447772 / arXiv:2003.02320 |
| 主题 | 知识图谱理论基础、模型、推理、学习与工业实践全景 (Comprehensive Foundations of Knowledge Graphs) |
| 链接 | Fulltext Markdown · Zotero 条目 · Zotero PDF · DOI: 10.1145/3447772 |
一句话摘要
本文是国际知识工程与语义网领域 17 位顶级学者联袂撰写的 135 页百科全书式综述,首次为“知识图谱(Knowledge Graph)”确立了包容性的权威统一定义,深入剖析了有向标号图与属性图等底层数据模型,系统对比了以本体/描述逻辑为核心的演绎知识(Deductive Knowledge)与以图嵌入/图神经网络为核心的归纳知识(Inductive Knowledge),并对知识图谱的生命周期(抽取、质量评估、补全精炼与发布)及海内外顶级工业实践给出了里程碑式的理论总结。
研究对象
- 研究对象:广义上的知识图谱(Knowledge Graphs, KGs)。
- 权威定义:
“We view a knowledge graph as a graph of data intended to accumulate and convey knowledge of the real world, whose nodes represent entities of interest and whose edges represent relations between these entities.” (Page 2) 知识图谱是一个用于积累和传递现实世界知识的数据图,其节点表示感兴趣的实体,其边表示这些实体之间的关系。
- 核心问题:随着 Google 2012 年正式提出 Knowledge Graph 概念,工业界(Facebook、Amazon、Microsoft、Uber 等)与学术界掀起研发狂潮,但长期存在定义混乱、语义学派(Semantic Web / RDF / OWL)与图计算/机器学习学派(Property Graphs / KGE / GNN)相互割裂的技术壁垒。亟需一套统一的概念框架,厘清知识图谱在数据模型、逻辑模式、符号推理、统计机器学习与数据质量治理维度的全貌。
- 研究情境/范围:跨越从上世纪 70 年代语义网络起源到现代深度图学习的半个世纪发展历程;涵盖开放网络知识图谱(Wikidata、DBpedia、YAGO、ConceptNet)与千万级至百亿级商业闭源企业图谱。
研究方法
方法概述
- 方法类型:理论全景综述 + 分类学结构化归纳 + 形式化逻辑分析与算法评述。
- 总体思路:
- 底层数据图(Data Graphs, Section 2):梳理有向边标号图(Directed Edge-Labelled Graphs / RDF 三元组)、属性图(Property Graphs / Neo4j 节点边属性键值对)以及关联图查询语言(SPARQL, Cypher);
- 模式、身份与上下文(Schema, Identity, Context, Section 3):探讨从无模式(Schema-flexible)、实体解析对齐(Entity Resolution /
owl:sameAs)到时空/溯源高阶上下文表征(RDF-star, Named Graphs); - 演绎知识推理(Deductive Knowledge, Section 4):阐述本体描述逻辑(Description Logics: , , / OWL 2)与规约规则(Datalog, SWRL),对比前向链接物化(Materialisation)与后向链接查询重写(Query Rewriting)的计算复杂性与完备性;
- 归纳知识学习(Inductive Knowledge, Section 5):全面梳理从平移距离模型(TransE, TransH, TransR)、双线性张量分解(DistMult, ComplEx)到图神经网络(GCN, R-GCN)与规则挖掘(AMIE);
- 图谱精炼与生命周期(Refinement, Section 6-9):定义知识图谱补全(KGC / Link Prediction)、实体对齐、噪声与矛盾清洗及开放数据发布准则(FAIR 原则);
- 工业落地与前沿展望(Practice & Future, Section 10-11):总结在搜索引擎、电商推荐、个人助理、生物医药风控中的应用瓶颈与神经符号融合趋势。
- 为什么用这种方法:只有打破“纯符号逻辑”与“纯深度学习”的偏见,将严谨的形式化演绎(用于确定性事实推演和概念树约束)与统计归纳(用于在海量不完备数据中预测未知链接)有机融合,才能构建可持续进化的高可用知识库。
方法分析
- 分析单位:图谱本体公理、事实三元组、节点与边嵌入向量、图查询执行计划。
- 关键变量/概念:
- 数据模型:;
- 形式化公理:如包含公理 (概念树的 Is-A 关系)、传递性 、反演性 ;
- 演绎推理模式:前向链接生成演绎闭包 ,后向链接通过一阶重写(First-order Rewritability)实时扩展查询;
- 归纳嵌入打分函数:,通过低维紧凑向量空间拟合实体关系的代数性质;
- 知识图谱精炼(KGC):预测缺失三元组 或修正事实错误。
- 识别/推断逻辑:
- 演绎闭包(Deduction):从肯定前提推导必然结论(例如已知 是 的子类, 是 的子类,则必然有 是 的子类);其优势是 100% 严谨且可解释,劣势是面对不完备现实数据无法泛化;
- 归纳学习(Induction):从高频共现模式推导概率性假说(例如大量事实显示 与 共享相似近邻,则推测它们存在关联);其优势是容噪且能发现潜在未知链接,劣势是可能产生常识幻觉。
- 具体步骤:
- 事实抽取与结构化清洗(NER、关系抽取、R2RML 关系数据库转图);
- 模式与本体建模(构建领域分类树与概念体系);
- 演绎推理扩展(运行 OWL Reasoner 生成显式闭包);
- 归纳嵌入与链路补全(训练 TransE/RotatE/GCN 预测缺失事实);
- 人机协同验证与知识发布。
- 核心公式/指标 1:演绎逻辑公理语义与归纳嵌入打分映射对比 (Deductive vs. Inductive Mapping)
- 公式拆解 1:
- 这组公式表示什么:直观对比知识图谱处理“关系与概念包含”的两大技术范式。演绎法通过形式化谓词逻辑建立绝对严格的真值传递;归纳法则通过连续空间中的代数向量变换将符号映射为几何连续流形中的能量距离。
- 其中关键符号分别代表什么: 为描述逻辑子类公理(分类树的核心算子); 为实体与关系的稠密嵌入向量; 为关系双线性变换矩阵。
- 这组公式对应方法中的哪一步:第 4 节演绎知识与第 5 节归纳知识的核心方法论抽象。
- 核心公式/指标 2:图神经网络多关系消息聚合算子 (Relational Message Passing)
- 公式拆解 2:
- 这条公式表示什么:在多关系数据图上通过图卷积迭代汇聚不同语义边上的邻居特征(即 R-GCN 的经典公式,综述在归纳图学习部分的核心代表算子)。
- 其中关键符号分别代表什么: 为实体 在关系 下的邻居集合; 为关系特定变换参数; 为局部归一化因子。
- 这条公式对应方法中的哪一步:第 5.1.3 节基于图神经网络的归纳知识表征。
- 方法优势:
- 极其广博而深厚的理论视野:将看似毫不相干的 RDF 语义网、Neo4j 图数据库、TransE 几何嵌入、GCN 图学习与企业级架构熔于一炉;
- 中立客观的权衡分析:清晰对比了各种技术路线在“表达力(Expressivity)”与“计算复杂度(Tractability)”之间的本质博弈;
- 标准术语与规范的奠基:为全球科研人员提供了学术界与工业界通用的规范交流词汇。
- 方法局限:
- 论文成文于 2021 年,未及涵盖 2023 年后大语言模型(LLM)与生成式 AI 对知识图谱构建与检索带来的范式革命(但其对神经符号结合的预见完全契合大模型与图谱的融合趋势);
- 篇幅浩瀚(135页),工程细节繁复,需要极高知识背景方能透彻领会。
数据来源
- 数据类型:全球文献库、开放标准数据集与开源/工业图谱库。
- 样本来源:
- 文献样本:详尽综述了 550 余篇高质量学术文献;
- 核心分析图谱:涵盖 Wikidata(1亿实体、10亿事实)、DBpedia、YAGO、WordNet、ConceptNet 等开放权威图谱;
- 工业系统:系统拆解了 Google Knowledge Graph、Microsoft Satori、Amazon Product Graph、Facebook Graph API、Uber Food KG 等顶级企业系统。
- 时间范围:正式刊发于 2021/2022 年 ACM Computing Surveys。
- 样本量/案例数:涵盖数百个图数据库、查询引擎与推理机 benchmark。
研究结论
- 主要发现 1:明确确立了知识图谱的统一定义,指出知识图谱必须在“承载真实世界实体关系的数据图”之上,具备“积累、演化并传递知识”的核心能力。
- 原文引用 1:
“Herein we adopt an inclusive definition, where we view a knowledge graph as a graph of data intended to accumulate and convey knowledge of the real world, whose nodes represent entities of interest and whose edges represent relations between these entities… Employing a graph-based abstraction of knowledge has numerous benefits in such settings when compared with, for example, a relational model or NoSQL alternatives.” (Page 1-2, Section 1)
- 主要发现 2:演绎知识(Deductive)与归纳知识(Inductive)构成知识图谱智能的一体两翼——演绎保证了由公理驱动的确定性与一致性,而归纳赋予了从高噪不全数据中泛化预测的生命力。
- 原文引用 2:
“Deductive methods can then be used to entail and accumulate further knowledge (e.g., 'Santiago is a city'). Additional knowledge – based on simple or quantified statements – can also be extracted from and accumulated by the knowledge graph using inductive methods… Scalable frameworks for graph analytics can be leveraged for computing centrality, clustering, summarisation, etc., in order to gain insights about the domain.” (Page 2, Section 1)
- 主要发现 3:知识图谱补全(Knowledge Graph Completion)是图谱持续演化的核心环节,平移距离模型(如 TransE)与图神经网络(如 R-GCN)打破了离散符号推理的脆弱性,构成了链接预测的主流支柱。
- 原文引用 3:
“A key goal of inductive techniques is knowledge graph completion: predicting missing edges in a knowledge graph based on existing patterns. Graph embedding techniques map entities and relations to a continuous vector space where algebraic operations can be used to predict novel relations.” (Page 32-35, Section 5)
我的判断
- 最有启发的点:清晰指出了“树与分类体系(Taxonomies/Hierarchies)”在整个知识图谱体系中扮演的**骨架支撑(Backbone)**角色。无论是 RDFS 的
subClassOf,还是 OWL 的描述逻辑概念包含,一切高级逻辑推理和关系约束,本质上都依赖于一棵干净、完备的领域层级树。这也完美解释了为什么在知识图谱研究中,“分类体系扩展(TaxoExpan/TaxoEnrich)”与“分类体系归纳(SPARROW)”具有如此决定性的基础地位。 - 可借鉴的方法:将知识图谱系统的研发划分为“数据图层 模式/本体层 推理/演绎层 嵌入/归纳层 质量精炼层”的模块化架构思路。在设计现代基于大模型或双曲几何的知识库时,依然应严格遵循这一分层解耦范式。
- 可继续追问的问题:在大模型时代,大语言模型(LLM)本身是否就是一个“巨型软性知识图谱”?在检索增强生成(GraphRAG)大行其道的今天,结构化知识图谱(尤其是确定性的树状层级)应当如何与大模型的参数化记忆实现最优的互补?
- 与我的研究关联:本论文是整个“树模型知识图谱”专题的总揽元综述。它像一座灯塔,清晰标定了专题内所有单篇论文的坐标:TransE 位于第 5.1 节平移模型;GCN 与 R-GCN 位于第 5.1.3 节图卷积网络;HGCN 与 Bio-HKG 延伸至非欧几何归纳表征;TaxoExpan、TaxoEnrich、BoxTaxo、FPLC 与 SPARROW 对应第 8 节本体树的结构精炼与补全;CLIP 与 CEL 对应多模态知识对齐。本综述是所有理论思考的出发点与归宿。