先找父节点再标子节点:基于预训练语言模型的两阶段分类体系补全方法 (FPLC)

基本信息

项目内容
作者Fei Xia, Yixuan Weng, Shizhu He, Kang Liu, Jun Zhao (中科院自动化所模式识别国家重点实验室 NLPR / 中国科学院大学)
年份2024 (ACL 2024 Findings)
来源Findings of the Association for Computational Linguistics: ACL 2024 / arXiv:2406.17739v1
主题两阶段预训练语言模型分类体系补全 (Taxonomy Completion via Parent Finding and Multiple Children Labeling)
链接Fulltext Markdown · Zotero 条目 · Zotero PDF · arXiv:2406.17739

一句话摘要

针对传统分类体系扩展仅能添加叶子节点且无法修改既有层级关系的缺陷,本文提出 ATTEMPT 两阶段分类体系补全框架:第一阶段采用局部路径提示方法(PPT)激发预训练语言模型隐式上下位知识精确定位新概念的直接父节点,第二阶段采用多节点联合序列标注方法(MNL)同时判定并解绑重挂其所有的下属子节点,实现了层级树拓扑的端到端动态自适应插入与重构。

研究对象

  • 研究对象:以树状结构 T=(V,E)\mathcal{T} = (\mathcal{V}, \mathcal{E}) 形式存在的领域分类知识体系(Taxonomy),其中节点 v∈Vv \in \mathcal{V} 表示领域术语概念,边 e∈Ee \in \mathcal{E} 表示非对称的“上位-下位”(Hypernym-Hyponym / Is-A)泛化-特化关系。
  • 核心问题:随着领域前沿知识的演化,新涌现的概念往往并非最底层的叶子特化,而是居于中间层级的概括性或交叉性概念(例如“Social Science”应当插入在顶级“Science”之下,同时将既有的“Anthropology”与“Civics”收编为其子节点)。传统分类扩展(Taxonomy Expansion, TE)仅预测父节点,无法识别子节点;而既有分类补全(Taxonomy Completion, TC)通常保持既有边不变,无法调整原树的“父子变祖孙”拓扑,且高度依赖大量标注或外部检索语料。
  • 研究情境/范围:跨越环境科学(Environment, 261节点)、通用科学(Science, 429节点)与食品科学(Food, 1486节点)三大权威 SemEval-2016 体系,同时全面评测叶子节点挂载与非叶子节点插入任务。

研究方法

方法概述

  • 方法类型:两阶段混合深度学习模型(提示微调 Prompt Tuning + 序列标注 Sequential Labeling)与领域实证评测。
  • 总体思路:
    1. 问题分解:将复杂的“任意位置插入与重构”问题解耦为两个前后依赖的子任务:阶段一“寻找直接父节点(Parent Finding)”与阶段二“联合标注全部直接子节点(Children Finding)”;
    2. 阶段一(PPT:局部路径提示):放弃全树超长路径拼接,仅截取距离候选节点最近的局部路径节点 lp={ND−1,ND}l_p = \{N_{D-1}, N_D\},利用自然语言模板将其与待扩展概念 qq 组装为自然陈述句,输入 BERT 编码,利用动态语义重叠间隔损失(Dynamic Margin Ranking Loss)进行排序优化;
    3. 阶段二(MNL:多节点联合标注):对于候选父节点下的既有子节点与孙节点,摈弃传统的独立二元配对分类(Pair-wise Classification, PWC),将待插入概念与所有候选节点及其孙节点连接为全局统一提示句,使用预训练模型进行全局序列联合标注,显式利用兄弟与后代节点之间的相互依赖约束;
    4. 拓扑重构:若第二阶段识别到子节点集合,则在分类树中切断这些子节点与原父节点的边,重连至新概念,完成中间层级的真实插入。
  • 为什么用这种方法:预训练语言模型(PLM)在大规模自然文本语料上训练,其对语法连贯的自然语言蕴含关系(Prompt)的感知能力远强于人工分隔符(如 [SEP])拼接;此外,兄弟节点之间存在互斥与语义覆盖关联,联合标注能够有效消除独立分类产生的结构矛盾。

方法分析

  • 分析单位:待插入新概念 qq、候选分类树路径片段 PP、候选父节点 uu 及其局部的候选子节点群 Cu\mathcal{C}_u。
  • 关键变量/概念:
    • 局部路径节点:lp=local(P)={ND−1,ND}l_p = \text{local}(P) = \{N_{D-1}, N_D\};
    • 提示生成句子:SGen(q,lp)=Prompt(q,lp)S_{\text{Gen}}(q, l_p) = \text{Prompt}(q, l_p)(例如 "Social Science including Anthropology, and Anthropology including Archeology");
    • 动态路径间隔函数:γ(P,P′)=(∣P∪P′∣∣P∩P′∣−1)⋅k\gamma(P, P') = \left( \frac{|P \cup P'|}{|P \cap P'| - 1} \right) \cdot k;
    • 序列标注标签体系:yi∈{1(Child),0(Sibling),Ignore}y_i \in \{1 (\text{Child}), 0 (\text{Sibling}), \text{Ignore}\}。
  • 识别/推断逻辑:
    • 在阶段一,局部上下位关系的自然语言提示越符合真实事实,PLM 编码器输出的 [CLS] 匹配得分越高;
    • 在阶段二,待插入概念如果真实涵盖某一候选子节点,其不仅在语义上体现包含关系,而且该子节点的后代节点(孙节点)必须全部属于新概念的外延,联合提示将孙节点信息作为上下文能够提供强判别证据。
  • 具体步骤:
    1. Stage 1 (PPT 寻找父节点):为全树中所有潜在路径生成自然语言提示句 SGenS_{\text{Gen}},通过 BERT 计算路径得分 f(P)f(P),选取最高分对应的叶端节点作为预测的直接父节点;
    2. Stage 2 初始判定:判定待插入概念是否为叶子节点;若无任何合理下属概念,则结束流程(退化为叶子挂载);
    3. Stage 2 (MNL 标记子节点):将候选父节点的所有子节点与孙节点组织成全局提示,BERT 进行统一多标签序列分类;
    4. 树结构拓扑更新:建立边 (u,q)(u, q),若识别出子节点集合 Schild≠∅\mathcal{S}_{\text{child}} \neq \emptyset,则对每个 c∈Schildc \in \mathcal{S}_{\text{child}} 删除原边 (u,c)(u, c) 并新增边 (q,c)(q, c)。

  • 核心公式/指标 1:基于动态重叠度的自适应间隔排序损失 (Dynamic Margin Ranking Loss)
L=∑P∈P+∑P′∈P−max⁡(0,f(P′)−f(P)+γ(P,P′))\mathcal{L} = \sum_{P \in \mathcal{P}^+} \sum_{P' \in \mathcal{P}^-} \max\left(0, f(P') - f(P) + \gamma(P, P')\right) γ(P,P′)=(∣P∪P′∣∣P∩P′∣−1)⋅k\gamma(P, P') = \left( \frac{|P \cup P'|}{|P \cap P'| - 1} \right) \cdot k
  • 公式拆解 1:
    • 这条公式表示什么:在父节点路径检索阶段,要求正样本路径 PP 的打分 f(P)f(P) 必须高于负样本路径 P′P' 的打分 f(P′)f(P'),且两者之间的间隔边界根据两路径的拓扑相似度动态调整。
    • 其中关键符号分别代表什么:P+\mathcal{P}^+ 为树中真实存在的路径集合,P−\mathcal{P}^- 为负样本路径集合;∣P∩P′∣|P \cap P'| 为两条路径共享的祖先节点数;k∈[0.1,1]k \in [0.1, 1] 为间隔缩放调节系数。若两条路径在树深处才分叉(相似度高),重叠大,则惩罚间隔较小;若两条路径完全属于不同子树,重叠极小,则施加极大的间隔惩罚。
    • 这条公式对应方法中的哪一步:Stage 1 父节点匹配模型 PPT 的端到端判别训练。

  • 核心公式/指标 2:局部路径提示映射算子 (Taxonomy-Path Prompt Formulation)
lp=local(P)={ND−1,ND}l_p = \text{local}(P) = \{N_{D-1}, N_D\} SGen(q,lp)=Prompt(q,lp)S_{\text{Gen}}(q, l_p) = \text{Prompt}(q, l_p) Encoder⁡(SGen)=v[CLS]′,v1′,…,vw′\operatorname{Encoder}(S_{\text{Gen}}) = \mathbf{v}'_{[\text{CLS}]}, \mathbf{v}'_1, \dots, \mathbf{v}'_w
  • 公式拆解 2:
    • 这条公式表示什么:将树路径截断为与挂载点直接相关的 1~2 阶局部近邻,并通过自然语言模板将形式化的图路径转化为预训练模型最擅长理解的连贯文本序列。
    • 其中关键符号分别代表什么:NDN_D 为路径叶端锚点,ND−1N_{D-1} 为其直接父节点;Prompt(⋅)\text{Prompt}(\cdot) 为填词模板函数;v[CLS]′\mathbf{v}'_{[\text{CLS}]} 用于下游线性层计算路径兼容性匹配标量得分 f(P)f(P)。
    • 这条公式对应方法中的哪一步:Stage 1 中特征构造与 PLM 语义蕴含激发。

  • 方法优势:
    1. 首创中间节点插入与重构能力:突破了传统 TE 仅能“贴叶子”的根本限制,能自主修改原树的拓扑关系;
    2. 提示学习最大化释放 PLM 潜力:相比传统分隔符拼接,连贯的自然语言上下位陈述充分激活了 BERT 等模型在大规模预训练中积累的常识与世界知识;
    3. 联合序列标注消除结构矛盾:MNL 能够在一个上下文窗口中同时观测所有候选子节点与孙节点,避免了独立二分类导致的一对多不一致性。
  • 方法局限:
    1. 仍默认单父节点(Tree 结构为主),对于多继承 DAG 分类图谱(Multi-parent Taxonomies)尚未专门建模;
    2. 提示模板采用固定人工启发规则设计,缺乏对不同专业领域的自动化提示工程搜索。

数据来源

  • 数据类型:权威公开学术评测基准知识树。
  • 样本来源:SemEval-2016 Task 13 官方数据集,涵盖 Environment(环境学)、Science(通用科学)、Food(食品科学)三大领域分类体系。
  • 时间范围:论文发表于 2024 年(基准建立于 SemEval-2016)。
  • 样本量/案例数:
    • Environment:261 个节点,200 个叶子节点,最大深度 6;重构非叶子测试集包含 52 个叶子与 59 个非叶子;
    • Science:429 个节点,306 个叶子节点,最大深度 8;重构非叶子测试集包含 85 个叶子与 112 个非叶子;
    • Food:1486 个节点,1161 个叶子节点,最大深度 8;重构非叶子测试集包含 297 个叶子与 284 个非叶子。
  • 数据局限:仅支持英文领域分类树,单父节点占绝大多数(多父节点比例仅 1/3843),对超大规模图谱(十万级节点)的扩展效率有待进一步验证。

研究结论

  • 主要发现 1:在第一阶段父节点识别任务中,局部路径结合自然语言提示(PPT)显著压制了直接拼接长路径的 SOTA 基线 TEMP。
  • 原文引用 1:

“For leaf nodes, we improved the TEMP model by 8.2%, 6.7%, and 2.8% on Acc, MRR, and Wu&P, respectively. For all types of nodes, the improvement is 11.0%, 9.2%, and 6.4%, respectively.” (Page 8, Section 4.3)

  • 主要发现 2:在第二阶段子节点发现任务中,多节点联合序列标注(MNL)大幅超越传统的独立配对二分类(PWC),证明了联合建模局部结构与兄弟依赖的决定性价值。
  • 原文引用 2:

“For leaf nodes, the MNL method improves Acc and Avg(F1) by 21% and 20.3%, respectively, compared to the pair-wise classification method over the three benchmark datasets. For all type nodes, the improvement is 11.3% and 11.9%, respectively.” (Page 8, Section 4.3)

  • 主要发现 3:消融实验证实,局部孙节点信息的引入对子节点判定起到了不可替代的锚定作用。
  • 原文引用 3:

“Table 5 also shows that the MNL method decreases by 14.6% and 22.1% on average on accuracy and average F1 score, respectively, after removing the grandchild node information in the child finding stage… The individual nodes are closely associated in our MNL method.” (Page 8, Section 4.4)

我的判断

  • 最有启发的点:清晰揭示了“分类体系扩展 (TE)”与“分类体系补全 (TC)”的本质差距——TC 绝不是单纯给新概念找一个父节点就完事,而必须伴随既有子节点的识别与重新挂载(Rewiring)。这才是层级知识库动态进化的真实形态。
  • 可借鉴的方法:将图上的拓扑邻域(父、兄、子、孙)通过专门设计的提示函数转换为自然语言陈述,再利用预训练语言模型的掩码/分类头做联合序列标注(MNL)。这种“图结构提示化”方法在资源匮乏、缺乏海量图训练样本时极具实用价值。
  • 可继续追问的问题:若新插入概念需要分裂现有的子树,或者一个新概念同时拥有两个不同领域的交叉父节点(DAG 结构,如“Biochemistry”同时隶属于“Biology”与“Chemistry”),两阶段串行流水线是否会发生错误级联?如何设计端到端的联合强化学习或树生成解码器?
  • 与我的研究关联:本论文是“树模型知识图谱”专题下从纯图嵌入算法走向“预训练大模型 + 提示学习”进行树结构生长和修补的标志性工作,与前文的 TaxoExpan(局部图卷积)和 TaxoEnrich(双向预测)构成了从“GNN 图学习”到“PLM 提示学习”的完整演化闭环。
Built with LogoFlowershow