基于大语言模型从既有分类体系半自动构建层级分类树

基本信息

项目内容
作者Elham Motamedi, Inna Novalija, Luis Rei (斯洛文尼亚约瑟夫·斯特凡研究所 Jožef Stefan Institute)
年份2026 (Business & Information Systems Engineering / BISE 2026, 68(1): 35–57, Accepted Nov 2025, Published online Jan 2026)
来源Business & Information Systems Engineering, Springer, 23 pages
主题基于大语言模型从既有分类体系半自动构建层级分类树 (Semi-Automatic Hierarchical Taxonomy Creation from Existing Taxonomies with Large Language Models)
链接Fulltext Markdown · Zotero 条目 · Zotero PDF · DOI: 10.1007/s12599-025-00982-y

一句话摘要

针对现实中大型分类体系(如包含 25 万个类别的 CPC 专利树)粒度过细、长尾稀疏且手工精简极耗专家资源的问题,斯洛文尼亚国家研究所团队将 Nickerson 经典分类学设计科学范式与大语言模型结合,提出一套基于统计长尾判定与 LLM 语义合并的半自动层级抽象方法,在百万级专利分类中以极少人工开销达成了与纯手工精炼树完全一致的高水准性能。

研究对象

  • 研究对象:现实中已建立但因层级过深、类别过于庞杂而难以服务于下游具体任务的大规模层级分类体系(以包含 5 级层级、约 25 万个分类代码的合作专利分类法 CPC 为核心案例)。
  • 核心问题:
    1. 分类体系超精细粒度(Overly Detailed Granularity)的负面效应:随着树层级加深,底层类别语义高度重叠且样本呈极端幂律长尾分布,导致自动化分类器预测精度断崖式下跌,信息检索与知识追踪难以实用;
    2. 传统人工精炼的不可持续性:手工合并、抽象分类树依赖资深领域专家投入海量工时,且过程往往缺乏标准化记录、透明度低、无法复现;
    3. 传统机器学习与逻辑推理的高技术门槛:基于 SVM 节点剪枝、形式概念分析(FCA)或描述逻辑学习(DL-Learner)的系统要求对每个节点独立训练分类器或形式化编写逻辑规则,无法直接理解类目名称的丰富自然语言上下文;
    4. 固定层级截断的刚性缺陷:以往工作简单截断前两层(如固定取 Subclass 663 类),抹杀了不同成熟度学科在最佳粒度上的客观差异。
  • 研究情境/范围:全球专利大数据挖掘、技术创新追踪以及百万级多标签专利文本分类(涵盖机械、化学、电气、计算机、物理等 8 大核心人类知识领域)。

研究方法

方法概述

  • 方法类型:设计科学研究范式 (Design Science Research) + 统计长尾启发式探测 + 大语言模型 (GPT-4) 语义代理 + 人机协同双循环迭代 (Semi-Automatic Human-in-the-Loop)。
  • 总体思路: 适配信息系统领域公认的 Nickerson et al. (2013) 与 Kundisch et al. (2022) 分类树构建方法论,构建四阶段流水线:
    1. 明确问题与动因:专家界定目标用户(创新学者、政策制定者)与核心用途(创新追踪与文档分类);
    2. 定义目标与元特征 (Meta-characteristics):选定以“知识领域 (Knowledge fields)”而非“产品功能”为观察视角,确立客观终止条件(单轮无新合并)与主观终止条件(叶节点总数小于 100);
    3. 层级设计与抽象迭代(核心设计):
      • 第一阶段(视角对齐过滤):Prompt 驱动 GPT-4 审核原始节点是否符合“知识领域”元特征,过滤掉 41 个纯产品向琐碎类目(如假发、帽子、手枪);
      • 第二阶段(统计长尾驱动的同胞合并):在真实语料中统计各节点挂载文献量,依据均值与方差构建动态长尾阈值 ss;对低于阈值的长尾节点,Prompt 驱动 LLM 判定其与哪个同胞兄弟存在知识重叠,若重叠则执行合并并让 LLM 归纳生成不超过 10 个词的更高阶代表性类名;
      • 第三阶段(小类别向父级晋升合并):若迭代后叶节点数仍超标,将同胞中最孤立微小节点提升并入父级,重新触发长尾平衡;
    4. 下游实用性实证评估:使用 DistilRoBERTa 训练百万级多标签分类器,对比手工精炼树与模型抽象树在 Micro-F1、Macro-F1 及表征空间簇内簇间相似度上的表现。
  • 为什么用这种方法: LLM 具备极其广博的世界常识与上下文理解力,能充当低成本的“概念语义仲裁员”,无需在每个节点训练机器学习模型;而统计长尾阈值与专家设立的元特征 Prompt 则为 LLM 提供了强有力的几何与逻辑约束,避免大模型幻觉与发散。

方法分析

  • 分析单位:CPC 分类树中的类目节点 ci∈Cc_i \in \mathcal{C}、父子有向边 (ci,cj)∈R(c_i, c_j) \in \mathcal{R}、节点文献挂载频次。
  • 关键变量/概念:
    • 自变量:节点文献计数值、同胞集合 Siblings(c)\text{Siblings}(c)、同层集合 Level(c)\text{Level}(c);
    • 核心算法参数:长尾离差因子 n=1n=1、长尾门限 ss、叶节点上限门限 100100;
    • 因变量/评估指标:层级数、平均叶节点路径长、多标签分类 Micro-F1 / Macro-F1、簇内余弦相似度 (Intra-similarity)、簇间余弦相似度 (Inter-similarity)。
  • 识别/推断逻辑: 文献数量极少的底层细分分支代表该方向技术积累较少或属于早期/边缘探索,在宏观任务中单独设类会带来严重的模型过拟合与数据稀疏;如果 LLM 判定其与某个大同胞属于同一知识领域的细化分支,则两者的合并不仅能消除类目冗余,还能通过数据聚合提升特征表达的稳健性。
  • 具体步骤:
    1. 通过 BigQuery 抓取并利用 MinHash LSH 清洗去重 131 万篇专利,统计 CPC 各节点文献数;
    2. 运行 Prompt 对齐过滤,剔除 41 个偏离元特征的异质节点;
    3. 执行 Algo 1:计算长尾阈值 ss,对长尾候选词询问 GPT-4 是否与兄弟合并,若合并则生成新 label;
    4. 重复 Algo 1 直至没有新合并发生;
    5. 检查叶节点总数:若 ≥100\ge 100,执行 Algo 2 将最小子节点向父级提升,回退到 Algo 1 继续平衡;
    6. 产出最终 3 层 93 节点分类树,训练 DistilRoBERTa 验证下游分类指标。

核心公式与推导

  • 核心公式 1:动态长尾候选类目统计判定门限(Equation 1,Page 11):
s=max⁡S∈{Siblings,Level}(μ(S)−n⋅σ(S))s = \max_{S \in \{\text{Siblings}, \text{Level}\}} \left( \mu(S) - n \cdot \sigma(S) \right)
  • 公式拆解 1:
    • 这条公式表示什么:度量某一节点在其所属局部同胞群体(Siblings)或全局同层级群体(Level)中是否处于极端低频的长尾分布;
    • 其中关键符号分别代表什么:SS 表示参考候选集合,μ(S)\mu(S) 为该集合中各节点文献计数的算术平均值,σ(S)\sigma(S) 为文献计数的标准差,nn 为可调节的离差标量因子(论文取 n=1n=1 对应一倍标准差);
    • 这条公式对应方法中的哪一步:在 Algo 1 迭代开始前,对全树节点进行自动化长尾打标。取同胞组与同层级组两者的最大值 max⁡\max,确保只要一个节点在同胞中或在全层中暴露出低频特征,均能被灵敏捕获并送入 LLM 裁决池。

  • 核心公式 2:表征空间簇内与簇间语义一致性比率(Section 5.2,Page 19 & Table 7):
Ratio=Average Inter-similarityAverage Intra-similarity=1∣C∣(∣C∣−1)∑i≠jsim⁡(zˉi,zˉj)1∣C∣∑i1∣Di∣(∣Di∣−1)∑u,v∈Di,u≠vsim⁡(zu,zv)\text{Ratio} = \frac{\text{Average Inter-similarity}}{\text{Average Intra-similarity}} = \frac{\frac{1}{|\mathcal{C}|(|\mathcal{C}|-1)} \sum_{i \neq j} \operatorname{sim}(\bar{\mathbf{z}}_i, \bar{\mathbf{z}}_j)}{\frac{1}{|\mathcal{C}|} \sum_{i} \frac{1}{|D_i|(|D_i|-1)} \sum_{u, v \in D_i, u \neq v} \operatorname{sim}(\mathbf{z}_u, \mathbf{z}_v)}
  • 公式拆解 2:
    • 这条公式表示什么:评估精炼后的分类树各类别在语义向量空间中的几何区分度。优秀的分类体系应当具备“簇内高内聚、簇间高离散”的特性,即分子(不同类别间的平均距离)尽可能小,分母(同类别内部文档间的距离)尽可能大,从而使整体比率越低越好;
    • 其中关键符号分别代表什么:zu\mathbf{z}_u 为经 DistilRoBERTa 最后一层提取并归一化的文档向量,zˉi\bar{\mathbf{z}}_i 为类别 ii 的质心向量;
    • 这条公式对应方法中的哪一步:分类树结构合理性的表征几何验证。

  • 核心流程:长尾合并与父级晋升算法逻辑(Algo 1 & Algo 2,Page 10–12):
# Algo 1: 长尾兄弟合并迭代
while not objective_ending_condition:
    for node in candidate_nodes:
        if doc_count(node) < threshold(node):
            siblings = get_siblings(node)
            decision = LLM_Prompt_Merge_Decision(node, siblings, meta_char="knowledge fields")
            if decision.merge == True:
                target_sibling = decision.target
                new_label = LLM_Prompt_Generate_Label(node, target_sibling)
                merge_nodes(node, target_sibling, new_label)
                update_counts_and_thresholds()

# Algo 2: 向父级晋升合并
if num_leaf_nodes >= 100: # 主观终止条件未达成
    smallest_leaf = find_smallest_count_sibling()
    merge_upward_to_parent(smallest_leaf)
    goto Algo 1 # 重新触发平衡

核心观点与发现

  1. 结构指标显著优化: 从原始 CPC 的 5 级层级、606 个初筛第三级类目出发,通过半自动抽象:
    • 最终产出仅包含 3 个层级(Level 1: 8 类,Level 2: 48 类,Level 3: 36 类),共 93 个叶节点;
    • 相比手工耗时构建的 4 层 83 类树,模型抽象树的平均叶节点路径从 3.0 缩短至 2.3,每父节点平均子节点数为 6.6(手工树为 6.0),展现出极为相似的拓扑结构与分支平衡度。
  2. 下游分类性能全面媲美专家手工树: 在超过 131 万篇专利的大规模 DistilRoBERTa 多标签分类测试集上(Table 6):
    • Micro-F1:LLM 抽象树达到 0.70,手工专家树为 0.71(性能差异仅 0.01);
    • Macro-F1:LLM 抽象树达到 0.87,反超手工专家树的 0.86;
    • 在验证集上,两者的 Macro-F1(均为 0.93)与 Micro-F1(0.90 vs 0.91)几乎完全重合。
  3. 在中小长尾类别上的分类均衡性更优: 四分位数细分分析(Fig. 4)发现,无论是手工树还是自动树,小类别与中等类别的 Macro-F1 中位数均高于大类别;但 LLM 抽象树在小类与中类之间的 F1 离散度更小(Disparity smaller),表明统计长尾阈值与 LLM 语义合并有效修复了罕见类别的样本贫瘠问题。
  4. 语义几何边界的高保真对齐: 表征空间距离度量(Table 7)显示,LLM 抽象树的簇内平均相似度为 0.60(手工树为 0.60),簇间相似度为 0.17(手工树为 0.18),簇间/簇内比率为 0.28(手工树为 0.30),证实大模型抽象出的概念具有极高的语义外延清晰度与边界独立性。

创新点与贡献

  1. 设计科学与大语言模型的深度方法论融合: 首次成功将信息系统领域的经典分类学构建方法(Nickerson / Kundisch 框架)改造为支持大模型半自动执行的流水线,打通了概念建模形式化流程与大模型提示工程的壁垒。
  2. 数据规模信号驱动的自适应长尾合并机制: 创造性地以文献挂载量作为领域发育程度的度量代理,通过结合同胞与同层统计分布的动态门限公式(Equation 1),使大模型的介入时机客观、精准、可控,避免了对整树盲目调用 API。
  3. 双重终止条件驱动的多轮向心抽象算法: 设计了由“无新合并产生”的客观终止条件与“叶节点数量上限”的主观终止条件联立驱动的双循环结构,配合叶节点向父级晋升机制(Algo 2),保障了抽象粒度能够精确收敛至用户预期的认知负荷范围。
  4. 全透明、可复现、强文档化的开放基准资产: 彻底改变了以往人工分类树构建“黑盒化、无评估、不可溯”的弊端,开源了完整的 Prompt 模板、中間每轮合并决策日志、CPC 创新分类树以及百万级分类评测管道。

局限性与讨论

  • 作者指出的局限:
    1. LLM 语义漂移与单次调用方差:在处理极端边缘长尾或定义模糊的概念时,LLM 可能会出现不一致推理,研究未对同一合并决策进行多次采样一致性检验(Agreement quantification);
    2. 跨领域泛化实证的单一性:案例分析集中于 CPC 专利体系,对于医学(MeSH)或金融(SIC)等不同书写规范的分类法,统计门限因子 nn 可能需要重调;
    3. 分类器未显式融合树拓扑:下游验证仅采用扁平多标签分类器(DistilRoBERTa + Sigmoid),未利用层级分类网络(如 Tree-CNN)显式利用树的有向路径损失。
  • 客观批判性思考:
    1. 对预标注数据统计量的依赖:该方法要求初始粗树必须拥有足够量级的已归档文档(以此计算挂载频次),对于纯概念、无挂载实例的纯逻辑冷启动本体,该长尾统计机制将无法启动;
    2. 人类专家的隐式兜底作用:实验中专家对 GPT-4 的初筛结果进行了二次复核(虽然未作修改),说明在涉及高精尖行业准则时,完全无监督的“全自动”闭环仍存在安全顾虑。

启示与应用

  • 对本知识库/本课题的直接价值: 本课题在整理“树模型知识图谱”相关研究时,往往面临不同学者提出的子模型类别过多、层次混乱的困扰。这篇论文给出了标准解法:先由人类指定元特征(如“核心推理机制”),统计各子类论文篇数,借助大模型将篇数极少的相近方法归并入主流方法,并重新生成高阶代表性标签,从而自动生成精简优美的综述知识树。
  • 可复用的技术资产:
    • 基于均值与标准差的类目长尾过滤判定公式与代码;
    • 引导大模型进行语义重叠裁决、类目合并以及 10 词以内抽象命名的标准化 Prompt 模板;
    • 簇内/簇间余弦相似度几何质量验证评估脚本。

关键引用与原文溯源

  • 关于超细粒度分类树导致分类性能崩溃的论述(Page 2):

    "Fine-grained classes in taxonomies are typically defined by domain experts based on subtle distinctions within specific groups. As the hierarchy deepens, it becomes increasingly difficult to identify distinctive features that reliably characterize objects at lower levels… predictive accuracy suffers due to the many classes and semantic similarity among them."

  • 关于本方法轻量级优势对比传统重型 ML 的辩护(Page 2 & 4):

    "In contrast to prior semi-automatic abstraction approaches that require training a classifier at each node, which can be computationally intensive… our method uses class size as a lightweight signal and leverages LLMs for group merging and label generation, without requiring embeddings, classifiers, or external resources…"

  • 关于统计长尾门限公式与参数灵活性的定义(Page 11):

    "Our threshold formula provides an objective way to identify long-tail groups by subtracting n⋅σ(S)n \cdot \sigma(S) from the average size of related groups… The parameter nn can be tuned based on the desired level of abstraction… This flexibility ensures the method can adapt to different taxonomies…"

  • 关于下游分类结果完全媲美人类专家手工树的实证总结(Page 17):

    "The classifier using the taxonomy generated by the proposed method performed comparably to the manually created taxonomy (i.e., Micro-F scores of 0.70 vs. 0.71 and Macro-F1 scores of 0.87 vs. 0.86). Moreover, both taxonomies exhibited similar structural features and groups."

Built with LogoFlowershow