FoodTaxo:基于大语言模型生成食品分类体系

基本信息

项目内容
作者Pascal Wullschleger, Majid Zarharan, Donnacha Daly, Marc Pouly, Jennifer Foster, Georg Rehm, Yunyao Li (都柏林城市大学 ADAPT 研究所 / 瑞士卢塞恩应用科技大学 HSLU)
年份2025 (ACL 2025 Industry Track, July 28–30, 2025, Vienna, Austria)
来源Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track), pp. 784–803
主题基于大语言模型生成食品分类体系 (FoodTaxo: Generating Food Taxonomies with Large Language Models)
链接Fulltext Markdown · Zotero 条目 · Zotero PDF · DOI: 10.18653/v1/2025.acl-industry.55 · GitHub: wullli/foodtaxo

一句话摘要

针对食品科技工业界配方替代缺乏合适语料进行概念抽取、仅有一批分散食材词项的现实挑战,都柏林城市大学与瑞士 HSLU 团队基于 DSPy 框架与开源 Llama-3-70B,提出融合检索增强思维链、NLI 逻辑蕴含验证与智能回溯的分类树自底向上生成与补全系统 FoodTaxo,首次实现了在完全无种子树条件下的高自洽多层级分类树自主构建。

研究对象

  • 研究对象:食品配方工业领域的成分分类体系,以及广泛存在于自然语言(SemEval-Food, SemEval-Verb)、生物医学(MeSH)和通用知识库(Wikidata)中的树形层级图。
  • 核心问题:
    1. 语料匮乏与概念抽取失灵:传统分类树学习强烈依赖包含丰富上位词模式(Hearst patterns)的领域大语料,但在食品工业中,通常只有成分列表(如各种坚果、调味品),缺乏现成的专业教科书语料用于模式挖掘;
    2. 从零自底向上长树(Zero-seed Generation)的结构盲区:以往工作全部假设存在一个现成的“种子骨架树”,无法回答“当只有一批底层已知实体时,如何自发向上涌现出高阶抽象中间节点并连成树”;
    3. 大模型的语义幻觉与对称性误判:LLM 极其容易将“语义强相关性(Similarity/Co-occurrence)”混淆为严格的“上下位包含关系(Hypernymy is-a)”,且生成的概念往往发生自身指代或格式失控;
    4. 传统黄金标准评估的死板性:针对同一组叶概念,现实中完全可能存在多种不同切入视角但同样合理的合法分类树,依赖单一黄金标准比对会严重低估生成树的真实逻辑质量。
  • 研究情境/范围:跨越瑞士顶级食品企业 Betty Bossi 的真实工业配方树(CookBook)、公开食品科学树、超大规模动词语义树与医学主题词树共 5 大基准。

研究方法

方法概述

  • 方法类型:LLM 智能体流水线 (Prompt-based Agent) + 检索增强生成 (RAG) + 思维链推理 (CoT) + 自然语言推理 (NLI) 形式化过滤 + 声明式回溯 (Backtracking)。
  • 总体思路: 系统划分为两大核心模式:
    1. 基于上下文检索的分类体系补全(Completion Mode):
      • 轻量边检索:针对待插入概念 qq,利用 FastText 稠密词向量计算余弦相似度,召回树中最相关的局部有向亲子边;
      • 父节点生成 CoT 提示:以检索边为局部上下文,Prompt 引导 Llama-3 分步推理谁是 qq 的最直接父节点(要求必须落在已知候选池中,若不存在则返回 None);
      • 子节点归属 CoT 提示:检索出候选父节点名下的所有已知子节点,Prompt 引导模型裁决哪些子节点应当降级从属于新节点 qq;
      • 双重守卫(NLI 验证与回溯):调用独立的 NLI 模型检验定义与关系之间的单向蕴含性;基于 DSPy 设定 7 大断言规则,若失败则自动携带错误反馈重试至多 3 次;
    2. 无种子自底向上全树生成(Generation Mode):
      • 全局认知构想:从已知叶概念集合 QQ 中随机采样 100 个词,让 LLM 先写一段关于“未来分类体系宏观架构”的综述段落,确立领域世界观;
      • 递归式自下而上造树:循环遍历 QQ 中的词,调用补全算子为其推导父节点;允许模型自由创造词表中原本不存在的高阶抽象概念(如“核果类”、“游戏肉品”);
      • 概念队列自生长:一旦生成新的上位词,立即将其重新推入待处理队列 QQ,直到模型判定顶层节点的父节点为伪根节点 pr\mathbf{p}_r;
    3. 多维无参考质量评估(Reference-Free Evaluation): 引入概念相似度相关性(CSC,度量拓扑路径深度与语义正交内聚的相关度)与基于 NLI 的整树路径游走转移概率(NLIV-W 弱非矛盾性,NLIV-S 强必然蕴含性)。
  • 为什么用这种方法: 无需昂贵且容易灾难性遗忘的微调;借助 LLM 内部内化的庞大通识网络实现“无中生有”的概念归纳,并用外部逻辑模型(NLI)做物理闭环校验。

方法分析

  • 分析单位:食品与知识概念词元、有向上下位边、由(父节点、查询词、子节点)构成的三元挂载切片。
  • 关键变量/概念:
    • 自变量:已知实体词集 QQ、局部上下文边集合、FastText 词向量;
    • 核心参数:回溯上限次数 33、采样摘要数 100100、NLI 判定阈值;
    • 因变量/指标:三元组 Position-F1、Parent-F1、Wu & Palmer 路径相似度 (WPS)、概念相似度相关度 CSC、逻辑蕴含分数 NLIV。
  • 识别/推断逻辑: 如果一个词 BB 能够被表述为“BB 是一种 AA”,并且在自然语言推理任务中,BB 的词典定义能够作为充分前提严格推导出“BB 是 AA 的一种类型”,则确立 A→BA \to B 的有向边。
  • 具体步骤:
    1. 载入原始叶节点清单;
    2. FastText 建立局部候选向量索引;
    3. 运行 Listing 1 父节点推理 CoT 提示,产出父节点集合;
    4. 运行 Listing 2 子节点过滤 CoT 提示,确定挂载下位集;
    5. 检查 7 大约束(无自环、词数小于 6 等),若违背则触发 DSPy Backtracking;
    6. 若为从零建树模式,将新生成的抽象词放入待办队列继续递归,直到触碰伪根收敛。

核心公式与推导

  • 核心公式 1:Wu & Palmer 树拓扑路径相似度指标(Equation 1,Page 5):
WPS(ca,cb)=2⋅depth⁡(LCA⁡(ca,cb))∣p(ca)∣+∣p(cb)∣\text{WPS}(c_a, c_b) = \frac{2 \cdot \operatorname{depth}(\operatorname{LCA}(c_a, c_b))}{|p(c_a)| + |p(c_b)|}
  • 公式拆解 1:
    • 这条公式表示什么:定量度量分类树中任意两个概念节点 cac_a 与 cbc_b 在拓扑层级上的结构亲疏程度;
    • 其中关键符号分别代表什么:LCA⁡(ca,cb)\operatorname{LCA}(c_a, c_b) 为两节点的最低公共祖先节点,depth⁡(⋅)\operatorname{depth}(\cdot) 为从伪根到该祖先的边深度,∣p(ca)∣|p(c_a)| 和 ∣p(cb)∣|p(c_b)| 分别表示从伪根到各节点的总路径长度;
    • 这条公式对应方法中的哪一步:分类树补全效果评估的核心拓扑连续性打分基准。当两节点互为同胞兄弟时,WPS 逼近 1;当两者位于完全不同的根分支时,WPS 趋近于 0。

  • 核心评估公式 2:无参考逻辑完备性路径游走概率(Section 5.2,Page 6–7):
NLIV-W(T)=1∣Vleaf∣∑u∈Vleaf1∣p(u)∣−1∑i=1∣p(u)∣−1I[NLI⁡label(xi,xi+1)≠Contradiction]\text{NLIV-W}(T) = \frac{1}{|V_{\text{leaf}}|} \sum_{u \in V_{\text{leaf}}} \frac{1}{|p(u)| - 1} \sum_{i=1}^{|p(u)|-1} \mathbb{I} \left[ \operatorname{NLI}_{\text{label}}(x_i, x_{i+1}) \neq \text{Contradiction} \right] NLIV-S(T)=1∣Vleaf∣∑u∈Vleaf1∣p(u)∣−1∑i=1∣p(u)∣−1I[NLI⁡label(xi,xi+1)=Entailment]\text{NLIV-S}(T) = \frac{1}{|V_{\text{leaf}}|} \sum_{u \in V_{\text{leaf}}} \frac{1}{|p(u)| - 1} \sum_{i=1}^{|p(u)|-1} \mathbb{I} \left[ \operatorname{NLI}_{\text{label}}(x_i, x_{i+1}) = \text{Entailment} \right]
  • 公式拆解 2:
    • 这条公式表示什么:在完全没有真实人工标注树作为参考(Reference-free)的情况下,量化自动化生成树在逻辑事实上的无矛盾率与因果必然性;
    • 其中关键符号分别代表什么:p(u)=⟨x1,x2,…,xk⟩p(u) = \langle x_1, x_2, \dots, x_k \rangle 表示从根节点到叶节点 uu 的一条完整分类路径,前提文本为子类别的官方自然语言定义,假设文本为“xi+1x_{i+1} 是 xix_i 的一种”;NLIV-W\text{NLIV-W}(弱检验)统计全路径上非矛盾转移的比例,NLIV-S\text{NLIV-S}(强检验)统计绝对必然蕴含的比例;
    • 这条公式对应方法中的哪一步:从零自底向上生成树的语义合法性客观质检机制。

核心观点与发现

  1. 工业配方树上的绝对制霸: 在瑞士商业食品工业配方树 CookBook 上,完全未微调的开源 Llama-3-70B(Few-Shot)展现出极强大的领域适应性:
    • 综合 WPS 达到 0.9342,F1 达到 0.3327,全面击败经过监督训练的深度学习与提示微调 SOTA(TacoPrompt 为 0.2879,TEMP 为 0.2529,QEN 为 0.1868,TaxoExpan 仅 0.0272);
    • 在叶子节点挂载上,Llama-3 Few-Shot 的 F1 达到 0.4533(TacoPrompt 为 0.3933),表明在层级适中、先验知识丰富的领域,大模型能够完全替代监督微调分类器。
  2. 从零生成的逻辑鲁棒性可比拟黄金真树: 在仅输入底层叶子节点、完全无种子树的极端生成测试中(Table 5):
    • 在 SemEval-Food 上,模型自底向上自发长出的树,其无参考弱逻辑验证分 NLIV-W 高达 0.9726,甚至微幅超过了人类专家整理的真实黄金标准树(0.9641);
    • 在 MeSH 医学数据集上,生成的树其 NLIV-W 达到 0.8167(真实黄金树为 0.8502),CSC 语义正交内聚度达到 0.1051(优于黄金树的 0.0614),强力证明了其内部层级划分在语义几何上具有极高的辨识度。
  3. 大模型核心瓶颈:内部中间节点(Non-Leaf)的挂载极难:
    • 数据对比清晰揭示了一个系统性痛点:在所有模型中,非叶节点(Non-Leaf)的插入精度普遍低得惊人;
    • 例如在 SemEval-Food 上,所有模型非叶节点的 F1 普遍低于 0.10(TacoPrompt 为 0.0995,Llama-3 Few-Shot 为 0.0914,而叶节点 F1 分别高达 0.6434 与 0.4715);
    • 案例分析(Figure 2c)直观展现了该缺陷:大模型容易把属于同级的食材(如茴香 fennel、罂粟籽 poppy seed)错误地挂载到“调料 seasonings”下方的“成分 ingredients”等抽象中间词之下,反映出 LLM 对多层级抽象程度的细微差异判定存在模糊性。
  4. 消融机制的关键价值:
    • 移除 NLI 蕴含验证 会导致模型生成大量非 is-a 的概念关联(如将菜肴与原产地强行做亲子挂载);
    • 移除 DSPy Backtracking 回溯 会导致叶节点 F1 明显下降(从 0.4715 跌至 0.4184),证实了断言重试对纠正模型低级格式错误与自环具有关键防护作用。

创新点与贡献

  1. 确立无种子概念集自发长树的递归范式(Zero-seed Bottom-up Generation): 打破了以往必须依附既有种子树才能扩张的刚性约束,首次实现了仅凭借一批底层离散词汇、通过提示大模型自适应涌现高阶抽象节点自底向上建树的完整闭环。
  2. 工业级 DSPy 声明式检索-推理-校验-回溯工程链路: 将思维链提示、FastText 局部边检索、MNLI 逻辑蕴含验证与最多 3 次自我修正断言深度融合,大幅抑制了大模型在拓扑推导中的幻觉与语义对称性漂移。
  3. 开拓分类体系无参考(Reference-Free)质量评估标准: 摆脱了传统单一基准树刚性匹配的桎梏,系统化提出了兼顾几何区分度(CSC)与逻辑非矛盾蕴含(NLIV-W/S)的树图谱评价数学指标。
  4. 开源多领域高价值行业分类基准: 公开发布了来自欧洲顶级食品集团的第一手工业配方分类树(CookBook)及代码库,为垂直领域知识工程研究提供了真实宝贵测试集。

局限性与讨论

  • 作者指出的局限:
    1. 单一开源模型评测局限:受制于大规模提示工程的极高推理开销,实验主要在 Llama-3-70B 上展开,未系统横向对比 GPT-4o 或 Claude-3.5-Sonnet 等闭源最强模型;
    2. 任务导向性(Goal-orientation)的缺乏:当前建树主要遵循客观生物学/常识分类,未显式根据下游特定业务场景(如低碳替代或过敏原隔离)调整分类维度;
    3. 超深树上的性能退化:在深度高达 13 层的超大语义树 SemEval-Verb 上,大模型零微调少样本策略表现较差(F1 仅 0.0630),表明随着树规模爆炸,单纯依靠局部边检索的提示策略难以把握全局超深结构。
  • 客观批判性思考:
    1. 自顶向下与自底向上的割裂:ICON(Shi et al., 2024)采用了自顶向下与自底向上的对偶夹逼,而 FoodTaxo 纯粹采用自底向上生长,这正是导致其内部中间节点(Non-leaf)定位极其不稳的深层算法根源;
    2. NLI 模型的领域偏差:预训练 NLI 模型多在通用常识语料(MNLI/SNLI)上训练,面对高度专业的工业化合物或冷门食材时,往往无法给出精准的蕴含概率。

启示与应用

  • 对本知识库/本课题的直接价值: 当面对一个全新技术领域、手头只有数十篇前沿论文的关键词但完全没有成熟知识体系框架时,FoodTaxo 证明了“先让 LLM 构想整体宏观综述段落 →\to 检索相近局部边 →\to 双阶段思维链推导父子 →\to NLI 校验并回溯”能够在短时间内自动化梳理出可读性极高、逻辑自洽的初始文献分类树。
  • 可复用的技术资产:
    • 基于 DSPy 编写的 Parent/Child CoT 生成签名与验证断言代码;
    • 判定分类路径逻辑必然性的 NLIV-W/S 自然语言推理评估流水线;
    • FastText 轻量快速拓扑边检索与上下文格式化组件。

关键引用与原文溯源

  • 关于摆脱文本语料抽取、直接从已知概念自发长树的动因阐述(Page 1):

    "Classical taxonomy completion typically involves extracting concepts from a corpus. However, we suggest that it is often more practical to start with a set of known concepts and extend the set while establishing taxonomic relationships. We hypothesize that taxonomies can be iteratively generated using LLMs, without the need for traditional concept extraction…"

  • 关于大模型混淆对称相似度与层级包含关系的实证观察(Page 3):

    "We notice that sometimes an LLM will mistakenly interpret the meaning of a parent-child relation as a similarity relation and simply generate predictions of related parent or child concepts on the basis of their similarity… To mitigate this, we require that the description of the concept (premise) entails the relation (hypothesis) when passed through an natural language inference (NLI) model…"

  • 关于无参考指标验证生成树质量媲美真实黄金树的结论(Page 7):

    "Table 5 shows a comparison of our generation method against the gold standard… We can see that our reference-free scores are competitive with the gold standard and according to CSC even better on both datasets… NLIV-W of SemEval-Food reached 0.9726 vs 0.9641 on True taxonomy…"

  • 关于当前大模型在非叶内部节点定位上存在重大困难的客观诊断(Page 7 & 8):

    "Further, we notice that there are frequent erroneous classifications, which are not well captured by the metrics. Such issues likely stem from poor model performance on non-leaves… We conclude that for LLM-based taxonomy generation to reach practical utility, significant advances are still needed, particularly in the reliable placement of non-leaf concepts."

Built with LogoFlowershow