层级选择性分类
层级选择性分类
基本信息
| 项目 | 内容 |
|---|---|
| 作者 | Shani Goren*, Ido Galil*, Ran El-Yaniv (Technion 以色列理工学院、NVIDIA) |
| 年份 | 2024 |
| 来源 | Advances in Neural Information Processing Systems 37 (NeurIPS 2024) |
| 主题 | 层级分类体系下的选择性预测(HSC)、攀爬式不确定性回退与无分布假设的严格精度控制算法 |
| 链接 | NeurIPS 录用页面 / Zotero 条目 / 本地 PDF 全文 / 提取的全文 Markdown |
一句话摘要
针对传统选择性分类“非全即无”二元拒绝机制在细粒度不确定时浪费有用信息的痛点,本文提出层级选择性分类(HSC)框架,建立基于信息熵的层级覆盖度与风险理论,提出同时保证正确性与覆盖度单调性的“攀爬推断规则”(Climbing),并基于保形预测给出能在任意黑盒模型上以高概率满足目标精度的最优阈值搜索算法,在 ImageNet 1,115 个模型上全面超越基线并揭示 CLIP 预训练对层级推理的飞跃性赋能。
研究对象
- 研究对象:层级选择性分类(Hierarchical Selective Classification, HSC)。在具有树状拓扑关系 的多分类任务中(其中叶节点 为互斥的真实类别,内部节点为后代叶节点的并集,根节点 为所有类别的全集),分类器在输入不确定时允许自适应降低预测特异性(Specificity),输出拓扑树上置信度达标的高层级祖先概念,而非武断预测叶节点或彻底拒绝。
- 核心问题:现有模型部署于风险敏感型领域(如脑肿瘤诊断)时面临核心两难:
- 标准选择性分类的二元局限(Binary Shortcoming):传统带拒绝选项的分类器(Selective Classification)只能二选一——给出叶节点预测或者彻底弃权(Reject)。若模型对 3 种恶性肿瘤亚型各自给出 0.33 的置信度,设定阈值 0.5 时会被迫放弃报警,即使模型已 99% 确信这是“恶性肿瘤”;这种二元弃权忽略了高层概念的救命价值;
- 层级准确性与信息量的权衡缺失:在树结构中,将所有样本粗暴归为“根节点(生物/物体)”可以轻易获得 100% 的层级准确率,但这毫无信息量;需要一种能严格量化预测特异性(覆盖度)并全范围控制“风险-覆盖度权衡”的理论体系;
- 现有启发式搜索算法(如 DARTS)的脆弱性:现有方法无法严格保证测试集精度的置信区间,经常在严苛约束下极端崩塌为零覆盖度,且需要耗时的针对性调参。
- 研究情境/范围:跨越 ImageNet-1k(构建于 WordNet 树状体系之上)的 1,115 个现代主流视觉模型(涵盖 CNN、ViT、Swin、ConvNeXt 及 CLIP 系列),以及生物分类学细粒度树数据集 iNaturalist 2021(iNat21),并在覆盖度(Coverage)、层级风险(hAURC)、校准误差(ECE)及目标精度误差四个维度进行全面评估。
研究方法
方法概述
- 方法类型:理论形式化证明、非参数保形统计推断与超大规模实证研究。
- 总体思路:
- 层级风险与信息熵覆盖度形式化:定义预测只要命中真实叶节点的任一祖先即视为层级正确();利用后代叶节点数量的对数(信息熵 )相对于根节点熵的比值,定义严格递增的层级覆盖度 (根节点为 0,叶节点为 1);
- 攀爬推断规则(Climbing Inference Rule):基础分类器首先经过温度缩放(Temperature Scaling)校准叶节点概率,内部节点概率为后代叶节点概率之和;若最高置信度叶节点的得分低于阈值 ,模型沿树拓扑单调向上攀爬至其父节点,直至找到首个置信度不低于 的祖先节点;
- 推断规则的代数性质公理化:提出“正确性单调性”(提高阈值绝不会使原本正确的预测变错)与“覆盖度单调性”(提高阈值绝不会增加覆盖度);严格证明 Climbing 规则同时满足这两大公理,而现有的 Max-Coverage(MC)规则破坏了正确性单调性;
- 免微调最优阈值搜索算法(Algorithm 2):受分裂保形预测(Split Conformal Prediction)启发,在留出标定集上计算使每个样本层级正确的最小阈值分位数,理论证明在交换性假设下,算法输出的固定阈值 能以至少 的用户置信度严格控制测试集精度误差在 之内;
- 校准-覆盖曲线(CC-Curves):提出评估层级回退对不确定性置信度校准影响的全新可视化工具。
- 为什么用这种方法:攀爬规则从模型原本最擅长区分的最高概率叶节点出发,最大化利用了预训练判别器的先验,消除了全局搜索导致的拓扑越级突变;保形分位数统计保证无需重构损失函数或重训模型,即插即用赋能任意黑盒网络。
方法分析
- 分析单位:输入图像 、多分类树状图 以及自适应选取的预测节点 。
- 关键变量/概念:
- 节点祖先集合 与后代叶节点集合 ;
- 内部节点置信度 ;
- 节点信息熵 与层级覆盖度 ;
- 攀爬选择函数 ;
- 保形分位数秩次 。
- 识别/推断逻辑:将高风险细粒度误判通过层级树进行语义抽象化吸收。当模型对细粒度品种(如金毛 vs 拉布拉多)发生混淆时,其后验概率分散在相邻兄弟节点中;通过向父节点“猎犬/狗”回退,原本分散的叶概率在父节点聚合累加,置信度迅速越过阈值 ,从而在保留高度可用信息的同时消除误判风险。
- 具体步骤:
- 获取基分类器 对样本 的叶节点 Softmax 输出并执行温度缩放校准;
- 选定初始叶候选 ;
- 检验 是否小于预设阈值 ;若小于,令 并累加其子树概率;
- 重复攀爬直至概率达标或到达根节点(彻底弃权);
- 最优阈值通过在标定集上统计最小正确阈值数组并取对应分位数一次性离线解出。
核心公式与拆解
核心公式/指标 1:基于信息熵的层级覆盖度(Hierarchical Coverage)
用于数学化度量树模型预测结果所蕴含的信息特异性量级:
- 公式拆解 1:
- 表示内容:假设叶节点先验分布均匀,节点 覆盖的不确定性为其后代叶节点集合 的信息熵;层级覆盖度 为节点 消除的相对熵比例。
- 关键符号: 为节点 统辖的所有叶节点集合; 为整个分类树的所有叶节点全集; 为树的根节点。
- 对应方法步骤:覆盖度评估基准。根节点 ,(信息量为零,等价于彻底弃权);叶节点 ,,(最大信息特异性)。随着层级由根向叶深入,覆盖度从 0 连续单调上升至 1。
核心公式/指标 2:层级选择性风险与 hAURC(Hierarchical Selective Risk & Curve)
用于量化模型在给定覆盖度下的层级错误率及全局曲线面积:
- 公式拆解 2:
- 表示内容:若预测节点属于真实标签 的祖先集合 ,则损失为 0,否则损失为 1。层级增益(Hierarchical Gain)直接度量了相较于传统“非全即无”二元选择性分类模型(忽略树结构的 ),引入层级回退后风险-覆盖曲线下面积(hAURC)的相对削减百分比。
- 关键符号: 为包含 本身及其到根节点整条路径上的所有合法祖先;hAURC 越小代表在相同覆盖度下的风险越低。
- 对应方法步骤:模型选择性能力的全局综合评估,解决了单一工作点难以衡量全谱表现的难题。
核心公式/指标 3:攀爬推断规则(Climbing Inference Rule)
算法 1 的数学迭代形式化:
- 公式拆解 3:
- 表示内容:从分类器最自信的叶节点 开始判定;若当前节点的累积子树概率 达到阈值 ,则停止并输出该节点;否则递归向父节点回退。
- 关键符号: 为用户设定的置信度门限。
- 对应方法步骤:在线推理核心步。该算法保证了:当 时,若 下预测正确,提升阈值至 只会进一步向祖先回退,绝对不会脱离正确祖先路径(严格满足正确性单调性)。
核心公式/指标 4:最优阈值有限样本统计保证(Optimal Threshold Guarantee, Theorem 1)
基于保形推断的分位数逆映射阈值选取:
-
公式拆解 4:
- 表示内容:对标定集中每个样本,求解使其预测正确的最小必要阈值 ;将所有 从小到大排序后,选取第 个分位数作为测试期全局阈值 。定理 1 保证测试集上的真实精度与目标约束 的偏差在容差 内的概率不低于 。
- 关键符号: 为标定集样本数; 为目标精度(如 95%); 为置信水平(如 90%); 为分析给出的严密误差界。
- 对应方法步骤:离线校准步,彻底摆脱了传统调参对测试集分布的过拟合风险。
-
方法优势:
- 理论严密:首次在层级选择性分类中同时实现了覆盖度/正确性双重单调性与无分布假设的严格保形精度保证;
- 极高鲁棒性:在大规模 ImageNet 模型上运行无需修改网络权重,泛化表现优异;
- 彻底释放层级先验价值:消除了二元拒绝选项中高达数十个百分点的宝贵粗粒度信息流失。
-
方法局限:
- 假定类结构必须严格构成单父节点的有向树(Tree),若分类体系为多父节点的复杂有向无环图(DAG),父节点攀爬路径将出现分支歧义;
- 概率累加机制依赖于叶节点预测经过充分的温度校准,若底层基础模型存在严重的过度自信失真,子树概率累加仍可能发生过早截断。
数据来源
- 数据类型:计算机视觉经典通用图像分类与细粒度生物分类基准及层级词表。
- 样本来源:
- ImageNet-1k(Deng et al., 2011):基于 WordNet 层级拓扑组织的 1000 类通用图像,评估了 1,115 个来自 timm 与 torchvision 的预训练模型;
- iNaturalist 2021 (iNat21)(Van Horn et al., 2021):包含 10,000 个细粒度物种、具备完整生物分类阶元(界门纲目科属种)的超大型长尾层级树。
- 时间范围:NeurIPS 2024 权威测评协议。
- 样本量/案例数:ImageNet 验证集 50,000 张图像,iNat21 验证集 100,000 张图像;算法 2 评估中每个模型重复 1000 次独立随机标定测试(累计超过 1,115,000 次统计验证)。
- 数据局限:树拓扑为预设人工先验,未考虑现实中模糊分类体系下的跨分支交叠。
研究结论
- 主要发现 1:允许模型回退至高层级概念相较于传统二元拒绝带来了显著的性能飞跃;在 ImageNet 1,115 个模型上,Climbing 规则相较无层级感知的选择性分类基线取得了 14.94% 的平均层级增益(Hierarchical Gain),在 iNat21 上更是达到了 23.94%,其性能表现达到先前 Max-Coverage(MC)基线的两倍以上。
- 原文引用 1:
“Compared to the non-hierarchical selective baseline, hierarchical inference has a clear benefit. Allowing models to handle uncertainty by partially rejecting a prediction instead of rejecting it as a whole, proves to be advantageous; the average model is capable of leveraging the hierarchy to predict internal nodes that reduce risk while preserving coverage. Nonetheless, the differences remain stark when comparing the hierarchical inference rules. Climbing, achieving almost 15% hierarchical gain, outperforms MC, with more than double the gain of the latter.” (Page 7)
- 主要发现 2:最优选择性阈值算法(Algorithm 2)在目标精度控制的精准度与保留覆盖度上全面碾压现有最强基线 DARTS;在目标精度设定为 95%–99.5% 的极高可靠性要求下,DARTS 的覆盖度迅速崩溃至 13%–22%,而本文算法能够稳定维持两倍以上的有效覆盖度(26%–40%),且目标精度误差仅为 0.02%(DARTS 误差高达 0.40%–0.69%)。
- 原文引用 2:
“This property allows the model to provide a better balance between risk and coverage. Our algorithm is more inclined towards this trade-off, as it almost always achieves higher coverage than DARTS. This is particularly noteworthy when the target accuracy is high: while DARTS loses coverage quickly, our algorithm maintains coverage that is up to twice as high… Left: EVA-Giant/14. DARTS fails to meet the constraint, whereas our algorithm’s mean accuracy is very close to the target. Right: ResNet-152. While our algorithm has a near-perfect mean accuracy, DARTS rejects all samples, resulting in zero coverage.” (Page 7–8)
- 主要发现 3:预训练范式对模型的层级选择性能力具有决定性影响;在对 1,115 个模型的系统分析中,带有 Linear-probe 的 CLIP 多模态图文对齐模型展现出断层式领先,其 hAURC 相对增益突破 40%(显著优于普通 ImageNet21k 预训练的增益),且 Linear-probe CLIP 比零样本(Zero-shot)CLIP 表现出大幅提升的置信度排序与校准能力(相对跃升 45%)。
- 原文引用 3:
“CLIP exceptionally improves hierarchical selective performance, compared to other training regimes. Out of the methods mentioned above, CLIP, when equipped with a ‘linear-probe’, improves hierarchical performance the most by a large margin. As seen in Figure 4… CLIP achieves an exceptional improvement surpassing 40%. Further, its median improvement is almost double the next best methods, pretraining and semi-supervised learning.” (Page 8)
- 主要发现 4:层级选择性分类不仅降低了决策风险,还能天然显著改善模型的置信度校准能力(Calibration);Calibration-Coverage 曲线显示,随着覆盖度按层级回退释放,Climbing 规则下的预期校准误差(ECE)持续单调下降,全程显著低于平铺选择性分类。
- 原文引用 4:
“The results indicate that HSC not only improves risk, but also improves calibration, with the Climbing inference rule nearly always outperforming Selective.” (Page 9)
我的判断
- 最有启发的点:
- “优雅降级”比“生硬拒绝”更具商业与安全价值:很多实用 AI 系统在用户端最致命的问题不是不能回答,而是给出荒谬答案或者干脆报错拒答;如果视觉或文本系统在不确定时能够给出“我确定这是一只鸟,但我不确定是游隼还是雀鹰”,用户体验和安全性将获得质的提升;
- Climbing 算法的极简与单调性之美:许多复杂的工作尝试在树上做复杂的动态规划,而 Climbing 仅凭“沿最自信叶节点的父路径爬升”就严格锁定了“绝不把对的改成错的”这一硬核单调性,实证性能反而大幅击败了全局乱跳的复杂规则;
- CLIP 跨模态表征对层级理解的隐式增益:CLIP 的多模态预训练不仅学到了像素特征,更因为语言文本天然具有的上下位概括性(如描述中交替使用 puppy、dog、pet),赋予了视觉编码器天然的层级泛化偏置。
- 可借鉴的方法:
- 基于有限样本保形分位数的最优置信度阈值锁定:任何需要向用户交付“保证 95% 正确率”的树模型或级联大模型系统,都可以直接复用 Algorithm 2,只需极小的留出集即可求得具有严格概率保证的截断阈值。
- 可继续追问的问题:
- 本文假设树节点具有单一父节点;如果本体或知识图谱属于包含“多重继承”(如兼具‘武器’与‘文化遗产’属性的刀剑)的 DAG 网络,如何拓展 Climbing 规则以避免遍历爆炸?
- 与我的研究关联:
- 本文是“树模型知识图谱”从确定性图谱拓扑走向“不确定性鲁棒决策与校准评估”的奠基之作,对于树模型推理的置信度控制与拒答回退机制具有直接指导意义。