融合与独立协同:超复数驱动的鲁棒多模态知识图谱补全
融合与独立协同:超复数驱动的鲁棒多模态知识图谱补全
基本信息
| 项目 | 内容 |
|---|---|
| 作者 | Zhiqiang Liu, Yichi Zhang, Mengshu Sun, Lei Liang, Wen Zhang (浙江大学软件学院/计算机科学与技术学院、浙大-蚂蚁集团知识图谱联合实验室、蚂蚁集团) |
| 年份 | 2026 |
| 来源 | Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 27968–27983 (ACL 2026) |
| 主题 | 超复数(双四元数)驱动的多模态知识图谱表征学习、独立与融合模态共存架构(M-Hyper) |
| 链接 | DOI: 10.18653/v1/2026.acl-long.1289 / Zotero 条目 / 本地 PDF 全文 / 提取的全文 Markdown |
一句话摘要
针对多模态知识图谱中“融合范式导致模态专属信息丢失”与“集成范式缺乏细粒度交互”的固有缺陷,本文提出首个基于超复数代数的 M-Hyper 框架,将 1 个关系自适应融合模态与 3 个独立模态分别映射至双四元数的四个正交基上,利用哈密顿积同时实现平移与旋转几何变换下的全面跨模态协同交互,在大幅提升推理精度与鲁棒性的同时实现了极佳的计算与显存效率。
研究对象
- 研究对象:多模态知识图谱补全(Multi-Modal Knowledge Graph Completion, MMKGC),针对包含三元组关系与多模态实体特征(结构、文本、图像)的有向图谱 ,在链接预测任务中推断缺失事实 或 。
- 核心问题:现有 MMKGC 方法分裂为两大互有妥协的建模范式:
- 融合范式(Fusion-based):依赖固定的跨模态融合模块或对比损失将多模态压入单一向量。在融合过程中,模态独有的细粒度特征不可逆地丢失,且无法灵活适应不同推理上下文对特定模态的差异化倚重;
- 集成范式(Ensemble-based):通过为各模态训练独立的子模型并后期求和或门控投票来维持模态独立性,但这割裂了模态间的上下文动态交互,无法捕获复杂的跨模态语义依赖;
- 现实世界知识图谱的噪声与模态缺失:图谱中的多模态数据普遍存在信息不一致、视觉爬取偏差与多义性杂音,单一表征极易遭受噪声侵蚀导致决策崩溃。
- 研究情境/范围:涵盖 DB15K、MKG-W、MKG-Y 三大标准基准图谱,在严格的过滤排名协议(Filtered Setting)下系统评估 MRR、Hit@1、Hit@3、Hit@10、单轮耗时与显存占用,并与包括经典双线性模型、四元数模型、双四元数模型及最新大语言模型(K-ON)在内的 18 项基线进行全方位对比。
研究方法
方法概述
- 方法类型:理论代数建模、超复数几何表示学习与实证算法研究。
- 总体思路:
- 超复数双四元数代数基础(Biquaternion Algebra ):四元数由四个正交基底 构成,具备天然的线性独立性与非交换乘法性质;双四元数进一步将系数由实数域 推广至复数域 ,具备双倍的自由度与完备的旋转-平移几何表达能力;
- 细粒度实体表征因子分解(FERF):针对 3 个独立模态(结构 、视觉 、文本 ),将其表征分解为“模态专属子空间”(保留原始感知特质)与“任务特异子空间”(支持跨模态协同),并通过跨模态协作重构损失 强化互补表征;
- 关系感知鲁棒模态融合(R2MF):针对关系查询的动态需求,设计由关系平移和旋转向量引导的自适应温度门控网络,动态生成融合模态 ;同时引入高斯特征扰动与自蒸馏机制(),提高融合特征对抗输入噪声的鲁棒性;
- 四基底双四元数统一打分(Biquaternion Scoring):将 1 个融合模态 置于实部基底 1,将 3 个独立模态 分别置于虚部基底 ;实体关系运算通过加法 (平移)与哈密顿积 (旋转变换与全两两两模态交互)计算三元组匹配得分,联合 正则化进行优化。
- 为什么用这种方法:双四元数的四个正交基天然提供了让“1 个融合模态”与“3 个独立模态”和平共存且互不干扰的代数结构;哈密顿积可以在一次代数运算中直接展开出所有模态之间的全部两两交互项,无需构建沉重复杂的全连接多层注意力网络;高斯自蒸馏增强了网络在不完美现实多模态环境下的稳健性。
方法分析
- 分析单位:多模态实体表征向量、关系平移/旋转超复数与候选三元组 。
- 关键变量/概念:
- 双四元数实体嵌入 ;
- 模态专属嵌入 与任务特异嵌入 ();
- 关系感知权重系数 与关系温度系数 ;
- 关系平移嵌入 与旋转嵌入 ;
- 双四元数哈密顿积 与三元组评分 。
- 识别/推断逻辑:给定头实体 与关系 ,首先利用加法进行关系平移 ,随后利用哈密顿积进行非阿贝尔旋转 。根据四元数代数乘法规则,实部与虚部相互交叉相乘,使得融合模态与结构、视觉、文本之间,以及各独立模态之间两两产生代数耦合,最终与尾实体 计算内积打分。
- 具体步骤:
- 从预训练视觉(VGG)与文本(BERT)编码器提取特征,结构模态从头学习;
- 经过 FERF 模块分解并联合重构损失更新得到 ;
- 经过 R2MF 模块计算关系自适应加权并施加高斯扰动自蒸馏,输出融合模态 ;
- 组装为实体双四元数 ,每个分量为 维复向量(总长 );
- 关系施加平移与哈密顿旋转变换计算评分,以交叉熵与 正则化端到端训练。
核心公式与拆解
核心公式/指标 1:双四元数代数表征结构(Biquaternion Entity Representation)
将融合模态与独立模态分别对齐到超复数正交基底上:
- 公式拆解 1:
- 表示内容:实体 的嵌入被严谨构建为双四元数,包含 1 个实轴基底(赋值给关系自适应融合表征 )和 3 个虚轴基底(分别赋值给结构模态 、视觉模态 与文本模态 )。
- 关键符号: 为四元数的正交基底; 为复数域的虚数单位( 且与 可交换);每个系数分量 均为复数嵌入向量,整体实体嵌入向量总维度为 。
- 对应方法步骤:多模态实体表征组装步,从数学结构上杜绝了单一向量融合导致的模态专属特征湮灭,保障了独立特征与综合特征的完全并存。
核心公式/指标 2:细粒度协作重构损失(FERF Cross-Modal Reconstruction Loss)
用于约束任务特异表征在保留专属特性的同时学会跨模态协同互补:
- 公式拆解 2:
- 表示内容:要求当前模态 的任务特异嵌入 必须能够与其他所有模态的专属嵌入共同协作,通过多层感知机解码器 逆向重构出模态 自身的专属表征 。
- 关键符号: 为模态专属嵌入; 为任务特异嵌入; 为可学习的重构 MLP 映射; 表示除自身以外的其他模态。
- 对应方法步骤:实体因子分解阶段的自监督约束,迫使各模态的潜在特征空间建立深层的语义纽带。
核心公式/指标 3:关系感知自适应门控融合(Relation-Aware Gated Fusion)
用于动态权衡不同关系查询下各模态的显著度:
- 公式拆解 3:
- 表示内容:根据当前实体特征 以及查询关系 的平移与旋转嵌入,动态预测模态注意力权重,并引入关系特异的温度系数 进行 Softmax 锐化调节,最终线性加权并融合任务特异向量 。
- 关键符号: 为全连接网络; 为可学习的关系温度; 为生成的融合模态表征。
- 对应方法步骤:R2MF 模块的前向融合步,完美解决了固定融合策略无法应对关系语义差异的问题(例如预测“颜色”关系重视觉、预测“职业”关系重文本)。
核心公式/指标 4:双四元数几何变换与三元组打分函数(Biquaternion Scoring Function)
同时实现查询实体的平移旋转与跨模态哈密顿乘积:
-
公式拆解 4:
- 表示内容:头实体首先执行平移 ;随后与旋转关系 进行双四元数哈密顿积 。哈密顿积在代数层面展开为四元数乘法表,使得 4 个模态分量在复数域内两两全组合相乘(由结构常数张量 严格确定),最终与尾实体双四元数进行向量点积得出匹配分。
- 关键符号: 为基底分量对齐的复数相加; 为双四元数哈密顿乘法; 表示复数域内的标准乘法; 为正交基。
- 对应方法步骤:推理打分与损失计算阶段,实现了代数闭包下的全模态两两交互,且保持旋转平移不变性。
-
方法优势:
- 首创将超复数代数引入多模态图谱,从几何上统一了解耦表示、全通道交互与刚体运动变换;
- 计算极其高效,哈密顿积的非阿贝尔代数运算可在 GPU 上高度向量化并行,推理速度显著快于 Transformer 交叉注意力机制;
- 噪声蒸馏与分解机制赋予了模型优异的抗扰动稳定性。
-
方法局限:
- 双四元数乘法的非交换性对基底排列顺序具有代数敏感性,超参数搜索需覆盖复数维度的正则化项;
- 针对实体关联包含多张复杂图像或超长文档时的局部实体对齐尚未做细粒度切片。
数据来源
- 数据类型:多模态图谱链接预测基准数据集(实体、关系三元组、预抽取的 VGG-16 图像视觉特征、BERT 文本特征)。
- 样本来源:
- DB15K(Liu et al., 2019):来自 DBpedia,图像通过搜索引擎检索爬取;
- MKG-W(Xu et al., 2022):源于真实 Wikidata 多模态子图;
- MKG-Y(Xu et al., 2022):源于 YAGO 知识库子图。
- 时间范围:经典多模态知识图谱完成基准,沿用 ACL 2026 最新严格评测基线。
- 样本量/案例数:DB15K(12,842 训练三元组,14,780 实体,99 关系);MKG-W(15,000 实体,12 关系);MKG-Y(15,000 实体,16 关系)。
- 数据局限:所用模态特征为冻结特征抽取,未在图谱训练过程中进行端到端视觉分词微调。
研究结论
- 主要发现 1:M-Hyper 在三大基准数据集上全面刷新了多模态知识图谱补全记录,击败包括大模型增强算法(K-ON)与最新混合专家模型(MoMoK)在内的 18 项基线;在 DB15K 上 MRR 达到 41.25%(较先前 SOTA MoMoK 的 39.57% 提升 4.25%),Hit@1 达到 33.64%,展现出卓越的链接预测精度。
- 原文引用 1:
“M-Hyper outperforms 18 existing baselines on most metrics, including AdaMF and MoMoK, which also adopt modality noise enhancement. Specifically, M-Hyper achieves a 4.25% improvement in MRR and a 3.89% improvement in Hit@10, demonstrating significant performance improvements. Compared to the classic fusion-based and ensemble-based paradigm, M-Hyper not only preserves the original modality information but also enables dynamic and flexible modality interaction…” (Page 7)
- 主要发现 2:在模型效率与训练开销方面,M-Hyper 展现出压倒性优势;在 DB15K 上达到最优性能仅需 1160 秒的训练时间,单轮耗时与显存消耗在所有对比 SOTA 模型中均处于最优梯队。
- 原文引用 2:
“Compared to 6 state-of-the-art methods, our M-Hyper achieves the best training efficiency, requiring the shortest runtime for a single training epoch. In terms of memory usage, M-Hyper demonstrates nearly optimal performance. Figure 4(b) illustrates the training times required to achieve the best performances. Our model requires only 1160 seconds of training time to achieve an MRR of 40.75% and a Hit@1 of 33.14%.” (Page 7)
- 主要发现 3:消融实验证实,融合模态与独立模态的“共存与协同”缺一不可;移除融合模态 会导致性能出现最大幅度的暴跌(DB15K 上 MRR 由 41.25 断崖降至 36.36),而将双四元数退化为实四元数(去除复数旋转)也会带来显著退化。
- 原文引用 3:
“Notably, excluding the joint modality leads to the most substantial performance decline, highlighting its pivotal role in M-Hyper’s overall effectiveness… Notably, removing the rotation operation in complex field reduces hypercomplex space to a quaternion space and results in a performance decline, indicating that the biquaternion space offers greater expressive power.” (Page 7–8)
- 主要发现 4:代数与理论分析证明,M-Hyper 的打分机制在数学层面上完整涵盖了先前主流评分函数所缺失的“平移+旋转”复合几何变换以及“融合+独立模态全互作用项”,填补了多模态表征理论维度的拼图。
- 原文引用 4:
“Compared to existing MMKGC score functions, M-Hyper achieves the most comprehensive modality interaction and geometric transformation… As shown in Figure 3, it can achieve the most comprehensive modal interaction and geometric transformation (translation + rotation).” (Page 6)
我的判断
- 最有启发的点:
- 巧用抽象代数破解机器学习工程死结:过去大家总是在“全融合(丢失个性)”还是“各玩各的集成(缺乏交流)”之间左右摇摆;作者敏锐地发现四元数的正交基正好有 4 个(1 个实轴 + 3 个虚轴),恰好完美映射“1 个融合模态 + 3 个独立模态(结构/图/文)”,并利用哈密顿积天然的代数分配律在一次乘法中完成两两交叉运算,数学之美跃然纸上;
- 双四元数较之单四元数的表达跃迁:引入复数系数使模型同时具备空间旋转与缩放平移的完备几何群性质,为知识图谱复杂关系建模提供了强大先验。
- 可借鉴的方法:
- 基于正交代数基底的多源特征组织:在设计树模型节点表征或多模态知识库节点时,可以借鉴超复数基底解耦法,将全局拓扑编码与局部文本/视觉属性分别绑定于正交坐标轴,利用代数积实现零参数开销的高阶特征交叉。
- 可继续追问的问题:
- 双四元数维度固定为 4 基底。若知识图谱进一步拓展至 5 个或更多模态(例如引入代码、时序、音频),是否需要推广至八元数(Octonions,非结合代数)或克利福德代数(Clifford Algebra)?其计算稳定性如何保证?
- 与我的研究关联:
- 本文为“树模型知识图谱”在处理非对称关系、多模态节点对齐以及复杂关系模式(对称、反转、包含)的几何嵌入提供了坚实、优美且高效率的超复数理论底座。