探索情感树:面向多模态情感识别的层级双曲检索增强生成

基本信息

项目内容
作者Zeheng Wang, Bo Zhao, Yijie Zhu, Zhishu Liu, Hui Ma, Ruixin Zhang, Shouhong Ding, Qianyu Xie, Zitong Yu (大湾区大学信息科学技术学院 / 腾讯优图实验室 / 香港中文大学(深圳))
年份2026 (arXiv:2605.18884, May 2026)
来源arXiv preprint arXiv:2605.18884v1
主题层级双曲检索增强生成与多模态情感识别 (Hierarchical Hyperbolic RAG for Multimodal Emotion Recognition)
链接Fulltext Markdown · Zotero 条目 · Zotero PDF · arXiv:2605.18884

一句话摘要

针对多模态大语言模型在情感识别中将情感类别视为扁平孤立标签、缺乏外部事实支撑且极易被跨模态噪声误导产生幻觉的问题,大湾区大学与腾讯优图团队提出 HyperEmo-RAG:将心理学情感分类树与多模态输入共同嵌入连续庞加莱双曲空间,通过由粗到细的束搜索深思式检索锁定细粒度情感路径,并将检索证据组装为**深思证据图(DEG)**经由树感知注意力和 EmotionGraphFormer 蒸馏注入冻结的大模型提示前缀,显著刷新中英文情感识别与对话情感分析 SOTA。

研究对象

  • 研究对象:基于多模态大语言模型(Multimodal Large Language Models, MLLMs)的人类情感理解系统,涵盖多模态情感分析(Multimodal Sentiment Analysis, MSA)与多模态对话情绪识别(Emotion Recognition in Conversation, ERC),协同处理文本(Text)、语音(Audio)与面部视频(Video)三向异构时序信号。
  • 核心问题:
    1. 扁平标签与心理学层级分类学的结构失配:人类心理学中的情感并非孤立离散的平行概念,而是呈现出从粗粒度基础倾向(如“喜悦 Joy”)到细粒度复合状态(如“狂喜 Ecstasy”、“欢愉 Cheerfulness”、“逗乐 Amusement”)的严密树状分类体系(如 Plutchik 情绪轮)。现有大模型直接做平坦多分类,无法辨析语义相近的近邻情感边界;
    2. 跨模态冲突与参数化记忆导致的幻觉(Hallucination):情感表达往往伴随言不由衷、微表情瞬态冲突或声调反讽,仅依赖大模型内部静态参数记忆极易过度解读局部噪声,诱发置信度虚高但事实错误的判断;
    3. 传统单轮多模态 RAG 的结构缺失:现有多模态检索增强方法大多采用“单步检索-直接拼接”范式,把检索出的样本视为无序记忆池,破坏了情感概念与证据之间的层级从属关系,无法实施从粗到细的多步审慎推理。
  • 研究情境/范围:跨越两项主流英文基准(CMU-MOSEI、MELD)与两项高难度中文基准(CH-SIMS v2.0 包含微弱情感区间评测、CHERMA 包含微表情与对话双模态评测),覆盖连续情绪得分回归(-3 到 +3)与离散多类别分类(如 7 分类)。

研究方法

方法概述

  • 方法类型:双曲流形连续嵌入 + 树搜索深思检索 + 结构化图 Transformer 蒸馏 + 冻结大模型提示学习(Prompt Tuning)。
  • 总体思路:
    1. 层级双曲基底构建(Hierarchical Hyperbolic Grounding):基于心理学情绪轮构建层级情感树 T\mathcal{T},并在庞加莱球(Poincaré Ball)中为各情感节点赋予可学习的概念原型 pn\mathbf{p}_n;同时将当前输入的音、视、文特征映射至同一双曲流形切空间进行自适应加权融合,生成多模态样本查询 qX\mathbf{q}_X;
    2. 由粗到细的束搜索深思检索(Hierarchical Deliberation):从情感树的顶层粗粒度概念出发,计算样本查询与概念原型的双曲测地线距离,保留少量候选分支;逐层向下展开至细粒度叶节点,并在选定分支中根据模态解耦的双曲距离从外部知识库检索最匹配的多模态证据项;
    3. 深思证据图(DEG)构建与树感知编码:将检索出的细粒度证据节点与支撑的概念原型节点连接为结构化图 G=(V,E)\mathcal{G}=(\mathcal{V},\mathcal{E});引入节点类型与层级位置嵌入,并施加拓扑邻接掩码(Tree-Aware Attention),严防无连接节点之间的无关信息混叠;
    4. EmotionGraphFormer 标记蒸馏与前缀注入:设计 QQ 个可学习图查询向量,通过交叉注意力与自注意力将变长图表征压缩蒸馏为固定长度的证据标记 Zg\mathbf{Z}_g,与任务 Prompt 拼接后送入冻结的大语言模型(如 ChatGLM3-6B、LLaMA2-7B 或 Qwen-1.8B);
    5. 几何与路径双重正则化协同训练:冻结主干 LLM,联合优化多模态编码器、双曲投影层、图转换器与提示层,引入树距离感知对比损失 Lcont\mathcal{L}_{cont} 与检索路径一致性损失 Lpath\mathcal{L}_{path}。
  • 为什么用这种方法: 双曲空间的体积随半径呈指数级爆炸式增长,能够以极低失真(Low Distortion)完美容纳树状分层结构;层级深思式检索有效阻断了一步式检索中的噪声雪崩;图结构注意力避免了将结构化证据强行压平为自然语言文本导致的拓扑信息失真。

方法分析

  • 分析单位:多模态情感视频片段 X={xa,xv,xt}X = \{x_a, x_v, x_t\}、情感层级树节点 n∈Tn \in \mathcal{T} 与深思证据图 G\mathcal{G}。

  • 关键变量/概念:

    • 自变量:音视频与文本欧氏特征 ha,hv,ht\mathbf{h}_a, \mathbf{h}_v, \mathbf{h}_t、外部情感图谱记忆库 K\mathcal{K};
    • 因变量:大语言模型自回归生成的细粒度情感类别或情感连续标量值 y^\hat{y};
    • 核心状态量:庞加莱球切空间原点映射 Exp0/Log0\text{Exp}_0 / \text{Log}_0、双曲概念原型 pn\mathbf{p}_n、样本多模态查询 qX\mathbf{q}_X、深思证据图掩码矩阵 M\mathbf{M}、蒸馏图标记 Zg∈RQ×d\mathbf{Z}_g \in \mathbb{R}^{Q \times d}。
  • 识别/推断逻辑: 先判定全局宏观情感极性分支(如正面、负面、中性),再在分支下推演二级情绪类别(如悲伤、恐惧),最终落地为三级细粒度状态(如绝望、落寞),同时调取外部相似案例的特征与原因解释作为认知锚点,辅助大模型做出事实驱动的情感溯源与定性。

  • 具体步骤:

    1. 多模态特征抽取与双曲抬升:使用预训练上游模型提取原始特征,经线性层和 LayerNorm 后,通过双曲指数映射投射至庞加莱球:qXm=Exp0(fm(hm))\mathbf{q}_X^m = \text{Exp}_0(f_m(\mathbf{h}_m));
    2. 切空间多模态查询融合:学习模态门控标量 α=softmax(θ)\boldsymbol{\alpha} = \text{softmax}(\boldsymbol{\theta}),在原点切空间进行黎曼对数映射均值求和,再投回双曲球得到统一样本查询 qX\mathbf{q}_X;
    3. 层级束搜索深思:以 qX\mathbf{q}_X 在树 T\mathcal{T} 上计算测地线距离展开 Beam Search,选定最优粗到细路径 π∗\pi^* 与细粒度原型 p∗\mathbf{p}^*;
    4. 知识库多模态对齐检索:在所选概念分支下,计算样本分模态查询与候选条目的多模态双曲加权距离 DiD_i,检索 Top-kk 个互补多模态证据;
    5. 构建深思证据图 (DEG):以概念原型和证据特征作为两类节点,保留树路径边与证据近邻边;添加类型嵌入和层次嵌入后送入 Tree-Aware Attention;
    6. 图标记压缩与提示注入:通过 EmotionGraphFormer 生成 QQ 个高维图标记 Zg\mathbf{Z}_g,与主干多模态标记 HmmH_{mm}、任务提示 HtaskH_{task} 组装成完整上下文序列,送入冻结大模型进行自回归生成。
  • 核心公式/指标 1:庞加莱球原点指数映射与样本双曲查询生成(Equations 1, 2,Page 3):

pn=Exp0(zn),qXm=Exp0(fm(hm)),m∈{a,v,t}\mathbf{p}_n = \text{Exp}_0(\mathbf{z}_n), \quad \mathbf{q}_X^m = \text{Exp}_0(f_m(\mathbf{h}_m)), \quad m \in \{a, v, t\}
  • 公式拆解 1:

    • 这条公式表示什么:将欧氏切空间中的可学习情感概念参数 zn\mathbf{z}_n 和多模态投影特征映射至曲率为 −1-1 的连续庞加莱双曲球流形中;
    • 其中关键符号分别代表什么:zn∈Rdh\mathbf{z}_n \in \mathbb{R}^{d_h} 为情感节点 nn 的欧氏基底参数,pn\mathbf{p}_n 为双曲概念原型;fmf_m 为线性层与层归一化构成的模态投射头,qXm\mathbf{q}_X^m 为对应模态的双曲查询向量;
    • 这条公式对应方法中的哪一步:对应系统第一阶段(情感树与样本多模态特征的双曲几何抬升)。
  • 核心公式/指标 2:黎曼切空间多模态查询加权融合(Equation 3,Page 3):

qX=Exp0(αaLog0(qXa)+αvLog0(qXv)+αtLog0(qXt))\mathbf{q}_X = \text{Exp}_0\Big( \alpha_a \text{Log}_0(\mathbf{q}_X^a) + \alpha_v \text{Log}_0(\mathbf{q}_X^v) + \alpha_t \text{Log}_0(\mathbf{q}_X^t) \Big)
  • 公式拆解 2:

    • 这条公式表示什么:在双曲流形的原点切空间(切空间为欧氏空间)进行加权向量线性求和,避免了在非欧流形直接做向量相加破坏测地线几何的弊端;
    • 其中关键符号分别代表什么:Log0(⋅)\text{Log}_0(\cdot) 为原点对数映射,α=[αa,αv,αt]=softmax(θ)\boldsymbol{\alpha} = [\alpha_a, \alpha_v, \alpha_t] = \text{softmax}(\boldsymbol{\theta}) 为可学习的跨模态动态权重,qX\mathbf{q}_X 为融合后的统一样本级双曲查询;
    • 这条公式对应方法中的哪一步:为后续在情感树上执行束搜索定位提供统一样本锚点。
  • 核心公式/指标 3:基于庞加莱测地线的多模态解耦检索距离(Equation 4,Page 4):

Di=αadH(qXa,kia)+αvdH(qXv,kiv)+αtdH(qXt,kit)D_i = \alpha_a d_\mathbb{H}(\mathbf{q}_X^a, \mathbf{k}_i^a) + \alpha_v d_\mathbb{H}(\mathbf{q}_X^v, \mathbf{k}_i^v) + \alpha_t d_\mathbb{H}(\mathbf{q}_X^t, \mathbf{k}_i^t)

其中双曲测地线距离定义为:

dH(u,v)=arcosh(1+2∥u−v∥2(1−∥u∥2)(1−∥v∥2))d_\mathbb{H}(\mathbf{u}, \mathbf{v}) = \text{arcosh}\left( 1 + 2 \frac{\|\mathbf{u} - \mathbf{v}\|^2}{(1 - \|\mathbf{u}\|^2)(1 - \|\mathbf{v}\|^2)} \right)
  • 公式拆解 3:

    • 这条公式表示什么:在锁定的细粒度情感分支下,利用各模态的独立双曲查询与知识库中各条目的分模态嵌入计算测地线距离,加权计算总检索距离;
    • 其中关键符号分别代表什么:kia,kiv,kit\mathbf{k}_i^a, \mathbf{k}_i^v, \mathbf{k}_i^t 分别为知识库第 ii 个样本的音、视、文双曲证据嵌入,dH(⋅,⋅)d_\mathbb{H}(\cdot, \cdot) 为庞加莱球测地线距离;
    • 这条公式对应方法中的哪一步:在深思式检索中挑选支持当前预测的 Top-kk 个互补性证据项。
  • 核心公式/指标 4:树感知拓扑掩码注意力机制(Equations 6, 7, 8,Page 4):

Mij={0,i=j 或 (i,j)∈E−∞,其他M_{ij} = \begin{cases} 0, & i=j \text{ 或 } (i,j) \in \mathcal{E} \\ -\infty, & \text{其他} \end{cases} G^=MHA(X(0),X(0),X(0);M)\widehat{\mathbf{G}} = \text{MHA}(\mathbf{X}^{(0)}, \mathbf{X}^{(0)}, \mathbf{X}^{(0)}; \mathbf{M}) eG=FFN(LayerNorm(X(0)+G^))\mathbf{e}_G = \text{FFN}\Big(\text{LayerNorm}(\mathbf{X}^{(0)} + \widehat{\mathbf{G}})\Big)
  • 公式拆解 4:

    • 这条公式表示什么:在深思证据图(DEG)上进行自注意力消息传递时,强行施加邻接拓扑掩码矩阵 M\mathbf{M},只有存在概念从属关系或双曲近邻拓扑边的节点对才允许进行注意力权重计算与特征交换;
    • 其中关键符号分别代表什么:X(0)\mathbf{X}^{(0)} 为融合了类型与层级嵌入的初始图节点特征矩阵,M\mathbf{M} 为负无穷掩码矩阵,eG\mathbf{e}_G 为编码后的结构化图表征;
    • 这条公式对应方法中的哪一步:在深思证据图编码中保持树状拓扑层次完整性,消除无关节点噪声。
  • 核心公式/指标 5:EmotionGraphFormer 标记蒸馏与输入前缀构建(Equations 10, 11, 12,Page 4, 5):

Q(1)=CrossAttn(Q(0),eG,eG),Q(2)=SelfAttn(Q(1)),Zg=WLLMQ(2)\mathbf{Q}^{(1)} = \text{CrossAttn}(\mathbf{Q}^{(0)}, \mathbf{e}_G, \mathbf{e}_G), \quad \mathbf{Q}^{(2)} = \text{SelfAttn}(\mathbf{Q}^{(1)}), \quad \mathbf{Z}_g = \mathbf{W}_{LLM} \mathbf{Q}^{(2)} Hin=[E(⟨bos⟩);E(⟨Multimodal⟩);H0;E(⟨/Multimodal⟩);Zg;Htask]\mathbf{H}_{in} = \big[ E(\langle\text{bos}\rangle); E(\langle\text{Multimodal}\rangle); \mathbf{H}_0; E(\langle/\text{Multimodal}\rangle); \mathbf{Z}_g; \mathbf{H}_{task} \big]
  • 公式拆解 5:

    • 这条公式表示什么:通过 QQ 个可学习的查询探针向量 Q(0)\mathbf{Q}^{(0)},经交叉注意力从变长图表征 eG\mathbf{e}_G 中提炼关键信息,并自注意力聚合后投射至大语言模型隐层维度得到固定数量的结构化标记 Zg\mathbf{Z}_g,与主干提示一起送入冻结大模型;
    • 其中关键符号分别代表什么:Zg∈RQ×d\mathbf{Z}_g \in \mathbb{R}^{Q \times d} 为蒸馏出的结构证据标记,Hin\mathbf{H}_{in} 为输入 LLM 的最终稠密嵌入前缀序列;
    • 这条公式对应方法中的哪一步:将复杂的图拓扑解耦蒸馏为大模型天然兼容的序列标记,实现平滑高效的证据注入。
  • 核心公式/指标 6:联合优化总体多任务训练目标(Equations 13–16,Page 5):

L=Ltask+λcontLcont+λpathLpath\mathcal{L} = \mathcal{L}_{task} + \lambda_{cont} \mathcal{L}_{cont} + \lambda_{path} \mathcal{L}_{path}

其中主任务自回归生成损失 Ltask=−∑t=1Tlog⁡p(yt∣y<t,Hin)\mathcal{L}_{task} = -\sum_{t=1}^T \log p(y_t \mid y_{<t}, \mathbf{H}_{in}),路径一致性约束损失为样本查询与最终命中细粒度概念原型间的双曲距离 Lpath=dH(qX,pn∗)\mathcal{L}_{path} = d_\mathbb{H}(\mathbf{q}_X, \mathbf{p}_{n^*})。

  • 公式拆解 6:

    • 这条公式表示什么:大模型监督生成、双曲空间概念对比对齐、以及检索路径与推理决策一致性的联合三元多任务优化目标;
    • 其中关键符号分别代表什么:λcont=0.10,λpath=0.05\lambda_{cont} = 0.10, \lambda_{path} = 0.05 为平衡超参数,pn∗\mathbf{p}_{n^*} 为选定路径上的终止细粒度情感概念原型;
    • 这条公式对应方法中的哪一步:端到端(冻结主干LLM下)的联合参数更新。
  • 方法优势:

    1. 层级双曲几何原生适配:在庞加莱球上以对数级空间开销天然容纳树状分类体系,从根本上消除了欧氏空间下的距离挤压与语义失真;
    2. 深思检索阻断误差:由粗到细的束搜索推理机制将决策空间逐步限制在正确子树内,有效防止了单步检索常见的大范围召回漂移;
    3. 图 Transformer 拓扑保真:避免了将证据暴力拼接为纯文本提示导致的层级关系断裂,通过图标记将显式认知图谱结构注入大模型前缀;
    4. 大模型参数高效微调:大模型本体全程保持冻结,仅微调双曲投射与轻量 GraphFormer,计算资源消耗低且鲁棒性极强。
  • 方法局限: 外部情感图谱记忆库依赖离线构建质量(如 MERCaptionPlus 的标注粒度);束搜索的分支宽度与深度在面对极深层级(如 >5 层)时可能增加检索延迟。

数据来源

  • 数据类型:多模态情感分析基准(视频音轨、人脸面部视频帧、对白转写文本、微表情与情绪标注)。
  • 样本来源:
    • CMU-MOSEI:涵盖 23,453 个 YouTube 视频片段,提供从 -3 到 +3 的连续情感得分及 6 种离散情绪标注;
    • MELD:源自经典电视剧《老友记》(Friends)的多人对话情感识别数据集,包含 13,000 余句多轮对白与离散情绪分类(7类:中性、愤怒、厌恶、恐惧、喜悦、悲伤、惊讶);
    • CH-SIMS v2.0:中文单人视频多模态情感分析数据集,标注了统一多模态情感以及单模态独立情感,包含弱情感区间([-0.4, 0.4])评估;
    • CHERMA:中文对话微表情与宏观情绪识别基准,侧重面部动作单元(Action Units)与微妙情感状态;
    • 外部知识库 (Knowledge Base):从 MER2025 训练集中利用 MERCaptionPlus 注释提炼出开放域情感标签与多模态原因描述(包含面向音频、视频与文本的专属阐释)。
  • 时间范围:覆盖真实网络多模态视频(2018–2025年)及经典影视对话影视资料。
  • 样本量/案例数:
    • MOSEI: 23,453 样本;
    • MELD: 13,708 句子样本;
    • SIMS-V2: 4,402 视频切片;
    • CHERMA: 4,000+ 微表情与对话片段。
  • 数据局限: 外部知识库构建基于特定数据集的标注增强,在跨文化、跨领域的情感隐喻(如讽刺、戏谑)上知识覆盖面仍有扩充空间。

研究结论

  • 主要发现 1:HyperEmo-RAG 在中英文多模态情感基准上全面超越现有最强模态融合与统一大模型基线。在 ChatGLM3-6B 骨干下,MOSEI 上的 Acc-2/F1 达到 89.06/88.82(超出 UniMSE 达 3.20/3.03 个百分点);在 CHERMA 对话情感识别上加权 F1 达到 75.79(超出此前最强基线 LFMIM 达 5.25 个百分点)。在弱情感样本评测(SIMS-v2 Acc2-weak)中取得 77.78% 的高准确率,表明结构化外部证据在微妙微弱情感识别中具有独特的抗噪定锚作用。
  • 原文引用 1:

“On MOSEI, HyperEmo-ChatGLM3-6B achieves the best Acc-2/F1 of 89.06/88.82, outperforming the strongest prior classification baseline UniMSE by 3.20/3.03 points… On CHERMA, HyperEmo-ChatGLM3-6B obtains the best Acc/WF1 of 75.45/75.79, and its WF1 exceeds the strongest reported baseline LFMIM by 5.25 points… Notably, the gain on weak-emotion instances indicates that the retrieved emotional evidence is particularly useful when the sentiment signal is subtle.” (Page 6, 7)

  • 主要发现 2:相比通用多模态 RAG 模型(MuRAG, RA-CM3, REVEAL),层级双曲证据组织展现出决定性优势。在统一 Qwen-1.8B 骨干、相同检索语料与 Prompt 预算的严格受控实验下,HyperEmo-RAG 在所有四个基准的所有回归与分类指标上均夺得第一(例如在 MOSEI 上 MAE 降至 0.537,Corr 提升至 0.845,F1 达 88.57),证实单纯检索无序证据不足以支撑细粒度情感推理,必须借助树状层级组织。
  • 原文引用 2:

“A likely reason is that generic multimodal RAG mainly retrieves related multimodal evidence, but does not explicitly organize this evidence according to hierarchical emotional relations. In contrast, HyperEmo-RAG introduces emotion-oriented knowledge grounding and structured evidence integration, which helps the model use retrieved information in a way that is more aligned with fine-grained emotion understanding.” (Page 7)

  • 主要发现 3:双曲检索与层级深思式策略形成了紧密协同的双重增益。检索机制消融实验(Table 6)显示,若将双曲度规替换为欧氏度规,CHERMA 的 WF1 从 75.43 跌至 75.11;若进一步移除层级深思检索(退化为一步式平坦检索),WF1 进一步滑落。双曲空间提供了几何层级映射先验,而束搜索深思则实现了候选分支由粗到细的逐级精炼。
  • 原文引用 3:

“These results suggest that the retrieval design contributes at two levels: the hyperbolic space is better aligned with hierarchical emotional relations, and the multi-step deliberation process further improves the quality of the retrieved evidence… hyperbolic retrieval improves the geometric alignment between multimodal samples and hierarchically related emotion concepts, while hierarchical deliberation further enhances evidence selection by progressively filtering candidate branches from coarse to fine levels.” (Page 8)

  • 主要发现 4:Tree-Aware Attention 与 EmotionGraphFormer 证明了图拓扑显式建模的必要性。架构消融实验(Table 5)表明,移除拓扑掩码注意力或移除图转换器均会导致性能全面回退(MOSEI F1 分别从 88.82 降至 88.12 和 88.05),证实深思证据图内部的结构化关联若被简单全连接平铺,会导致有效层级信号被稀释;图蒸馏标记保留了最纯粹的认知拓扑证据。
  • 原文引用 4:

“Removing Tree-Aware Attention or EmotionGraphFormer leads to a consistent drop across all datasets, which indicates that the graph branch is useful not only because additional evidence is introduced, but also because the structural relations inside the deliberation evidence graph need to be encoded in a suitable way before being injected into the language model.” (Page 7–8)

  • 主要发现 5:多模态文本解释与图拓扑标记互为补充。证据通道消融(Table 4)显示,仅注入检索文本(Captions)或仅注入结构图标记(Graph Tokens)相比纯大模型骨干均有明显提升,而二者融合时达到最高性能(MOSEI F1 达 88.82,MELD WF1 达 67.54),表明自然语言的语义丰富性与图拓扑的几何确定性形成了极佳的双重互补。
  • 原文引用 5:

“At the same time, using only retrieved captions or only graph tokens already brings measurable improvements, whereas combining the two yields further gains, indicating that the textual evidence and the structured graph evidence provide complementary information.” (Page 7)

我的判断

  • 最有启发的点: 将“树模型”(Tree Taxonomy)与“双曲几何”(Hyperbolic Poincaré Ball)不仅作为表示工具,更作为检索增强生成(RAG)的控制流骨架。它打破了传统 RAG 把外源记忆库当成“一锅粥”扁平检索的固有思维,借由心理学分类树将检索过程拆解为逐步收敛的“深思树搜索(Tree-Deliberation)”,极大降低了多模态大模型的虚假关联和幻觉率。
  • 可借鉴的方法:
    1. 深思证据图(DEG)+ 树感知注意力:在检索出多条证据后,不急于拼接成文本,而是将先验概念节点与证据节点显式连边,并用掩码阻止无关信息横向扩散;
    2. EmotionGraphFormer 标记蒸馏器:用少量固定长度的 Query 向量压缩整个异构证据图,直接生成适配 LLM 隐层尺度的软提示(Soft Prompt Tokens),优雅解决了变长复杂图谱向纯自回归大模型注入的工程痛点。
  • 可继续追问的问题:
    1. 情感树的拓扑结构目前是根据心理学理论静态人工预设的,能否在特定领域(如心理危机干预或法庭辩护)通过大模型结合数据自监督动态诱导生成更具弹性的自适应情感树?
    2. 当跨模态线索出现极端矛盾(如面带微笑但声音充满杀气、文本具有强烈嘲弄讽刺)时,双曲切空间的权重门控能否通过反向传播自动学习出这种“负向对齐”的特殊图模式?
  • 与我的研究关联: 本篇论文是“树模型知识图谱”主题在**多模态大语言模型(MLLMs)和检索增强生成(RAG)**前沿交叉方向的标杆之作。它展示了树拓扑先验在治理大模型幻觉、规范多模态证据流向上的关键学术价值。
Built with LogoFlowershow