知识卡片:知识引导的多模态推理用于视频级别的矛盾与犹豫识别
一句话结论
PRISM‑AH 将视频中的矛盾与犹豫(A/H)建模为随时间展开的多模态冲突,通过轻量流式模型量化跨模态失调、生成“犹豫惊奇”信号并发现行为原型,再经知识引导的大语言模型(LLM)依据专家线索分类学进行推理,在 525 个视频的测试集上达到 Macro F1 0.6133,显著优于零样本基线(0.2827)。
事件概述
Ambivalence and hesitancy(A/H)是阻碍健康行为改变的矛盾情感状态,其信号源自面部、声音、语言和肢体等模态内部及之间的不一致,且个体差异大,使得视频级别识别极为困难。PRISM‑AH 提出一种两阶段框架:第一阶段使用冻结的视觉、音频和文本编码器对齐到短时间窗口,输入轻量流式模型进行跨模态失调评分、下一窗口预测(暴露犹豫惊奇信号)和行为原型发现,并利用参与者元数据进行条件化;第二阶段由知识引导的 LLM 基于结构化证据(利用数据集中的专家线索分类学)进行推理,其判决仅在验证集性能提升时才与模型输出进行晚期融合。
方法/产品要点
- 多模态交互流建模:将 A/H 视为随时间演化的冲突,而非静态标签。
- 轻量流式模型:对对齐后的窗口序列计算跨模态不和谐分数、预测下一窗口以得到“犹豫惊奇”信号、发现行为原型,同时引入参与者元数据作为条件。
- 密集窗口级标注:作为辅助目标训练模型,并校准决策阈值以优化 Macro F1。
- 知识引导推理:利用数据集自带的专家线索分类学,LLM 对结构化证据进行推理,仅在验证集有增益时融合其输出。
- 测试规模:公开测试分区含 525 个视频。
主要结果
- PRISM‑AH 在公开测试集上 Macro F1 = 0.6133。
- 对比的零样本基线(待确认具体方法)Macro F1 = 0.2827。
- 推理增益从验证集成功迁移至更大的测试集。
注:未提供验证集指标及消融实验完整结果,具体基线方法待核实。
为什么重要
- 首次将知识引导的 LLM 推理引入视频级 A/H 识别,且采用晚期融合策略保证只在有效时使用,避免噪声。
- 提出的“犹豫惊奇”信号和行为原型为理解 A/H 的时序动态提供了新视角。
与既有脉络的关系
本卡片是对已有卡片 CF-Net(冲突融合与说话人归一化及确定性加权用于矛盾/犹豫识别) 的补充与对比:
- CF‑Net 在相同数据集(ABAW 2026 挑战赛 BAH 数据集)上达到 Macro F1 0.7364,显著高于 PRISM‑AH 的 0.6133。
- 二者核心差异:CF‑Net 侧重显式跨模态冲突建模与说话人归一化、确定性加权;PRISM‑AH 则引入时序流式预测和知识引导的 LLM 推理。
- 增量信息:PRISM‑AH 提出了流式窗口预测(犹豫惊奇)和行为原型发现,且尝试使用专家知识进行推理,但整体性能低于纯端到端冲突融合方案,提示领域知识注入方式仍需优化。
局限与不确定性
- 公开测试集仅为 525 个视频,规模有限,泛化性需更多数据验证。
- 零样本基线(0.2827)的具体设定未在摘要中详述,无法直接对比模型增益来源。
- LLM 推理的增益条件(仅在验证集提升时融合)暗示知识引导可能不稳定,未报告无融合时的消融结果。
- 未提供与 CF‑Net 等同期方法的公平直接对比(数据集划分、评估协议是否一致待核实)。
可用于图书/PPT/简报的角度
- 健康行为干预:A/H 是健康行为改变失败的前兆,自动识别可辅助个性化干预时机选择。
- 多模态时序冲突建模:展示如何用流式模型捕捉细粒度跨模态失调。
- 知识‑数据双驱动:专家知识(线索分类学)与大模型推理相结合的设计思路。
原始材料
- 英文标题:Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition
- arXiv ID:2607.25961v1
- 作者:Podakanti Satyajith Chary, Barath Parthiban, Pranesh Velmurugan, Adeeba Khan, Nagarajan Ganapathy
- 发表日期:2026-07-28
- URL:https://arxiv.org/abs/2607.25961v1
- 英文关键词:Ambivalence and Hesitancy Recognition; Multimodal Conflict; Knowledge-Guided Reasoning; Streaming Model; Video-Level Affective Computing