知识卡片:CF-Net:冲突融合与说话人归一化及确定性加权用于矛盾/犹豫识别
一句话结论
CF-Net 通过显式建模跨模态不一致性并引入说话人归一化与确定性加权,在 ABAW 2026 挑战赛的 BAH 数据集上实现了矛盾/犹豫识别的领先性能,Macro F1 达 0.7364(AP=0.7492)。
事件概述或研究问题
检测非受限视频中的矛盾与犹豫(Ambivalence/Hesitancy, AH)极具挑战性,因为目标信号本身模糊,且通过细微的跨模态不一致而非典型情感表达来体现。该任务属于第三届 AH 视频识别挑战赛(ABAW 11th,与 ECCV 2026 同期),目标数据集为 BAH。
方法/产品要点
- 输入与编码:使用冻结的预训练骨干网络提取三种模态特征——视觉(SigLIP2)、音频(HuBERT)和文本转录(DistilBERT)。
- 说话人归一化:对每个说话人的骨干特征进行归一化,以减少身份信息泄露对目标任务的影响。
- 冲突融合模块(ConflictFusion):显式计算每对模态之间的不一致性,实现跨模态冲突信息的融合。
- 训练策略:结合确定性加权焦点损失(certainty-weighted focal loss)、流形混合(manifold mixup)和模态丢弃(modality dropout);额外设置辅助确定性回归头,利用模糊标注样本稳定对真正边界样本的学习。
主要结果或产业意义
- 在 BAH 验证集上 Macro F1 为 0.7155。
- 在私有挑战测试集上 Macro F1 为 0.7364,AP(平均精度)为 0.7492。
- 该结果提交至第三章矛盾/犹豫识别挑战赛,表明模型在非约束视频中的 AH 识别上有实际竞争力。
为什么重要
现有情感识别工作多关注典型情感(如快乐、悲伤),而忽略矛盾/犹豫这类更微妙的心理状态。CF-Net 首次系统性地将跨模态不一致显式建模为一个可学习的模块,并针对 AH 的模糊性设计了辅助确定性头,是对多模态情感理解领域的补充。
局限与不确定性
- 论文未提及模型的计算复杂度与推理速度,实际部署性待核实。
- 仅在一个数据集(BAH)上验证,跨数据集泛化能力未知。
- 冻结骨干网络可能限制了针对 AH 任务的进一步适应,若采用微调策略是否会更好尚待探索。
- 确定性加权与辅助头的具体超参数设置未在摘要中说明,需查阅原文确认。
可用于图书/PPT/简报的角度
- 作为多模态融合中“冲突信息”建模的案例,强调跨模态不一致在非典型情感识别中的价值。
- 展示预训练骨干网络(SigLIP2、HuBERT、DistilBERT)在情感分析任务中的冻结使用方式。
- 对比传统焦点损失与确定性加权焦点损失在处理模糊标注样本时的差异。
原始材料
- 英文标题:CF-Net: Conflict Fusion with Speaker Normalisation and Certainty Weighting for Ambivalence/Hesitancy Recognition
- 英文关键词:CF-Net; Ambivalence/Hesitancy Recognition; Multimodal Fusion; Conflict Fusion; Speaker Normalisation; Certainty Weighting; ABAW; ECCV 2026; BAH Dataset
- 来源:arXiv preprint, arXiv:2607.13976v1, 2026-07-15
- URL:https://arxiv.org/abs/2607.13976v1
- 作者:Tung Hung Bui, Hong Hai Nguyen, Van Thong Huynh