知识卡片:证据支持的视频问答(E-VQA)
一句话结论
本文提出证据支持的视频问答任务(E-VQA),要求模型联合输出语义答案和准确的时空证据(时间片段+密集跟踪分割掩码),并发布首个经过人工验证的像素级基准 ST-Evidence 及 160k 规模的自动化生成数据集 ST-Evidence-Instruct;微调后的 7B 模型在指标上相比同尺寸 UniPixel 基线提升显著(t-mean +27.2,J&F +13.8),揭示了当前 Video LLM 中问答精度与真实视觉感知之间的关键解耦问题。
事件概述或研究问题
当前视频大语言模型(Video LLMs)在问答任务上表现优异,但本质上是黑盒——仅输出文本答案,缺乏可验证的视觉依据。已有的可解释性工作依赖文本理由或稀疏的边界框,难以处理遮挡、非刚性变形等复杂视频动态。为解决这一问题,作者提出了 E-VQA 任务,要求模型同时输出语义答案和精确定位到像素级别的时空证据,从而让模型的推理过程变得可验证。
方法/产品要点
- E-VQA 任务定义:模型需输出三部分内容——语义答案、时间片段(temporal segments)、密集且跟踪的目标分割掩码序列(tracked object segmentation masklets)。
- ST-Evidence 基准:首个经过人工验证的像素级时空定位基准,支持判别式和生成式两种评估模式。
- ST-Evidence-Instruct 数据集:通过可扩展的自动化生成管道构建,包含约 160k 样本,旨在桥接高级推理与细粒度定位。
- 微调策略:在 ST-Evidence-Instruct 上对基于视频的 LLM 进行微调,获得可解释的、证据驱动的视频理解模型。
主要结果或产业意义
- 对现有 SOTA 模型的评估显示,QA 准确率与真实视觉感知之间存在关键解耦,并且仅靠模型规模扩展无法弥合这一差距。
- 在 7B 模型上使用 ST-Evidence-Instruct 微调后,相比同尺寸的 UniPixel 基线取得了显著提升:t-mean 提高 27.2,J&F 提高 13.8。
- 为可解释视频理解建立了稳健基线,代码与数据已开源(GitHub)。
为什么重要
当前 Video LLM 的可解释性大多停留在文本或稀疏框层面,而 E-VQA 首次将证据粒度推进到像素级跟踪掩码,使视频问答的推理过程可直接与视觉内容对应验证。这有助于提升模型的可信度,并揭示“看似答对实则未真正理解”的解耦问题,为后续夯实视频感知能力提供了明确的基准和方法。
局限与不确定性
- 文中未提及 E-VQA 在复杂长视频或高动态场景下的性能上限。
- 自动化生成管道对遮挡、非刚性变形等边缘情况的覆盖程度待核实。
- 微调模型在真实下游任务(如安防、自动驾驶)中的泛化表现待进一步评估。
可用于图书/PPT/简报的角度
- 视频问答的“信任危机”:为什么模型答对了却不代表真正“看懂了”?——引出 E-VQA 中 QA 精度与视觉感知解耦的发现。
- 从“黑盒”到“证据链”:视频大模型可解释性的新范式——介绍时空分割掩码作为证据的直观性。
- 基准与数据集的工程价值:如何进行大规模、低成本的像素级标注?——介绍 ST-Evidence-Instruct 的自动化生成流水线。
原始材料
- 英文标题:Evidence-Backed Video Question Answering
- 英文关键词:Video Question Answering, Video LLMs, Spatio-temporal Grounding, Explainability
- 来源:arXiv:2607.11862v1, cs.CV, cs.AI; ECCV 2026; 代码与数据集见 https://github.com/SalesforceAIResearch/EVQA