AI消息速览

超越帧选择:生成式潜在证据聚合用于长视频理解

事件日期 2026-07-30 · 学术前沿 · 已接受

事件日期2026-07-30
信息日期2026-07-30
入库日期2026-08-01
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:超越帧选择:生成式潜在证据聚合用于长视频理解

一句话结论

GenEvA 在“选帧/压缩”后增加一个查询相关的跨帧潜在证据聚合步骤,让模型在生成答案前先整合互补信息;在 8 帧设置下,LLaVA-Video 的四基准平均分提升 +5.2,Qwen2.5-VL 在 LVBench 上准确率提升 +10.1,仅增加约 0.11%–0.40% 的视频 token 开销。

事件概述或研究问题

  • 长视频理解常把视频压缩成少量帧或视觉 token,再交给视频多模态大语言模型(Video-MLLM)生成回答。
  • 已有紧凑流水线主要关注“保留相关的显式视觉证据”;但论文指出,证据被保留并不等于跨时刻的互补线索已被整合。
  • 研究问题因此被定位为:在帧选择之后、答案生成之前,如何组织查询相关的跨帧潜在证据。

方法/产品要点

  • 将“选择后处理”形式化为一个潜在证据接口(latent evidence interface),并用 GenEvA(Generative Latent Evidence Aggregation)实例化。
  • GenEvA 使用查询条件化的证据分布(query-conditioned evidence distribution)聚焦相关帧,并从各帧的帧特定信息中形成紧凑的跨帧潜在证据。
  • 由于并非所有问题都需要跨帧整合,同一证据分布还会决定是否插入该潜在补充,即 Adaptive Evidence Invocation(自适应证据调用)。

主要结果或产业意义

  • 在 4 个基准和 2 个 Video-MLLM 主干上,GenEvA 一致优于匹配帧数的基线。
  • 8 帧时的代表性提升:
    • LLaVA-Video:四个基准平均 +5.2 分;
    • Qwen2.5-VL:LVBench 上准确率 +10.1 分。
  • 平均视频 token 开销仅增加 0.11%–0.40%,属于低成本改进。
  • 分析还表明它具有任务感知分配(task-aware allocation)特性,并验证了自适应证据调用的收益。

为什么重要

  • 它提示“帧选择不是终点”:在显式选帧之后,如何对潜在证据进行跨帧聚合,是长视频理解中一个此前未被充分强调的改进点。
  • 通过极低 token 开销获得稳定增益,对 Video-MLLM 的高效实用部署有参考价值。
  • 增量信息:相比已有相关卡片中的 EgoPolice(基准)、PACR-Video(长视频外推)、SportMV-Agent(多视角推理),本条聚焦选帧后的“潜在证据聚合”机制,并给出 8 帧设置下的量化收益。

与既有脉络的关系

  • 已有相关卡片分别涉及真实场景基准(EgoPolice)、参数高效长视频外推(PACR-Video)和多视角体育推理(SportMV-Agent)。
  • 本条是对长视频理解流水线中“选择后阶段”的补充,不与上述卡片重复同一事实,可作为同一“长视频理解”主题下的机制类增量。

局限与不确定性

  • 摘要未列出四个基准的具体名称和更详细的实验设置,待核实。
  • 作者所属机构、是否开源代码、具体视频 token 计算方法等未在抓取片段中提供,待核实。
  • 对更长视频、更多帧、复杂真实场景的泛化效果,摘要未给出信息,待核实。

可用于图书/PPT/简报的角度

  • 角度:用一句话概括改进——“选帧 + 跨帧潜在证据聚合 + 自适应调用”。
  • 讲稿示例:选帧只是第一步;GenEvA 用 0.11%–0.40% 的额外 token 换来显著准确率提升,适合说明“长视频理解的收益来自生成前的证据组织,而不仅是选择更多帧”。
  • 对普通读者:可以把“视觉 token”理解成视频被压缩后的信息单位;GenEvA 是在这些单位之间做“按问题拼接和提炼”。

原始材料

  • 英文标题:Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding
  • 英文关键词(整理自标题与摘要):long-video understanding; latent evidence aggregation; Video-MLLM; frame selection; Adaptive Evidence Invocation
  • 作者:Bowen Liu, Shuning Wang, Xinpeng Ding, Zhiheng Wu, Bodong Du, Xiaomeng Li
  • arXiv ID:2607.28516v1
  • Primary category:cs.CV
  • 来源:https://arxiv.org/abs/2607.28516v1
  • PDF:https://arxiv.org/pdf/2607.28516v1