AI消息速览

EcoFrame——自适应视觉证据调度用于高效长视频理解

事件日期 2026-08-04 · 学术前沿 · 已接受

事件日期2026-08-04
信息日期2026-08-04
入库日期2026-08-06
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:EcoFrame——自适应视觉证据调度用于高效长视频理解

英文标题:When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding

英文关键词:long video understanding; adaptive visual evidence scheduling; training-free framework; entropy-gated budget scheduling; attention-guided candidate proposal; vision-language model

一句话结论

EcoFrame 是一个免训练的查询自适应视觉证据调度框架,通过利用 VLM 自身的推理反馈来决定“何时增大帧预算”和“到哪里寻找额外候选帧”,在 Video-MME、LongVideoBench 和 MLVU 上取得了比静态帧选择更优的准确率-效率平衡;在 Qwen2.5-VL 上平均准确率 64.4,超过 BOLT 的 63.5。

事件概述或研究问题

长视频理解要求视觉语言模型(VLM)只依赖少量稀疏帧作为视觉证据进行推理。现有基于相关性的方法通常采用固定帧预算和候选池的一次性静态选择;基于智能体(agent)的调度器虽然自适应,但依赖多轮推理和交互搜索,开销高昂。EcoFrame 针对的是“何时看(when)”和“往哪看(where)”这两个核心调度问题。

方法/产品要点

  • 免训练框架:EcoFrame 不引入额外训练,直接利用 VLM 推理反馈做调度。
  • 熵门控预算调度(entropy-gated budget scheduling):根据输出不确定性决定是提前停止(证据已足够)还是逐步扩大帧预算。
  • 注意力引导的候选提议(attention-guided candidate proposal):把帧级注意力转化为时间先验;在信息密集区域进行稠密局部搜索,在注意力分散时保留全局覆盖。
  • 查询自适应:帧预算和候选帧位置随当前查询动态调整,而非固定不变。

主要结果或产业意义

  • 在 Video-MME、LongVideoBench 和 MLVU 三个长视频基准上,EcoFrame 在多个 VLM 骨干上取得更好的准确率-效率权衡。
  • 在 Qwen2.5-VL 上,EcoFrame 平均准确率 64.4,超过 BOLT 的 63.5。
  • 相对 AKS 和 BOLT,EcoFrame 提供 1.85 倍加速。
  • 相对基于智能体的 A.I.R.,EcoFrame 保持可比准确率,并实现最高 13.5 倍推理加速。
  • 产业意义:这类低开销自适应调度若能复现,可降低长视频理解系统按需抽取证据的计算成本;具体场景收益仍需完整实验确认。

为什么重要

EcoFrame 把长视频理解中的“选哪些帧”从静态一次选择推进到“在推理中根据反馈动态调度”的范式,且不需要训练。它提供了一种可能更通用的效率优化思路:用熵作为“何时停/何时加帧”的信号,用注意力作为“往哪搜”的先验。

与既有脉络的关系:已有相关卡片分别覆盖了选帧后的生成式潜在证据聚合(GenEvA)、多页文档证据路由(HierDoc)和视频生成外推(PACR-Video)。本条不是在做帧聚合或文档分页,也不是长视频生成,而是直接处理“帧预算和候选位置如何根据查询与推理状态变化”的调度问题;与 GenEvA 等后处理/聚合方法可能互补。

局限与不确定性

  • 本卡片仅基于 arXiv 摘要和元数据整理,完整方法细节、消融实验和超参数设置待核实。
  • “平均准确率 64.4”“1.85 倍加速”“13.5 倍加速”等数字的具体评测设置、硬件条件和对比口径待核实。
  • 代码页面提到“Code will be available at ...”,但代码是否已开放、能否复现实验,待核实。
  • 熵阈值、注意力可靠性、跨任务/跨视频长度泛化等细节未在摘要中给出。

可用于图书/PPT/简报的角度

  • 用“何时看、往哪看”类比人类在长视频中的主动注意,解释机器如何用 VLM 的“自我反馈”来减少帧数。
  • 作为“低开销自适应推理”案例:熵作为不确定度门控、注意力作为时间先验。
  • 在“长视频 VLM 效率”主题下,与静态抽帧、智能体多轮搜索形成对比。

原始材料

  • 英文标题:When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding
  • 英文关键词:long video understanding; adaptive visual evidence scheduling; training-free framework; entropy-gated budget scheduling; attention-guided candidate proposal; vision-language model
  • 作者:Ke Li, Jiayu Chen, Maoliang Li, Zihao Zheng, Hailong Zou, Hengyi Zhang, Xuanzhe Liu, Xiang Chen
  • arXiv ID:2608.03918v1
  • 提交/更新日期:2026-08-04T16:49:53Z(更新日期同提交日期)
  • 分类:cs.CV; cs.AI
  • 原始来源:https://arxiv.org/abs/2608.03918v1
  • PDF 链接:https://arxiv.org/pdf/2608.03918v1
  • 代码链接(预告):https://github.com/AK-DREAM/EcoFrame