AI消息速览

VideoTreeSearch:基于自适应时间树的自纠正智能体用于定位长视频问答

事件日期 2026-07-17 · 学术前沿 · 已接受

事件日期2026-07-17
信息日期2026-07-17
入库日期2026-07-21
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:VideoTreeSearch:基于自适应时间树的自纠正智能体用于定位长视频问答

  • 英文标题:Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA
  • 英文关键词:Video question answering, Grounded long-video QA, Self-correcting agents, Temporal tree search, Reinforcement learning
  • 原始来源:arXiv:2607.16189v1(https://arxiv.org/abs/2607.16189v1)

一句话结论

VideoTreeSearch(VTS)通过将长视频组织成自适应时间树,并训练智能体使用 zoom_in、zoom_out、shift、answer 四种操作进行迭代自纠正搜索,在定位长视频问答任务上显著超越现有智能体方法,同时其学得策略可泛化至通用长视频问答。

事件概述或研究问题

现有基于智能体的方法仅依赖单一 crop_video(start, end) 动作进行多轮探索,只能从粗到细缩小范围,缺乏从细到粗的回溯原语。这导致智能体容易过早收敛,无法从早期错误中恢复。VTS 将定位长视频问答(Grounded LVQA)重新建模为在自适应时间树上的迭代自纠正搜索。

方法/产品要点

  • 时间树构建:根据视觉场景边界构造非均匀树,每个节点对应一个语义连贯的视频片段。
  • 四种离散操作
    • zoom_in:进入子节点(更细粒度);
    • zoom_out:返回父节点(回溯);
    • shift:在同级节点间移动;
    • answer:基于当前节点输出答案及其证据区间。
  • 轨迹合成管道:生成包含故意走入错误分支并随后恢复的多步路径,作为训练数据。
  • 训练流程:先进行监督微调(SFT),再使用强化学习(RL)优化,奖励包含定位准确性和答案正确性。

主要结果或产业意义

  • 在三个定位 LVQA 基准上:
    • CG-Bench:mIoU 提升 +12.5;
    • Haystack-Ego4D:T-F1 提升 +7.4。
  • 在通用长视频 QA 基准(Video-MME、MLVU、LVBench)上,准确率最高提升 +7.1 个点。
  • 消融实验证明:移除自适应下降或显式回溯均会导致性能显著下降,自纠正层次搜索是核心机制。

为什么重要

该工作首次将粗到细搜索与细到粗回溯作为显式、可学习的原语引入长视频问答,解决了现有智能体方法因缺乏退出机制而无法纠错的关键瓶颈。其学习策略具有良好的迁移性,为构建更鲁棒的长视频理解智能体提供了新范式。

局限与不确定性

  • 论文未讨论对超长视频(如数小时)的计算开销或推理延迟(待核实)。
  • 时间树依赖视觉场景边界分割,分割质量对性能的影响未详细分析(待核实)。
  • 轨迹合成管道需人工设计错误分支,其泛化边界尚未明确(待核实)。

可用于图书/PPT/简报的角度

  • “树状搜索 + 显式回溯”类比人类在视频中“试错–回退”的认知过程,适合用流程图展示四种操作。
  • 可突出“从错误中学习”的强化学习训练策略,强调合成轨迹中包含的恢复行为。
  • 对比现有方法“一条道走到黑”的缺陷,展示 VTS 如何在多步探索中自我纠正。

原始材料

  • arXiv 论文:https://arxiv.org/abs/2607.16189v1
  • GitHub 代码:https://github.com/CeeZh/VTS