AI消息速览

Video-DeepResearch——迈向下一代多模态深度研究智能体

事件日期 2026-08-04 · 学术前沿 · 已接受

事件日期2026-08-04
信息日期2026-08-04
入库日期2026-08-05
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:Video-DeepResearch——迈向下一代多模态深度研究智能体

一句话结论

Video-DeepResearch(Video-DR)将多模态深度研究智能体从静态图像扩展到连续视频流,通过“解耦感知-探索”流程和“SFT + GRPO”两阶段训练,在自建 Video-DR-Bench 上达到 64.0% 的平均准确率,超越 Claude-4.5-Sonnet(59.0%)、Gemini 2.5 Pro(57.5%)和 GPT-5(52.5%),并揭示了当前模型存在的“模态偏差”和“参数知识泄漏”两大瓶颈。

事件概述 / 研究问题

  • 现有深度研究智能体多处理静态图像或文本,而连续视频流要求模型具备密集的时空定位能力,同时还要结合开放网络探索。
  • 初步评估发现两个关键瓶颈:
    1. 模态偏差(modality bias):智能体会绕过视觉工具,更倾向于使用文本搜索来回答问题。
    2. 参数知识泄漏(parametric knowledge leakage):模型依赖内部记忆而非真实的工具增强执行,导致可能“凭记忆作答”而不是“查证后回答”。
  • 为应对上述问题,作者提出 Video-DR,要求智能体在网页检索之前先进行穷尽的跨帧视觉定位,从而保证感知与探索的解耦。

方法/产品要点

  • 解耦感知-探索流程(decoupled perception-exploration pipeline):将视频感知阶段与开放网络探索阶段分离,避免感知不足时过早进入文本检索。
  • 阶段式工具解锁(stage-wise tool unlocking):按阶段逐步开放工具使用,强制模型先完成跨帧视觉定位,再允许进行网页检索。
  • 两阶段训练策略
    • 第一阶段:监督微调(Supervised Fine-Tuning, SFT)
    • 第二阶段:组相对策略优化(Group Relative Policy Optimization, GRPO)
    • 该策略旨在使智能体具备自主探索能力,突破模仿学习的上限。
  • Video-DR-Bench 基准:人机协同构建,包含 200 个复杂、多跳的 VQA 实例,用于评估视频深度研究智能体。
  • 开源代码:https://github.com/Osilly/Vision-DeepResearch

主要结果或产业意义

  • Video-DeepResearch-35B-A3B 取得 64.0% 平均准确率,成为新 SOTA,比 Claude-4.5-Sonnet 高 5.0 个百分点。
  • Video-DeepResearch-30B-A3B 取得 59.3% 平均准确率,与 Claude-4.5-Sonnet 接近,表明即使模型规模更紧凑,该训练范式依然有效。
  • 对比模型表现:GPT-5 为 52.5%,Gemini 2.5 Pro 为 57.5%。
  • 意义:说明通过显式解耦感知与探索、并配合强化学习,可以让中等规模开源模型在视频深度研究任务上超越闭源大模型;同时为视频理解智能体的工具使用和评测提供了新基准。

为什么重要

  • 任务扩展:首次明确提出“从静态图像到连续视频流”的深度研究智能体设定,为下一代多模态 deepresearch 提供一个可复现的框架。
  • 瓶颈诊断:模态偏差和参数知识泄漏是当前多模态智能体落地时的普遍问题,本文给出了可量化的现象描述与应对路径。
  • 训练范式:SFT + GRPO 的组合表明,强化学习可以替代部分模仿学习,让模型学会自主使用工具,而不是机械复现人类轨迹。
  • 与既有脉络的关系:已有相关卡片多聚焦视频生成或知识边界演化,本条增量在于面向视频流的“深度研究”智能体,强调了工具使用与视觉感知的时序解耦,并用统一基准验证了训练范式的有效性。

局限与不确定性

  • 本文目前仅能依据摘要确认上述结果;具体评估设置、基准题目构成、模型参数量含义(如“35B-A3B”中 A3B 的含义)等细节待核实。
  • 不同模型之间的比较条件(如工具调用次数、推理预算、视频长度、检索范围)暂未在材料中说明,待核实。
  • Video-DR-Bench 仅有 200 个实例,规模较小,其泛化性和统计显著性需进一步检验。
  • 模态偏差和参数知识泄漏的检测方法、量化指标等详细定义待核实。
  • 代码仓库已公开,但实际复现效果和运行成本待验证。

可用于图书/PPT/简报的角度

  • 从“文本搜索优先”到“视频感知优先”:下一代深度研究智能体应该先看再查。
  • “模型知道多少”不等于“模型能查多少”——参数知识泄漏是新的评估盲区。
  • 小模型 + 强化学习也能超越闭源大模型:Video-DR 的紧凑规模示范。
  • 视频不仅用于生成,也可用于深度研究中的证据链构建。
  • 如何设计多阶段工具解锁的训练流程,让智能体学会“何时看、何时查、何时答”。

原始材料

  • 英文标题:Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
  • 英文关键词(自摘要提取):Video-DeepResearch; Multimodal Deepresearch Agent; Video Understanding; GRPO; Tool-Augmented Execution
  • arXiv ID:2608.03979v1
  • URL:https://arxiv.org/abs/2608.03979v1
  • PDF:https://arxiv.org/pdf/2608.03979v1
  • 作者:Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao
  • 发布日期:2026-08-04(arXiv v1)
  • 摘要原文

We introduce Video-DeepResearch (Video-DR), extending multimodal agents from static images to continuous video streams, a setting that demands dense spatiotemporal grounding coupled with open-web exploration. Preliminary evaluations reveal two critical bottlenecks in current models: (1) modality bias, where agents bypass visual tools in favor of textual search, and (2) parametric knowledge leakage, where models rely on internal memory rather than genuine tool-augmented execution. To address these challenges, we propose Video-DR, featuring a decoupled perception-exploration pipeline with stage-wise tool unlocking that compels exhaustive cross-frame visual grounding prior to web retrieval. Our framework adopts a two-stage training recipe: supervised fine-tuning followed by Group Relative Policy Optimization (GRPO), enabling autonomous exploration that breaks the imitation-learning ceiling. Furthermore, we curate Video-DR-Bench, a human-AI collaborative benchmark comprising 200 complex, multi-hop VQA instances. Empirical results demonstrate that our Video-DeepResearch-35B-A3B establishes a new state-of-the-art of 64.0% average accuracy, surpassing proprietary Claude-4.5-Sonnet (59.0%) by 5.0 points and significantly outperforming GPT-5 (52.5%) and Gemini 2.5 Pro (57.5%). The 30B-A3B variant achieves 59.3%, competitive with Claude-4.5-Sonnet and demonstrating the effectiveness of our training paradigm even at compact scale. Code: https://github.com/Osilly/Vision-DeepResearch.