Video-DeepResearch(Video-DR)将多模态深度研究智能体从静态图像扩展到连续视频流,通过“解耦感知-探索”流程和“SFT + GRPO”两阶段训练,在自建 Video-DR-Bench 上达到 64.0% 的平均准确率,超越 Claude-4.5-Sonnet(59.0%)、Gemini 2.5 Pro(57.5%)和 GPT-5(5…
现有深度研究智能体多处理静态图像或文本,而连续视频流要求模型具备密集的时空定位能力,同时还要结合开放网络探索。 初步评估发现两个关键瓶颈: 1. **模态偏差(modality bias)**:智能体会绕过视觉工具,更倾向于使用文本搜索来回答问题。 2. **参数知识泄漏(parametric knowledge leakage)**:模型依赖内部记忆而非…