AI消息速览

RefCaptioner:多参考图像锚定的视频字幕生成

事件日期 2026-07-30 · 学术前沿 · 已接受

事件日期2026-07-30
信息日期2026-07-30
入库日期2026-08-01
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:RefCaptioner:多参考图像锚定的视频字幕生成

一句话结论

RefCaptioner 提出并解决“多参考图像锚定的视频字幕生成”(multi-reference image-grounded video captioning)这一新任务,用两阶段后训练让模型在生成视频描述时将短语级内容显式关联到多张参考图像,同时保持通用视频字幕能力;在开源模型中取得综合最佳表现,并能让下游视频生成器更忠实于源参考图进行重建。

事件概述 / 研究问题

现有视频字幕模型能生成自然语言描述,但无法把局部视觉元素显式关联到多张参考图像。为此,本文引入一个新任务:要求模型生成事实性的视频描述,并在短语级别完成对多张参考图像的绑定(phrase-level reference grounding)。作者提出 RefCaptioner 框架,并构建训练语料和评估基准 MRVBench。

方法/产品要点

  • 新任务:多参考图像锚定的视频字幕生成,输出不仅要描述视频内容,还要在短语级与多张参考图像建立对应关系。
  • RefCaptioner 框架:采用两阶段后训练(two-stage post-training),具体阶段划分细节待核实。
  • 训练策略:结合混合数据 SFT(mixed-data SFT,原文未展开全称)与 Hierarchical Coverage-Discounted GRPO(原文未展开 GRPO 全称,机制细节待核实)。
  • 优化目标:同时改进参考图像选择、短语级绑定、干扰项拒绝(distractor rejection,原文未展开定义,待核实)以及跨参考图一致性,同时保留通用视频字幕能力。
  • 训练语料:包含 20,000 个视频和 171,354 张参考图像。
  • 基准 MRVBench:用于在真实视频和 AI 生成视频上评估字幕事实性(factuality)与多参考图 grounding 能力。

主要结果 / 产业意义

  • 在开源模型中,RefCaptioner 取得综合最佳表现(原文表述为“the best overall performance among the open-source models”)。
  • 在标准视频字幕基准上,RefCaptioner 保持有竞争力的表现,但原文未称全面领先。
  • 人工评估显示:标注者更偏好 RefCaptioner 生成的字幕;这些字幕也能让开源和专有视频生成器实现更忠实于来源的视频重建。
  • 潜在应用方向包括:视频数据标注、参考图驱动的视频生成/编辑提示词生成、视频理解与生成之间的可追溯文本条件。应用推断待核实。

为什么重要

现有视频字幕模型通常只输出自然语句,缺少可验证、可引用的视觉依据。RefCaptioner 将“多参考图像 + 短语级 grounding”引入视频字幕生成,使字幕从单纯的描述结果变成可追溯的文本条件,并提供了 MRVBench 这样的专门评估基准,有助于推动视频理解与生成之间的闭环。

与既有脉络的关系

已有相关卡片主要围绕视频生成侧的参考一致性问题,如 MV-Forcing、测试时迭代优化、PACR-Video。本条不重复其技术机制,而是补充视频理解/字幕生成侧的新任务、两阶段后训练框架和 MRVBench 基准;增量信息在于“多参考图像 + 短语级 grounding”的任务定义与评估方式。

局限与不确定性

  • 仅基于 arXiv 摘要,未提供模型架构、两阶段训练的具体操作、GRPO 全称与超参数;待核实。
  • 未提供标准视频字幕基准上的具体分数、对比基线列表、消融实验细节;待核实。
  • MRVBench 的规模、构建流程、评估指标和任务具体设置尚未在摘要中展开;待核实。
  • 人工评估的具体协议、偏好幅度、视频重建评测方式未给出;待核实。
  • “开源模型中最佳”不等于全面超过闭源模型;原文在标准基准上使用的是“competitive”这一表述。

可用于图书/PPT/简报的角度

  • 从“描述视频”到“描述并指认参考图”:一个新视频理解任务的定义。
  • 两阶段后训练 + 强化学习在视觉-语言模型上的应用示例。
  • 以字幕为中间表示,连接多参考图像与视频生成。
  • 为什么需要同时评估事实性、grounding 和通用字幕能力:MRVBench 的定位。

原始材料

  • 英文标题:RefCaptioner: Multi-Reference Image-Grounded Video Captioning
  • 英文关键词:multi-reference image-grounded video captioning; phrase-level reference grounding; mixed-data SFT; Hierarchical Coverage-Discounted GRPO; MRVBench
  • 原始来源:https://arxiv.org/abs/2607.28509v1
  • arXiv ID:2607.28509v1
  • Primary category:cs.CV
  • Authors:Tengfei Liu, Yang Shi, Yuran Wang, Xiaohan Zhang, Yuqing Wen, Yuqi Tang, Qixun Wang, Zhuoran Zhang, Xuanyu Zhu, Weihong Lin, Xinlei Yu, Yujie Wei, Xinwei Long, Fengxiang Wang, Xinlong Chen, Yue Ding, Jialu Chen, Haotian Wang, Yuanxing Zhang
  • Published/Updated:2026-07-30(arXiv v1)
  • PDF URL:https://arxiv.org/pdf/2607.28509v1