AI消息速览

RefVideo-6M:面向指令视频编辑的参考引导数据集

事件日期 2026-08-26 · 学术前沿 · 已接受

事件日期2026-08-26
信息日期2026-08-26
入库日期2026-08-27
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:RefVideo-6M:面向指令视频编辑的参考引导数据集

一句话结论

RefVideo-6M 是一个包含 500 万视频编辑样本和 100 万图像编辑样本的大型参考引导数据集,它把无伪影的真实视频作为编辑目标,并提供约 600 万视觉参考,以缓解现有数据集目标视频伪影多、视觉参考缺乏的问题。

事件概述/研究问题

近年来,视频编辑的进展在很大程度上依赖大规模指令式数据集。但已有数据集有两个关键局限:

  • 目标视频通常由自动编辑模型生成,可能带有可见伪影,导致监督信号不可靠;
  • 多数公开数据集主要依赖文本指令,缺少对精确编辑、身份保持和可控编辑至关重要的视觉参考。

针对这些局限,作者构建了 RefVideo-6M。

方法/产品要点

  • 数据规模:500 万视频编辑样本 + 100 万图像编辑样本,合计约 600 万编辑样本;同时提供约 600 万视觉参考。
  • 构建管线:将无伪影的真实视频作为编辑目标,使用多个编辑专家生成经过质量过滤的输入条件。
  • 视觉参考设计:覆盖多种参考类型和编辑场景,使模型能学习文本指令之外的细粒度视觉对应关系。
  • 配套模型:基于 RefVideo-6M 训练了参考引导视频编辑模型 Ref-MoT,用于验证数据集的有效性和可扩展性。

主要结果/产业意义

大量实验表明,RefVideo-6M 比现有数据集提供更可靠的监督,能够训练出视觉质量、可控性和参考一致性更好的视频编辑模型。该数据集已开源,可作为视频编辑模型训练的数据基础设施,并为参考引导编辑的产品化提供规模化数据支持。

为什么重要

RefVideo-6M 把“视觉参考”从辅助信息提升为大规模数据集的核心组成部分。相比纯文本指令,视觉参考能更直接地保留身份、细节和编辑意图。它为视频编辑模型提供了一条“真实目标视频 + 多专家生成条件 + 视觉参考”的可靠监督路线,用真实无伪影视频作为目标,直接从数据源头降低了伪影被当作真值学习的风险。

与既有脉络的关系

与 FlowMimic(聚焦如何从图像编辑样本生成视频编辑训练数据)和 ElasticTTT(聚焦测试时调优算法)不同,RefVideo-6M 属于数据资源与基准构建层面的贡献:它直接提供大规模、质量过滤的参考引导数据集,并配套 Ref-MoT 模型验证数据的可扩展性。其增量信息在于“参考引导 + 可靠目标”的大规模数据新基准。

局限与不确定性

  • 摘要未报告与现有数据集进行定量对比的具体数值和评测指标,提升幅度待核实。
  • Ref-MoT 的模型架构、参数量、训练细节和具体推理成本未在摘要中说明,待核实。
  • 视觉参考的具体类型(如图像、掩码、姿态、深度等)未在摘要中展开,待核实。
  • 数据集可能存在的内容偏差、标注误差或社会影响问题,原文未讨论,待核实。

可用于图书/PPT/简报的角度

  • 从文本指令到视觉参考:视频编辑数据集设计的下一个方向。
  • 数据质量决定模型上限:为什么用真实视频做编辑目标,而不是用编辑模型的输出。
  • 规模化参考引导编辑:500 万视频 + 100 万图像样本带来的训练与产业想象空间。

原始材料

  • 英文标题:RefVideo-6M: A Reliable Reference-Based Dataset for Instructional Video Editing
  • 英文关键词:原文未单独列出;以下为据摘要提炼,待核实:reference-based video editing; instruction-based dataset; visual reference
  • 来源:arXiv:2608.26101v1 [cs.CV]
  • URL:https://arxiv.org/abs/2608.26101v1
  • PDF:https://arxiv.org/pdf/2608.26101v1
  • 作者:Bojia Zi, Xiaoyan Yang, Yu Zhou, Ruijie Sun, Lihan Zhang, Bin Liang, Kam-Fai Wong, Haibin Huang, Chi Zhang, Xuelong Li
  • 发布时间:2026-08-26
  • 数据集开源地址:https://huggingface.co/datasets/RefVideo6M/RefVideo6M