知识卡片:BooM-VVT:利用图像级伪数据增强免掩码视频虚拟试穿
英文标题: BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data
英文关键词: Mask-Free Video Virtual Try-On; Keyframe-Driven Video Generation; Image-Level Pseudo Data; Garment-Sensitive Keyframe Sampling; Frame-Shared 3D-RoPE; OmniView Dataset
一句话结论
BooM-VVT 是一个面向视频虚拟试穿的免掩码生成框架,在关键帧驱动范式下,用图像级伪数据降低对昂贵视频级伪数据的依赖,并结合服装敏感关键帧采样与 Frame-Shared 3D-RoPE,提升生成视频的时序一致性和服装细节保真度。
事件概述或研究问题
视频虚拟试穿旨在生成人物穿着目标服装的自然视频。现有方法多采用关键帧驱动的视频生成范式,但仍依赖掩码来定位试穿区域,因此在大幅运动或严重遮挡下容易失效。图像级免掩码试穿方法虽然借助大规模伪数据取得了较好效果,但直接扩展到视频时,构建视频级伪数据成本过高。
此外,已有关键帧驱动方法还面临两个问题:关键帧采样较粗糙,难以保持服装一致性;多视角试穿数据稀缺,难以支持复杂相机视角和多样化试穿任务。BooM-VVT 针对上述问题提出了一套免掩码技术方案。
方法/产品要点
- 图像级伪数据驱动免掩码定位学习:引入多阶段训练策略,利用图像级伪数据进行免掩码试穿区域定位学习,大幅减少对视频级伪数据的需求。
- 服装敏感关键帧采样(Garment-Sensitive Keyframe Sampling):基于服装相关身体区域选择关键帧,以更好捕捉服装外观信息。
- Frame-Shared 3D-RoPE:用于建立关键帧与目标视频帧之间的时空对应关系,实现更准确的服装细节迁移。
- OmniView 数据集:构建大规模多视角试穿数据集,用于支持复杂相机视角下的可靠试穿视频生成和多样化试穿任务。
主要结果或产业意义
论文报告,BooM-VVT 在时序一致性和服装保真度上优于现有方法。该工作对服装电商、虚拟试穿、短视频内容生成等场景具有潜在应用价值,尤其有助于降低视频试穿数据构建门槛。
具体量化评测指标、对比基线清单和用户研究等细节,待核实。
为什么重要
BooM-VVT 的核心增量在于:它尝试把“图像级伪数据”带来的免掩码训练优势引入视频虚拟试穿,同时不依赖昂贵的视频级伪数据。相比已有免掩码通用编辑工作(如 FlowMimic),该工作将问题聚焦到服装视频试穿场景,采用关键帧驱动范式,并针对服装一致性和多视角数据稀缺提出了配套机制。
它同时推动了一个技术路径上的重要变化:视频虚拟试穿可以逐步摆脱掩码依赖,从而更接近真实场景中无标注、大运动、复杂遮挡的实用需求。
局限与不确定性
- 当前公开材料以论文摘要和元数据为主,具体实验设置、数据规模、定量结果尚未从材料中确认,均需以论文全文为准。
- OmniView 数据集的规模、采集方式、服装覆盖范围、视角标注协议等细节待核实。
- 图像级伪数据策略在长视频、罕见姿态、极端遮挡等情形下的失效边界待核实。
- Frame-Shared 3D-RoPE 的具体实现细节和与其他位置编码方案的对比尚不明确,待核实。
- 是否真正实现完全免掩码的端到端视频试穿,仍需结合论文方法部分进一步确认。
可用于图书/PPT/简报的角度
- AI 视频生成在电商服装展示中的应用。
- “免掩码”为何是虚拟试穿走向实际部署的关键一步。
- 用图像级伪数据解决视频级数据稀缺问题的训练策略思路。
- 虚拟试穿中的服装一致性、多视角挑战与关键帧设计。
- 面向学术报告中“从图像编辑到视频编辑”的技术演进案例。
原始材料
- 标题:BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data
- arXiv ID:2609.04120v1
- URL:https://arxiv.org/abs/2609.04120v1
- PDF:https://arxiv.org/pdf/2609.04120v1
- DOI:10.1145/3767308.3835712
- 期刊/会议:Proceedings of the 34th ACM International Conference on Multimedia (MM ’26), 2026
- 作者:Wei Zhang, Xin Li, Peishu Shi, Jialin Gao, Xuekang Peng, Zhichao Lian, Yeying Jin
- 项目页:https://boomvvt.github.io/boomvvt