知识卡片:基于物理引导的视频眼镜去除方法
一句话结论
本研究提出一种基于物理仿真的知识迁移框架,将商业级生成模型(Nano Banana, Gemini 3 Pro Image)的高质量人脸图像先验转移到专用修复网络 JFSnet,用于视频中眼镜的高保真去除;在保持身份、表情和姿态的同时,达到 27.68 FPS 的推理速度,并在感知评估中优于扩散与 GAN 基线。
事件概述或研究问题
视频眼镜去除是面部属性编辑中的难点:眼镜造成的折射畸变和随视角变化的镜面反射会遮挡人脸几何结构。现有基于大规模生成先验的静态图像修复方法容易出现“身份漂移”,难以保持身份、表情和姿态的一致性。
方法/产品要点
- 使用商业级生成模型(Nano Banana,Gemini 3 Pro Image)提取高保真合成人脸图像。
- 通过三阶段结构滤波对合成图像进行正则化,保留身份、表情和姿态。
- 在训练中引入基于物理的镜片光学仿真,生成多样化的成对数据。
- 将上述知识迁移到专用修复网络 JFSnet(Joint Feature-Spatial network)。
- JFSnet 融合 DINOv2 语义特征与卷积解码器进行空间重建,并利用平移等变约束改善时间一致性与高频细节保持。
主要结果或产业意义
- 在精选的 Flickr-Faces-HQ(FFHQ)子集(12,163 张图像)上验证了高保真度和结构准确性。
- 推理速度为 27.68 FPS,具备实时应用潜力。
- 在 CelebV-Text 视频序列的感知研究中,该方法在眼部一致性、时间稳定性和整体修复质量上持续优于扩散和 GAN 基线。
为什么重要
本工作处理了生成式先验的随机性问题,通过“先验知识迁移 + 专用修复网络 + 物理仿真数据”的组合,在视频级眼镜去除任务中兼顾身份保持、时间一致性和实时性,为面部属性编辑提供了一条不同于纯扩散模型修复的工程路径。
局限与不确定性
- 摘要未提供感知研究中相对基线优势的定量幅度、具体评测人数和统计显著性,待核实。
- 未说明 FFHQ 子集的挑选标准,以及在该子集上的具体量化指标(如 FID、身份相似度等),待核实。
- 未提供与更多基线(如视频级扩散模型)的详细对比细节,待核实。
- 商业生成模型的具体使用方式、三阶段结构性滤波的实现细节,以及 JFSnet 的网络参数均已省略,待核实。
可用于图书/PPT/简报的角度
- 人脸视频编辑中的身份保持挑战。
- 生成先验与专用图像复原架构的配合。
- 物理光学仿真作为训练数据增强来源。
- 视频眼镜去除从图像修复向时序一致迁移的方法论。
原始材料
- 英文标题: Unwarping the Lens: A Physics-Grounded Approach to Video Glasses Removal
- 英文关键词: Video glasses removal; Facial attribute editing; Generative priors; Physics-based simulation; JFSnet
- arXiv ID: 2608.20212v1
- 作者: Radim Spetlik, David Futschik, Radek Danecek, Feitong Tan, Ziqian Bai, Rohit Pandey, Yinda Zhang
- 发布/更新日期: 2026-08-20
- 分类: cs.CV
- URL: https://arxiv.org/abs/2608.20212v1
- PDF: https://arxiv.org/pdf/2608.20212v1