知识卡片:ProxyPose:视频到视频转换的6自由度姿态追踪
英文标题:ProxyPose: 6-DoF Pose Tracking via Video-to-Video Translation
英文关键词:6-DoF Pose Tracking; Video-to-Video Translation; Video Diffusion Model; Proxy Video; Monocular Video
一句话结论
ProxyPose 通过将单目视频中的 6-DoF 姿态追踪问题转化为视频到视频的转换任务,仅需输入视频和首帧一个标记像素,利用微调的视频扩散模型生成代理视频,即可使用经典方法恢复 6-DoF 轨迹,在无需额外输入(如 3D 模型、深度图)的情况下达到最先进精度。
事件概述或研究问题
从单目视频中追踪物体或表面的六自由度(6-DoF)姿态是计算机视觉中的长期难题。现存方法通常需要输入 3D 模型、深度图、物体掩码或任务特定特征,并且在无纹理、透明、反光或可变形表面上表现不佳。ProxyPose 提出将其重构为视频到视频转换问题。
方法/产品要点
- 输入:仅需一段视频和第一帧中的一个标记像素。
- 转换:使用微调的视频扩散模型将输入视频转换为“代理视频”——一种合成视频,显示一个彩色多面体在标记像素所在的表面区域上经历相同的局部刚体运动。
- 姿态恢复:由于代理视频的几何形状和外观是已知的,恢复完整 6-DoF 轨迹简化为使用现成求解器的经典姿态估计问题。
- 预训练优势:利用大规模视频预训练,将姿态追踪中最困难的部分(处理挑战性材料、遮挡和变形)吸收到转换步骤中,在像素级别操作,无需假设物体身份、边界或全局刚性。
主要结果或产业意义
- ProxyPose 在 6-DoF 姿态追踪精度上达到最先进水平,且不需要竞争方法所需的额外输入。
- 仅在合成数据上微调视频模型后即取得该结果。
- 进一步扩展至面部追踪、相机姿态估计以及现有方法无法处理的野外面场景。
为什么重要
该方法摒弃了传统方法对 3D 模型、深度图等辅助数据的依赖,仅凭单目视频和单个标记点即可实现高精度追踪,尤其适用于无纹理、透明、反射、可变形物体等困难情况。其视频到视频的转换框架新颖,利用扩散模型的生成能力从数据中隐式学习复杂运动与外观,为姿态追踪提供了新范式。
局限与不确定性
- 训练数据:目前仅在合成数据上微调视频模型,在真实场景中的泛化能力(尤其是与真实数据分布差异较大时)需进一步验证。
- 计算代价:视频扩散模型推理可能比传统方法更耗资源,实时性待核实。
- 标记点选择:需要第一帧中一个标记像素,该点如何自动选择或由用户指定,材料中未明确说明,待核实。
- 运动假设:方法假设局部刚体运动,对于非刚体运动(如流体、大变形物体)的适用性待核实。
可用于图书/PPT/简报的角度
- 技术突破:如何利用生成式 AI(视频扩散模型)解决传统 3D 视觉难题。
- 领域应用:机器人操作、增强现实、自动驾驶中的姿态追踪新思路。
- 对比分析:与传统方法(标记点、深度图、模型匹配)相比的优缺点。
- 未来方向:无需标记点、实时化、泛化到更多非刚体运动。
原始材料
- 论文:Ruihang Zhang, Felix Taubner, Pooja Ravi, Kiriakos N. Kutulakos, David B. Lindell. "ProxyPose: 6-DoF Pose Tracking via Video-to-Video Translation." arXiv:2607.06555v1, 2026.
- 摘要:见上文引用。
- 项目页面:https://ruihangzhang97.github.io/proxypose/