知识卡片:X-Lens:面向异构相机的实时度量深度估计
- 英文标题:X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras
- 英文关键词:metric depth estimation; heterogeneous cameras; fisheye; pinhole; real-time; foundation model
- 一句话结论:X-Lens 是一个仅 0.04B 参数、可达 41 FPS 的前馈模型,通过可学习校准令牌和 Jacobian 参数化畸变偏置,首次实现了对任意数量鱼眼与针孔视图的鲁棒度量深度估计,并在合成数据集 OmniScene 上相比最强基线将 AbsRel 降低 25.4% 的同时参数减少 88.9%。
事件概述/研究问题
现有度量深度估计模型通常针对单一相机类型(针孔或鱼眼)设计,难以处理实际系统中混合使用多种相机(如自动驾驶、机器人导航中同时搭载鱼眼和针孔相机)的场景。X-Lens 旨在解决异构相机系统下实时、准确的度量深度估计问题,支持可变数量的校准鱼眼与针孔输入视图。
方法/产品要点
- 几何感知的异构相机公式:核心包含两个可学习组件。
- 可学习校准令牌:为每张输入图像学习一个粗粒度的隐式对齐嵌入,将鱼眼与针孔的投影空间初步关联。
- Jacobian 参数化畸变偏置:注入交叉注意力层,显式建模局部投影变化,促进跨相机一致性。
- 前馈结构:紧凑设计,仅 0.04B 参数,支持实时推理(最高 41 FPS)。
- 直接预测:同时输出密集深度图与全局度量尺度,回避了辅助重建目标,从而降低计算与优化复杂度。
- 训练数据:在多个公共数据集以及新发布的大规模合成数据集 OmniScene 上训练。OmniScene 包含约 266K 个同步六视图帧、170 万张独立图像,覆盖 103 个室内外场景。
主要结果/产业意义
- 异构相机度量深度精度:在 OmniScene-Full 数据集上,X-Lens 的 AbsRel 比最强基线降低 25.4%,同时参数量减少 88.9%。
- 常规设置表现:在仅鱼眼或仅针孔的基准上同样具有竞争力。
- 效率:参数量仅 0.04B,推理速度可达 41 FPS,适合实时下游感知任务(如空间理解、避障、建图)。
为什么重要
X-Lens 是首个面向异构相机(鱼眼+针孔)的实时度量深度估计模型,其跨相机泛化能力源于几何感知设计,而非增加模型容量。结合新发布的 OmniScene 数据集,该工作为驾驶、机器人、AR/VR 等需要混合相机系统的应用提供了实用的基础模型。与已有相关卡片(均为其他领域)无重复;本条提供了异构相机深度估计的增量贡献。
局限与不确定性
- 模型要求所有输入相机已预先校准(内参已知);未校准或校准误差的影响待验证。
- OmniScene 为合成数据,真实场景泛化能力虽然通过实验验证,但极端光照、动态物体、低纹理区域等挑战下性能待进一步评估。
- 仅报告静态场景结果;动态场景中的时序一致性和度量尺度稳定性未在材料中明确讨论。
可用于图书/PPT/简报的角度
- 展示如何用极少量参数(0.04B)处理异构传感器融合问题,体现“几何先验+可学习”的设计哲学。
- 对比现有单一相机深度估计模型与 X-Lens 在精度/推理速度/参数量上的优势。
- 介绍 OmniScene 数据集构成(266K 帧、103 场景、六视图同步),作为大规模多视图合成数据集范例。
原始材料
- 论文标题:X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras
- arXiv ID:2607.12993v1
- 作者:Heng Zhou, Shuhong Liu, Yonghao He, Bohao Zhang, Fa Fu, Chenhui Hou, Xianbao Hou, Lijun Han, Wei Sui
- 发表/更新:2026-07-14
- 主要类别:cs.CV
- 摘要URL:https://arxiv.org/abs/2607.12993v1
- PDF URL:https://arxiv.org/pdf/2607.12993v1