知识卡片:从固定到自由相机:免标定的视角鲁棒视觉-语言-动作模型
英文标题:From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model
英文关键词:View-Robust VLA, Camera-Centric VLA, Calibration-Free, Hand-Eye Matrix, Monocular RGB, 6-DoF
原始来源:arXiv: 2607.05396v1 (2026-07-06),https://arxiv.org/abs/2607.05396v1;项目页面:https://alibaba-damo-academy.github.io/CamVLA/
一句话结论
CamVLA 通过让策略自主推断相机位置(而非被告知),仅依靠单目 RGB 图像和任务指令,即可在训练时未见过的相机视角下稳定执行操作任务,且无需相机外参标定或深度信息。
事件概述或研究问题
真实世界中的机器人部署很难保持训练时的相机设置——相机常因实际场景而被重新摆放或安装。现有的视角鲁棒视觉-语言-动作(VLA)策略只在明确提供相机外参的情况下才能容忍相机变化,这使得它们在视角鲁棒性关键时变得脆弱且难以使用。本文认为策略不应被告知相机在哪里,而应自己弄清楚。因此提出了 CamVLA。
方法/产品要点
- CamVLA 是一种新的 VLA 模型,它将操作控制与相机几何解耦,同时预测两个输出:
- 相机中心末端执行器动作:在局部相机坐标系下表达的末端执行器动作;
- 6-DoF 手眼矩阵:连接相机与机器人基座的变换矩阵。
- 通过确定性几何变换将上述两个预测组合为机器人基座坐标系下的动作。
- 该方法将“我该如何移动”(姿态无关的相机中心动作生成)与“我从哪里看”(相机视角几何定位)分离开。
- 部署时仅需单目 RGB 图像作为视觉观测和任务指令,无需相机标定、无需深度信息、单视图。
主要结果或产业意义
在仿真环境和真实机器人数据上的评估表明,CamVLA 在多种未见过的视角下持续提升任务成功率。具体成功率数字在摘要中未给出,可查阅论文正文。
为什么重要
- 消除了对相机外参标定的依赖,大幅降低部署成本与复杂度;
- 仅需单目 RGB,降低传感器要求;
- 策略自主适应视角变化,更适合动态变化的真实场景;
- 为视觉-语言-动作模型在灵活相机配置下的实际应用提供了新范式。
局限与不确定性
- 材料中未明确讨论失败案例、视角变化的许可范围、对遮挡或光照变化的鲁棒性等局限,需进一步参阅论文全文。
- 是否适用于多相机融合或大范围视角变化场景?待核实。
- 计算效率和实时性指标未在摘要中提及,待核实。
可用于图书/PPT/简报的角度
- “自适应相机几何”:强调机器人不应依赖预设的相机外参,而应通过内在推理理解“我在哪里看”,类似人眼无需每次测量即可调整动作。
- “三步走降低部署门槛”:从标定-深度-多视图到免标定-无深度-单视图,展示 CamVLA 如何简化机器人操作系统的视觉传感链。
- “解耦思想”:将动作生成(做什么)与视角感知(从哪看)分离,是视觉-语言-动作模型的重要设计思路,可类比于神经科学中的“where”与“what”通路。
原始材料
- 论文标题:From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model
- 作者:Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu
- 发布/更新日期:2026-07-06
- arXiv ID:2607.05396v1
- 分类:cs.CV (主), cs.AI, cs.LG, cs.RO
- 摘要原文:参见 https://arxiv.org/abs/2607.05396v1
- 项目页面:https://alibaba-damo-academy.github.io/CamVLA/