知识卡片:RayViT——面向视角鲁棒模仿学习的射线条件视觉表示
一句话结论
RayViT 通过向预训练 ViT 注入以 Plücker 射线图表示的相机几何信息,使视觉模仿学习策略在相机扰动下显著更鲁棒。
事件概述或研究问题
视觉模仿学习让机器人直接从图像习得视觉运动技能,但 RGB 观测缺少显式几何线索,导致策略在相机位姿变化时表现脆弱。本文提出 Ray-conditioned Vision Transformer Encoder(RayViT),在预训练 ViT 骨干中注入相机几何信息,以提升对视角扰动的鲁棒性。
方法/产品要点
- 将相机几何表示为 Plücker 射线图,并 patch 化为射线特征。
- 使用门控交叉注意力生成射线条件 class token。
- 射线特征作为稠密位置嵌入加入 ViT;射线条件 class token 替代原始 ViT class token,提供几何感知的全局表征。
- 结合辅助余弦相似度损失,持续改善几何感知 token 的性能与鲁棒性。
- 整体架构轻量,可适配预训练 ViT 骨干。
主要结果或产业意义
- 在多任务 RoboCasa 基准上,相机扰动下的鲁棒性相比基线提升约 13 个百分点。
- 在真实世界多任务成功率上,平均完成阶段数相比基线提升 1.78。
- 实验覆盖仿真与真实机器人任务,表明该方法具有实际部署价值。
为什么重要
RGB 图像缺乏显式几何信息,是视觉模仿学习在真实环境中对相机变化敏感的重要根因。RayViT 在不重建完整 3D 场景的前提下,以轻量方式让预训练视觉 Transformer 感知相机射线几何,为提升机器人视觉策略的部署鲁棒性提供了新思路。
局限与不确定性
- 材料未给出具体基线方法、任务数量和实验细节,需进一步核实。
- 未说明新增计算开销、推理速度、对预训练模型通用性等工程指标,待核实。
- 未讨论在极端视角变化或动态相机场景下的性能边界,待核实。
可用于图书/PPT/简报的角度
- 引出问题:机器人视觉模仿学习为何会因相机移动而失效?
- 核心思路:利用相机射线的几何信息增强视觉表征,而非仅依赖 RGB 像素。
- 效果展示:仿真与真实任务上的鲁棒性提升。
- 启示:将任务相关几何先验注入预训练视觉模型,是提升具身智能泛化性的有效方向。
与既有脉络的关系
本条与已有卡片(奖励学习、安全导航、遥感视觉推理)主题不同,切入点是视觉模仿学习中的视角鲁棒性。增量信息在于:通过 Plücker 射线图将相机几何编码进 ViT 表征,可作为几何感知视觉编码器的轻量方案。
原始材料
- 英文标题:RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning
- 英文关键词(原文未提供正式关键词,基于标题/摘要提炼):RayViT; Viewpoint-Robust Imitation Learning; Ray-Conditioned Visual Representations; Plücker Ray Map; Camera Perturbation
- arXiv ID:2607.29622v1
- 作者:Qian Wang, Longrui Chen, Peiran Sun, Aleksandar Taranovic, Niklas Freymuth, Ge Li, Weiran Liao, C. F. Maximilian Nagy, Yucheng Tan, Tao Chen, Gerhard Neumann
- 发布时间:2026-07-31T16:56:33Z
- 分类:cs.RO, cs.CV
- 原文链接:https://arxiv.org/abs/2607.29622v1