AI消息速览

RayViT——面向视角鲁棒模仿学习的射线条件视觉表示

事件日期 2026-07-31 · 学术前沿 · 已接受

事件日期2026-07-31
信息日期2026-07-31
入库日期2026-08-03
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:RayViT——面向视角鲁棒模仿学习的射线条件视觉表示

一句话结论

RayViT 通过向预训练 ViT 注入以 Plücker 射线图表示的相机几何信息,使视觉模仿学习策略在相机扰动下显著更鲁棒。

事件概述或研究问题

视觉模仿学习让机器人直接从图像习得视觉运动技能,但 RGB 观测缺少显式几何线索,导致策略在相机位姿变化时表现脆弱。本文提出 Ray-conditioned Vision Transformer Encoder(RayViT),在预训练 ViT 骨干中注入相机几何信息,以提升对视角扰动的鲁棒性。

方法/产品要点

  • 将相机几何表示为 Plücker 射线图,并 patch 化为射线特征。
  • 使用门控交叉注意力生成射线条件 class token。
  • 射线特征作为稠密位置嵌入加入 ViT;射线条件 class token 替代原始 ViT class token,提供几何感知的全局表征。
  • 结合辅助余弦相似度损失,持续改善几何感知 token 的性能与鲁棒性。
  • 整体架构轻量,可适配预训练 ViT 骨干。

主要结果或产业意义

  • 在多任务 RoboCasa 基准上,相机扰动下的鲁棒性相比基线提升约 13 个百分点。
  • 在真实世界多任务成功率上,平均完成阶段数相比基线提升 1.78。
  • 实验覆盖仿真与真实机器人任务,表明该方法具有实际部署价值。

为什么重要

RGB 图像缺乏显式几何信息,是视觉模仿学习在真实环境中对相机变化敏感的重要根因。RayViT 在不重建完整 3D 场景的前提下,以轻量方式让预训练视觉 Transformer 感知相机射线几何,为提升机器人视觉策略的部署鲁棒性提供了新思路。

局限与不确定性

  • 材料未给出具体基线方法、任务数量和实验细节,需进一步核实。
  • 未说明新增计算开销、推理速度、对预训练模型通用性等工程指标,待核实。
  • 未讨论在极端视角变化或动态相机场景下的性能边界,待核实。

可用于图书/PPT/简报的角度

  • 引出问题:机器人视觉模仿学习为何会因相机移动而失效?
  • 核心思路:利用相机射线的几何信息增强视觉表征,而非仅依赖 RGB 像素。
  • 效果展示:仿真与真实任务上的鲁棒性提升。
  • 启示:将任务相关几何先验注入预训练视觉模型,是提升具身智能泛化性的有效方向。

与既有脉络的关系

本条与已有卡片(奖励学习、安全导航、遥感视觉推理)主题不同,切入点是视觉模仿学习中的视角鲁棒性。增量信息在于:通过 Plücker 射线图将相机几何编码进 ViT 表征,可作为几何感知视觉编码器的轻量方案。

原始材料

  • 英文标题:RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning
  • 英文关键词(原文未提供正式关键词,基于标题/摘要提炼):RayViT; Viewpoint-Robust Imitation Learning; Ray-Conditioned Visual Representations; Plücker Ray Map; Camera Perturbation
  • arXiv ID:2607.29622v1
  • 作者:Qian Wang, Longrui Chen, Peiran Sun, Aleksandar Taranovic, Niklas Freymuth, Ge Li, Weiran Liao, C. F. Maximilian Nagy, Yucheng Tan, Tao Chen, Gerhard Neumann
  • 发布时间:2026-07-31T16:56:33Z
  • 分类:cs.RO, cs.CV
  • 原文链接:https://arxiv.org/abs/2607.29622v1