RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning
RayViT 是一种射线条件视觉 Transformer 编码器,将相机几何信息注入预训练的 ViT 主干。它使用 Plücker 射线图、门控交叉注意力和辅助余弦相似度损失。在 RoboCasa 基准测试中,相机扰动下的鲁棒性提高了约 13 个百分点;在真实世界多任务成功率中,平均完成阶段数提高了 1.78。
发展脉络
- 首次出现RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation LearningarXiv cs.RO
- 当前判断该研究展示了将几何先验注入预训练视觉模型的有效性,可能推动机器人操作领域对相机鲁棒性的重视。随着多任务机器人学习基准(如 RoboCasa)的普及,对相机扰动鲁棒性的评估可能成为标准,促使更多研究关注几何感知表示。Agent Pulse · 分析
视觉模仿学习使机器人能够直接从图像中获取视觉运动技能,但 RGB 观测缺乏明确的几何线索,导致策略对相机扰动脆弱。为此,研究者提出 RayViT,一种轻量级架构,将相机几何注入预训练的 ViT 主干。RayViT 将相机几何表示为 Plücker 射线图,将其分块为射线特征,并使用门控交叉注意力生成射线条件类标记。这些射线特征作为密集位置嵌入添加,而射线类标记替换原始 ViT 类标记以提供几何感知的摘要表示。该方法结合辅助余弦相似度损失,持续提高几何感知标记的性能和鲁棒性。在模拟和真实机器人任务上的实验表明,与基线相比,RayViT 在多任务 RoboCasa 基准的相机扰动下鲁棒性提高了约 13 个百分点,在真实世界多任务成功率中平均完成阶段数提高了 1.78。
RayViT 的核心创新在于将相机几何显式编码为 Plücker 射线图,并通过门控交叉注意力将其注入预训练 ViT,从而在不重新训练主干的情况下增强几何感知。辅助余弦相似度损失进一步稳定了射线条件标记的训练。这表明,在视觉模仿学习中,显式几何先验可以显著提升对相机扰动的鲁棒性,且计算开销小。
该研究展示了将几何先验注入预训练视觉模型的有效性,可能推动机器人操作领域对相机鲁棒性的重视。随着多任务机器人学习基准(如 RoboCasa)的普及,对相机扰动鲁棒性的评估可能成为标准,促使更多研究关注几何感知表示。
对于机器人公司,RayViT 提供了一种低成本提升视觉策略鲁棒性的方法,可能减少对精确相机标定的依赖,降低部署成本。在工业场景中,相机扰动是常见问题,该技术可能提高机器人系统的可靠性,加速商业化落地。
未来,RayViT 可能扩展到其他视觉任务,如具身导航或操作,并可能与其他传感器模态(如深度)结合。可验证的下一信号包括:在更多真实世界场景中的部署测试,或与其他几何感知方法的对比研究。