Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies
研究提出 Cross-View Action Consistency 方法,通过跨视角动作流一致性正则化提升 VLA 策略对场景相机视角变化的鲁棒性。在 LIBERO-Plus 相机扰动基准上达到 87.2%±0.4% 成功率,比仅用流匹配训练高 7.4 个百分点。
Development
- First ReportCross-View Action Consistency for Camera-Robust Vision-Language-Action PoliciesarXiv cs.RO
- Current Assessment该研究针对机器人操作中相机视角变化导致策略失效的常见问题,提出了一种无需额外传感器或标定的解决方案。这可能降低 VLA 策略在真实部署中对相机位置的敏感性,推动机器人学习从仿真到现实的迁移。Agent Pulse · analysis
该论文研究视觉-语言-动作(VLA)策略在场景相机移动时的鲁棒性问题。作者发现,从固定场景相机微调的 VLA 策略在相机移动后性能下降,即使任务、物体、语言和机器人状态不变。他们提出一种方法,仅使用场景 RGB 图像、语言和本体感觉,无需相机标签、外参、深度或点云。方法基于流匹配的 VLA,通过构建动作等价视角对(将 LIBERO 演示重置到相同 MuJoCo 状态并渲染标称和扰动视角),并添加跨视角损失,使预测的动作流速度在相同采样流坐标上一致。在 LIBERO-Plus 相机扰动基准上,该方法达到 87.2%±0.4% 成功率(3 个训练种子各 4797 次 rollout),比仅流匹配训练(79.8%±0.8%)高 7.4 个百分点,比基线高 12.5 个百分点。
该方法通过正则化动作流速度场来增强相机鲁棒性,而非依赖相机标定或深度信息。跨视角损失强制模型在不同视角下预测一致的动作流,从而学习视角不变的表征。这暗示 VLA 策略的视角鲁棒性可以通过训练时数据增强和一致性约束实现,而无需改变模型架构。
该研究针对机器人操作中相机视角变化导致策略失效的常见问题,提出了一种无需额外传感器或标定的解决方案。这可能降低 VLA 策略在真实部署中对相机位置的敏感性,推动机器人学习从仿真到现实的迁移。
该方法可提升 VLA 策略在真实环境中的鲁棒性,减少因相机位置变化导致的重新训练成本,对机器人部署和产品化有积极意义。
未来可探索将该方法扩展到更多相机扰动类型(如旋转、缩放)和更复杂的任务,并验证其在真实机器人上的泛化能力。