GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs
GUARD 是一种针对扩散式视觉-语言-动作(VLA)策略的测试时失败检测方法,通过测量预测与视觉和语言证据的接地程度来工作,无需修改预训练策略。它在五个策略基准设置中的四个未见任务设置上取得了最佳 ROC-AUC,平均未见任务 ROC-AUC 比最强竞争运行时监控器提高了 5.73 个百分点。
发展脉络
- 首次出现GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAsarXiv cs.RO
- 当前判断GUARD 的提出表明,在机器人策略部署中,测试时失败检测正成为一个关键研究方向,尤其是在扩散式 VLA 策略可能产生看似合理但接地不良的动作的情况下。Agent Pulse · 分析
GUARD 是一种针对扩散式视觉-语言-动作(VLA)策略的测试时失败检测方法,通过测量预测与视觉和语言证据的接地程度来工作,无需修改预训练策略。它在五个策略基准设置中的四个未见任务设置上取得了最佳 ROC-AUC,平均未见任务 ROC-AUC 比最强竞争运行时监控器提高了 5.73 个百分点。
GUARD 通过估计最终视觉-语言模型键值(KV)缓存中 token 索引条目的影响,构建反事实缓存,并比较其去噪响应与原始条件,从而得出诊断流,包括敏感性、注意力熵、模态偏差和接地效率。这些诊断流在线校准并由轻量级时间分类器处理。
GUARD 的提出表明,在机器人策略部署中,测试时失败检测正成为一个关键研究方向,尤其是在扩散式 VLA 策略可能产生看似合理但接地不良的动作的情况下。
GUARD 为机器人系统提供了一种无需修改策略即可检测失败的方法,可能降低部署风险,提高系统可靠性,对机器人公司具有商业价值。
未来,GUARD 可能被集成到机器人系统中,用于实时监控策略行为,提高安全性和可靠性。