ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies
ValueFormer 论文提出一种紧凑的、策略无关的因果 Transformer,基于冻结的 DINOv3 骨干,在一次前向传播中输出两个逐帧信号:用于优势估计的平滑蒙特卡洛值 V_mc 和用于在线错误检测的尖锐二值值。失败片段使用阶段感知的成功后衰减回报进行标注,错误检测从错误区间而非单一失败时间进行监督。
发展脉络
- 首次出现ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action PoliciesarXiv cs.RO
- 当前判断该研究针对真实机器人经验成本高且变形食物难以模拟的场景,提出了一种无需强化学习的替代方案,通过值函数提供进度信号。这可能推动半自主 VLA 策略在机器人操作中的应用,尤其是在数据稀缺的领域。Agent Pulse · 分析
ValueFormer 论文针对视觉-语言-动作(VLA)策略在行为克隆训练中失败时无法从动作流中察觉的问题,提出了一种紧凑的、策略无关的因果 Transformer 值函数。该模型基于冻结的 DINOv3 骨干,在一次前向传播中输出两个逐帧信号:用于优势估计的平滑蒙特卡洛值 V_mc 和用于在线错误检测的尖锐二值值。论文强调逐帧标签而非架构是难点,标签需要密集、连续且形状正确。失败片段使用阶段感知的成功后衰减回报进行标注,错误检测从错误区间而非单一失败时间进行监督。
ValueFormer 的核心贡献在于标签设计:阶段感知的成功后衰减回报保留了失败阶段之前的成功曲线,使得值函数能够区分成功进展与失败。双信号输出(平滑 V_mc 和尖锐二值)在目标上相互对立,但通过设计实现了优势估计和错误检测的兼顾。这种策略无关的架构可能适用于多种 VLA 策略,但论文未提供具体性能数据。
该研究针对真实机器人经验成本高且变形食物难以模拟的场景,提出了一种无需强化学习的替代方案,通过值函数提供进度信号。这可能推动半自主 VLA 策略在机器人操作中的应用,尤其是在数据稀缺的领域。
对于机器人公司,该方法可能降低训练 VLA 策略的成本,通过值函数实现错误检测和优势估计,提升策略的鲁棒性,从而加速半自主机器人的商业化部署。
后续可关注该方法的开源代码和实验数据,以验证其在不同 VLA 策略上的泛化能力。若有效,可能成为机器人学习中的标准组件。