Track4Action: Distilling World-Centric 3D Tracker into Vision-Language-Action Policies
Track4Action 是一个将冻结的世界中心 3D 追踪器蒸馏到视觉-语言-动作(VLA)策略中的框架。在训练时,Track4World 将片段 V_{t:t+K} 编码为池化追踪器特征,可学习的追踪查询从当前 VLA 隐藏状态推断该特征,并在共享空间中匹配,通过特征门控调节流匹配动作头。部署时不需要片段或追踪器。在零样本 LIBERO-Plus 上达到 82.3%,比无对齐变体高 7.6 分,比 LaMP 高 3.0 分。在 RoboTwin 2.0 的干净和随机分割上分别获得 80.44% 和 81.48%,在四个物理双臂任务上平均成功率为 67.5%,比无对齐变体高 25.0 分。
Development
- First ReportTrack4Action: Distilling World-Centric 3D Tracker into Vision-Language-Action PoliciesarXiv cs.RO
- Current Assessment该工作表明,利用世界模型(如 3D 追踪器)提供的监督信号可以显著提升 VLA 策略的泛化能力,尤其是在零样本和物理任务上。这提示行业在开发机器人基础模型时,除了扩大数据规模,还应关注如何利用未标注的演示视频中的结构信息。蒸馏世界模型到策略的方法可能成为提升 VLA 性能的重要方向,推动机器人学习从模仿走向更深入的世界理解。Agent Pulse · analysis
Track4Action 提出了一种新框架,通过将世界中心 3D 追踪器蒸馏到 VLA 策略中,利用演示片段中的帧转换来提供动作标签缺失的 3D 世界变化监督。训练时,Track4World 将片段编码为池化特征,可学习查询从当前隐藏状态推断该特征并匹配,通过特征门控调节动作头。部署时无需片段或追踪器。实验显示,在零样本 LIBERO-Plus 上达到 82.3%,比无对齐变体高 7.6 分,比 LaMP 高 3.0 分;在 RoboTwin 2.0 干净和随机分割上分别获得 80.44% 和 81.48%;在四个物理双臂任务上平均成功率为 67.5%,比无对齐变体高 25.0 分。该工作展示了利用世界模型监督提升 VLA 策略泛化能力的潜力。
Track4Action 的核心创新在于利用冻结的世界中心 3D 追踪器提取演示片段中的几何、运动、可见性和相机变化信息,作为对齐目标。通过可学习查询从当前 VLA 隐藏状态推断追踪器特征,并在共享空间中匹配,实现训练时的对齐,而部署时无需额外模块。这种设计避免了在推理时引入追踪器,保持了部署效率。特征门控机制允许模型根据对齐质量调节动作生成,可能增强了策略对动态环境的适应性。
该工作表明,利用世界模型(如 3D 追踪器)提供的监督信号可以显著提升 VLA 策略的泛化能力,尤其是在零样本和物理任务上。这提示行业在开发机器人基础模型时,除了扩大数据规模,还应关注如何利用未标注的演示视频中的结构信息。蒸馏世界模型到策略的方法可能成为提升 VLA 性能的重要方向,推动机器人学习从模仿走向更深入的世界理解。
Track4Action 通过提升 VLA 策略的泛化能力,可能降低机器人部署中对大量任务特定数据的需求,从而减少数据采集成本。在物理任务上的显著提升(比无对齐变体高 25 分)表明其在实际机器人应用中的潜力,可能加速机器人自动化在制造业、物流等领域的落地。对于开发机器人基础模型的公司,该方法提供了一种利用现有演示数据提升性能的途径,具有商业价值。
未来,Track4Action 可能扩展到更多任务和更复杂的场景,例如长时程操作或动态环境。进一步的研究可能探索如何将追踪器特征与其他世界模型(如物理预测器)结合,以提供更丰富的监督。此外,该方法在真实机器人上的部署效果和扩展性值得关注,可能推动 VLA 策略在工业和服务机器人中的应用。