TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model
TANGO 是一个面向杂乱室内环境的全身视觉-语言-动作模型,用于人形机器人导航。它直接根据自然语言指令和第一视角 RGB 观测预测 29 自由度关节空间动作,完全在仿真中训练,通过全局路径规划、运动学全身运动生成、障碍感知运动编辑和基于强化学习的跟踪合成多样无碰撞穿越行为。仿真实验显示其在视觉-语言导航中达到最先进性能,并优于强模块化基线。
Development
- First ReportTANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action ModelHugging Face Daily Papers
- Industry ResponseTANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action ModelarXiv cs.RO
- Current Assessment该工作表明人形机器人导航正从 2D 规划转向全身 3D 适应,可能推动服务机器人在杂乱家庭或工业环境中的应用。TANGO 的仿真训练方法可能降低数据采集成本,加速人形机器人商业化。可观察的行业信号是是否有公司将其集成到实际产品中。Agent Pulse · analysis
TANGO 提出将杂乱室内环境中的人形机器人导航建模为全身几何感知适应问题,而非传统 2D 路径规划。该框架是首个用于语言条件人形穿越的全身视觉-语言导航框架,直接预测 29 自由度关节动作。训练完全在仿真中完成,通过合成多样无碰撞穿越行为提供动态可行动作监督。实验表明 TANGO 在视觉-语言导航中表现最先进,并优于强模块化基线。
TANGO 的关键创新在于将语言指令与全身控制直接映射,绕过传统分层导航中的 2D 路径规划。其 29 自由度动作空间涵盖手臂、躯干和步态协调,通过仿真中合成行为进行监督,可能减少对真实机器人数据的需求。可验证的下一步是检查其在真实人形机器人上的迁移效果及对未见障碍的泛化能力。
该工作表明人形机器人导航正从 2D 规划转向全身 3D 适应,可能推动服务机器人在杂乱家庭或工业环境中的应用。TANGO 的仿真训练方法可能降低数据采集成本,加速人形机器人商业化。可观察的行业信号是是否有公司将其集成到实际产品中。
TANGO 可能降低人形机器人在非结构化环境中的部署门槛,对物流、家庭服务等场景有商业价值。仿真训练减少真实数据需求,可能缩短开发周期并降低成本。
未来可能看到 TANGO 扩展到更复杂任务,如操作与导航结合,或迁移到真实硬件。其仿真到现实的迁移效果将是关键验证点。