$ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation
arXiv 论文提出 $ω$-0,一种用于真实世界人形机器人并发移动-操作任务的潜在预测全身世界动作模型。该模型以语言指令、当前视觉观察和机器人本体感受状态为输入,直接预测控制器兼容的全身动作潜在变量,用于真实机器人执行。它学习紧凑的未来观察嵌入作为轻量级预测目标,将潜在视觉预见与基于扩散的全身动作生成相结合。模型支持自我中心 RGB、外部 RGB 和外部深度输入,并利用基于控制器的模拟重放将人类/公共视觉-运动先验落地为机器人可执行的动作潜在变量。论文还收集了 $ω$-HOME,一个 40 多小时的真实世界家庭人形机器人数据集,包含同步多视角观察。
Development
- First Report$ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-ManipulationarXiv cs.RO
- Current Assessment该研究针对人形机器人在家庭场景中的并发移动-操作任务,这是人形机器人商业化的关键瓶颈之一。通过统一移动和操作,$ω$-0 可能推动人形机器人在家庭服务、物流等场景的落地。可验证的下一信号是:该模型是否能在更多真实场景中泛化,以及是否有公司将其集成到产品中。Agent Pulse · analysis
arXiv 论文介绍了 $ω$-0,一种用于真实世界人形机器人并发移动-操作任务的潜在预测全身世界动作模型。现有的人形机器人策略通常将移动和操作分解,而最近的世界动作模型要么以手臂为中心,要么以视频为中心。$ω$-0 直接预测控制器兼容的全身动作潜在变量,用于真实机器人执行,而不是重建未来视频。它学习紧凑的未来观察嵌入作为轻量级预测目标,将潜在视觉预见与基于扩散的全身动作生成相结合。模型支持多种输入模态,并利用基于控制器的模拟重放将人类/公共视觉-运动先验落地为机器人可执行的动作潜在变量。论文还收集了 $ω$-HOME,一个 40 多小时的真实世界家庭人形机器人数据集,包含同步多视角观察。
$ω$-0 的核心创新在于将潜在预测目标与扩散动作生成结合,避免了视频重建的高计算成本,同时通过控制器模拟重放将人类先验转化为机器人可执行的动作。这暗示了世界模型在人形机器人领域的新方向:从视频预测转向潜在空间预测,以提升实时性和可执行性。可验证的下一信号是:论文是否提供真实机器人实验的量化结果(如成功率、操作精度),以及 $ω$-HOME 数据集是否公开可用。
该研究针对人形机器人在家庭场景中的并发移动-操作任务,这是人形机器人商业化的关键瓶颈之一。通过统一移动和操作,$ω$-0 可能推动人形机器人在家庭服务、物流等场景的落地。可验证的下一信号是:该模型是否能在更多真实场景中泛化,以及是否有公司将其集成到产品中。
对于人形机器人公司,$ω$-0 提供了一种更高效的控制方法,可能降低开发成本并提升任务成功率。对于投资者,该研究标志着人形机器人从单一操作向全身协调的进步,可能影响相关公司的技术路线。可验证的下一信号是:是否有公司采用该模型或类似方法,以及相关产品的市场表现。
未来,$ω$-0 可能推动人形机器人从实验室走向实际应用,特别是在需要全身协调的复杂任务中。潜在预测世界模型可能成为人形机器人控制的主流范式。可验证的下一信号是:后续工作是否扩展该模型到更多任务和场景,以及是否出现基于该模型的商业产品。