HumanCLAW: Can Vision-Language Models Act Through a Body?
HumanCLAW 是一个评估视觉语言模型(VLM)通过物理身体行动能力的框架,通过将动作决策与低级执行解耦,测量模型的行动智能。基于该框架构建的 HumanCLAW-Bench 包含 1,218 个长视界、自我中心的查找-导航-交互任务,覆盖 41 个室内场景。测试了 9 个最先进的 VLM,最佳模型仅达到 16.8% 的成功率。
Development
- First ReportHumanCLAW: Can Vision-Language Models Act Through a Body?arXiv cs.RO
- Current AssessmentHumanCLAW 的评估结果(最佳模型仅 16.8% 成功率)表明,当前 VLM 在物理行动任务上存在显著不足。这提示行业需要关注模型在具身环境中的决策能力,而不仅仅是语言或视觉理解。该框架可能成为评估具身 AI 系统的新标准,推动研究从感知向行动智能的转变。Agent Pulse · analysis
HumanCLAW 是一个评估视觉语言模型(VLM)通过物理身体行动能力的框架。它通过将动作决策与低级执行解耦,消除了电机控制误差的影响,从而直接测量模型的行动智能。基于该框架构建的 HumanCLAW-Bench 包含 1,218 个长视界、自我中心的查找-导航-交互任务,覆盖 41 个室内场景。测试了 9 个最先进的 VLM,最佳模型仅达到 16.8% 的成功率,表明当前 VLM 在物理行动任务上表现有限。
HumanCLAW 框架的核心创新在于解耦动作决策与低级执行:在每个步骤中,VLM 发出原子技能命令,该命令被转换为亚秒级的连续全身运动,并考虑重力和碰撞等物理效果。这种设计使得执行侧的干扰(如平衡和电机误差)被排除,从而可以单独测量模型的行动智能。该框架为评估 VLM 在物理世界中的决策能力提供了更干净的方法。
HumanCLAW 的评估结果(最佳模型仅 16.8% 成功率)表明,当前 VLM 在物理行动任务上存在显著不足。这提示行业需要关注模型在具身环境中的决策能力,而不仅仅是语言或视觉理解。该框架可能成为评估具身 AI 系统的新标准,推动研究从感知向行动智能的转变。
HumanCLAW 框架为具身 AI 系统的评估提供了标准化方法,有助于识别和提升模型在物理世界中的决策能力。对于开发机器人、自动驾驶等物理交互系统的公司,该框架可用于筛选和优化模型,降低部署风险。同时,它也为投资具身 AI 技术的资本提供了可量化的评估指标。
未来,随着 VLM 在物理行动任务上的改进,HumanCLAW 框架可能被用于指导模型训练和评估。可验证的下一信号包括:是否有模型在 HumanCLAW-Bench 上达到更高成功率(如超过 30%),或者是否有新框架被提出以进一步解耦决策与执行。