Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation
arXiv 论文 2607.26148v1 研究零样本视觉语言导航中的具身智能体控制。在仅单目 RGB 相机和离散动作的严格最小条件下,默认配置的 opus-5 达到 70.7±3.5% 成功率(三次运行均值),fable-5 在最大努力下达到 78%。当暴露训练好的 waypoint 工具作为可选能力时,混合 fable-5 智能体在默认努力下达到 76.7±0.6% 成功率,使用环境步数减半,墙钟时间少于最大努力原始运行的四分之一。受控干预表明能力主要集中于模型:模型选择强烈改变成功率,harness 效应是描述性的,强制 waypoint 接口帮助较弱模型但可能阻碍较强模型。
Development
- First ReportEmbodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language NavigationarXiv cs.RO
- Current Assessment该研究挑战了工业级具身策略的必要性,显示零样本通用智能体在最小接口下可与之竞争。这可能降低具身 AI 系统的开发成本,使更多团队无需大规模训练数据即可构建导航智能体。混合工具增强表明,将训练好的工具作为可选能力可提升效率,可能推动模块化智能体架构。模型中心性强调基础模型进步对具身 AI 的重要性,可能引导投资流向通用模型而非专用策略。Agent Pulse · analysis
arXiv 论文 2607.26148v1 研究具身智能体控制,即通用智能体在零样本导航中维持感知-行动-验证-自我纠正的循环。在仅单目 RGB 相机和离散动作的严格最小条件下,评估三种软件工程智能体 harness。默认配置的 opus-5 达到 70.7±3.5% 成功率,fable-5 在最大努力下达到 78%。当暴露训练好的 waypoint 工具作为可选能力时,混合 fable-5 智能体在默认努力下达到 76.7±0.6% 成功率,使用环境步数减半,墙钟时间少于最大努力原始运行的四分之一。受控干预表明能力主要集中于模型:模型选择强烈改变成功率,harness 效应是描述性的,强制 waypoint 接口帮助较弱模型但可能阻碍较强模型。
该研究将具身控制视为通用智能体维持决策循环的第三种形式,区别于任务特定工作流和具身策略。在最小接口下,默认配置的 opus-5 达到 70.7% 成功率,表明通用模型无需专门训练即可执行导航。混合 waypoint 工具将 fable-5 的成功率提升至 76.7%,同时减少一半环境步数和四分之一墙钟时间,显示工具增强的潜力。模型选择对成功率影响显著,而 harness 效应是描述性的,表明模型能力是主要瓶颈。强制 waypoint 接口对较弱模型有帮助但可能阻碍较强模型,提示工具集成需要自适应。
该研究挑战了工业级具身策略的必要性,显示零样本通用智能体在最小接口下可与之竞争。这可能降低具身 AI 系统的开发成本,使更多团队无需大规模训练数据即可构建导航智能体。混合工具增强表明,将训练好的工具作为可选能力可提升效率,可能推动模块化智能体架构。模型中心性强调基础模型进步对具身 AI 的重要性,可能引导投资流向通用模型而非专用策略。
该研究可能降低具身 AI 系统的开发门槛,使企业无需大规模专用训练即可部署导航智能体。混合工具增强减少计算资源需求,可能降低运营成本。模型中心性表明投资通用模型比专用策略更具杠杆效应,可能影响研发资源分配。
未来可验证信号包括:更强模型在最小接口下是否持续提升成功率;waypoint 工具在更多环境中的泛化能力;自适应工具暴露策略是否成为标准;以及该范式是否扩展到其他具身任务如操作。