When Replanning Becomes the Bottleneck: Budgeted Replanning for Embodied Agents
BRACE 控制器将具身智能体的重规划建模为预算控制循环,决定是否重规划、选择重规划模式并分配 token 预算和延迟 SLO。E-RECAP 是一种成本感知的渐进式 token 剪枝方法,跨 transformer 层剪枝重规划上下文,同时保留关键的头尾 token。在 Meta Habitat、RoboFactory 和 AirSim 中,BRACE 与 E-RECAP 将重规划调用的 token 数量减少 62-92%,SLO 违规率从 85.5-100.0% 降至 4.7-50.0%。
Development
- First ReportWhen Replanning Becomes the Bottleneck: Budgeted Replanning for Embodied AgentsarXiv cs.RO
- Current Assessment具身智能体的实时性要求与 LLM 推理延迟之间存在根本矛盾,随着上下文增长,重规划成为瓶颈。BRACE 和 E-RECAP 表明,通过预算控制和上下文剪枝,可以在保持任务成功率的同时满足延迟 SLO,这为实时具身智能体系统提供了实用方案。可验证的下一信号:是否有更多具身智能体框架采用预算化重规划或上下文剪枝技术,以及这些方法在真实机器人部署中的表现。Agent Pulse · analysis
具身智能体频繁重规划以应对执行漂移、部分可观测性和协调风险,但每次基于 LLM 的重规划调用会消耗随时间增长且跨智能体累积的文本上下文。当上下文变大时,重规划延迟出现重尾分布,即使任务成功率很高,也可能错过实时截止时间,这种失败模式难以从平均延迟或成功率中检测。BRACE 控制器将重规划形式化为预算控制循环,决定是否重规划、选择重规划模式,并分配显式 token 预算和延迟 SLO,同时考虑可选效率模块。E-RECAP 作为可复用组件,是一种成本感知的渐进式 token 剪枝方法,预测 token 效用并在 transformer 层间剪枝重规划上下文,同时保留关键的头尾 token。在 Meta Habitat、RoboFactory 和 AirSim 中,BRACE 与 E-RECAP 在任务成功率已饱和的设置中,将重规划调用的 token 数量减少 62-92%,SLO 违规率从 85.5-100.0% 降至 4.7-50.0%。
重规划延迟的重尾分布源于累积上下文随时间和智能体数量增长,导致 LLM 调用延迟超过实时截止时间,即使平均延迟和成功率看似正常。BRACE 将重规划视为预算控制问题,通过显式分配 token 预算和延迟 SLO 来管理延迟。E-RECAP 的渐进式剪枝方法预测 token 效用并跨层剪枝,同时保留头尾 token,表明上下文压缩可以显著降低延迟而不牺牲任务成功率。可验证的下一信号:在更长任务或更多智能体场景中,BRACE 的 SLO 违规率是否保持低水平,以及 E-RECAP 的剪枝策略是否适用于其他 transformer 架构。
具身智能体的实时性要求与 LLM 推理延迟之间存在根本矛盾,随着上下文增长,重规划成为瓶颈。BRACE 和 E-RECAP 表明,通过预算控制和上下文剪枝,可以在保持任务成功率的同时满足延迟 SLO,这为实时具身智能体系统提供了实用方案。可验证的下一信号:是否有更多具身智能体框架采用预算化重规划或上下文剪枝技术,以及这些方法在真实机器人部署中的表现。
对于开发实时具身智能体产品的公司,BRACE 和 E-RECAP 提供了一种降低推理成本(token 减少 62-92%)并满足延迟 SLO 的方法,从而提升系统可靠性和用户体验。可验证的下一信号:是否有商业产品采用类似技术并报告成本或延迟改进。
未来,具身智能体系统可能将重规划延迟作为一等公民进行管理,采用预算控制和上下文压缩技术。E-RECAP 的剪枝方法可能推广到其他长上下文 LLM 应用,如多智能体协作或长对话。可验证的下一信号:BRACE 是否被集成到主流具身智能体框架,以及 E-RECAP 是否在非具身场景中应用。