PACE: Adaptive Budget Allocation for Time-Efficient Embodied Planning
PACE (Planning with Adaptive Cognitive Effort) 框架通过 Interleaved Think-Act 架构和 Dynamic Budget Allocator 实现推理与执行交错,在 Robotouille 基准上使用 Qwen3-8B-AWQ 模型,相比 ReAct+Think 基线成功率提升 67%(达到 10%),思考时间加速 6.9 倍,66.8% 的思考时间隐藏在执行窗口内。
Development
- First ReportPACE: Adaptive Budget Allocation for Time-Efficient Embodied PlanningarXiv cs.RO
- Current Assessment该研究展示了在具身智能等实时场景中,通过算法优化而非单纯硬件升级来降低推理延迟的潜力。这可能推动行业关注推理效率的软件层面优化,尤其是在机器人、自动驾驶等对延迟敏感的应用中。Agent Pulse · analysis
PACE 框架针对具身智能系统中大语言模型推理延迟过高的问题,提出交错思考-执行架构和动态预算分配器,将认知处理与动作执行流水线化,并根据可用执行时间窗口调整推理 token 预算。在 Robotouille 基准上使用 Qwen3-8B-AWQ 模型,PACE 实现了 10% 的成功率,相比 ReAct+Think 基线提升 67%,同时思考时间加速 6.9 倍,66.8% 的思考时间隐藏在动作执行窗口内。这表明通过战略性地分配认知努力,可以在不牺牲规划质量的前提下显著提升推理效率。
PACE 的核心创新在于将推理与执行从串行改为交错,利用执行时间窗口隐藏推理延迟。Dynamic Budget Allocator 根据可用时间动态调整 token 预算,可能涉及对推理深度与实时性权衡的建模。这一方法可能启发更多关于推理时计算分配的研究,例如在资源受限的实时系统中如何优化推理策略。
该研究展示了在具身智能等实时场景中,通过算法优化而非单纯硬件升级来降低推理延迟的潜力。这可能推动行业关注推理效率的软件层面优化,尤其是在机器人、自动驾驶等对延迟敏感的应用中。
对于机器人或实时 AI 系统提供商,PACE 提供了一种在不增加硬件成本的情况下提升响应速度的方法,可能降低部署成本并提高系统实用性。对于模型服务商,这可能意味着推理成本模型的改变,因为按需分配计算资源成为可能。
未来可验证的信号包括:PACE 在更多具身任务和更大模型上的表现,以及其是否被集成到实际机器人系统中。此外,动态预算分配机制可能被扩展到其他实时推理场景。