Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents
TSDS 框架通过轻量级收敛探针和基于困惑度的延迟规则,在边缘设备上联合校准推理预算和云端调用,并在四个 ReAct 基准上评估。
Development
- First ReportThink Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM AgentsarXiv cs.AI
- Current Assessment该工作表明边缘 LLM 代理的推理预算管理正从启发式方法转向有理论保证的校准方法。联合优化多个目标(如性能和成本)成为趋势,可能推动边缘 AI 部署的标准化。Agent Pulse · analysis
TSDS 框架提出了一种协同集成轻量级收敛探针和基于困惑度的延迟规则的方法,用于边缘 LLM 代理。收敛探针在意图动作稳定后停止设备端推理,延迟规则将不确定动作升级到云端模型。两者通过多目标 Learn-Then-Test 过程在端到端轨迹上联合校准,提供期望奖励和云端调用率的有限样本保证。在 GSM8K、HotpotQA、MBPP 和 household robot 四个基准上评估,与仅校准思想和仅校准延迟的基线比较,TSDS 减少了云端调用并保持了性能。
TSDS 的核心创新在于将收敛探针和延迟规则联合校准,而非独立优化。这通过多目标 LTT 过程实现,同时保证奖励和成本。收敛探针基于动作稳定性,延迟规则基于困惑度,两者协同可更高效地分配边缘和云端资源。
该工作表明边缘 LLM 代理的推理预算管理正从启发式方法转向有理论保证的校准方法。联合优化多个目标(如性能和成本)成为趋势,可能推动边缘 AI 部署的标准化。
TSDS 降低了边缘设备对云端调用的依赖,从而减少延迟和成本,同时保持可靠性。这对部署 LLM 代理的物联网、机器人等场景有直接商业价值,可提升用户体验并降低运营成本。
未来可探索更复杂的延迟规则(如基于不确定性估计的多种云端模型选择),以及将 TSDS 扩展到更多任务类型和硬件平台。联合校准方法可能成为边缘代理的标准组件。