OoO-Spec: Out-of-Order Semantic Speculation for Fast Tool Calling
OoO-Spec 是一种用于加速工具调用的方法,在请求到达时,使用 Qwen3-0.6B 侧车模型并行预测函数选择和所有参数槽,而目标模型继续使用 ToolSpec 解码。运行时将槽值合并,渲染为文本,并暴露给后续候选构建轮次。目标模型轮询而不阻塞,重新标记化准备好的提示,并保持为唯一的验证者和提交权威。侧车使用 LoRA 在 Qwen2.5-32B 教师轨迹上训练一次,并跨 Qwen2.5、Qwen3 和 Llama 目标使用,无需针对目标进行训练。在七个完全排名目标和三个基准下,贪心批大小为 1 的解码中,OoO-Spec 在所有 21 个目标-基准组合中是最快的,达到 2.46 倍加速。
Development
- First ReportOoO-Spec: Out-of-Order Semantic Speculation for Fast Tool CallingarXiv cs.CL
- Current Assessment工具调用是 Agent 工作流的关键环节,OoO-Spec 的加速效果可能降低 Agent 的延迟和成本,从而提升 Agent 的实用性和用户体验。该方法无需针对目标模型训练,降低了部署成本,可能加速其在多模型环境中的采用。Agent Pulse · analysis
OoO-Spec 提出了一种乱序语义推测方法,用于加速大语言模型的工具调用。传统方法逐 token 生成工具调用,而 OoO-Spec 在请求到达时,通过一个 Qwen3-0.6B 侧车模型并行预测函数选择和所有参数槽,而目标模型继续使用 ToolSpec 解码。运行时将槽值合并,渲染为文本,并暴露给后续候选构建轮次。目标模型轮询而不阻塞,重新标记化准备好的提示,并保持为唯一的验证者和提交权威。侧车使用 LoRA 在 Qwen2.5-32B 教师轨迹上训练一次,并跨 Qwen2.5、Qwen3 和 Llama 目标使用,无需针对目标进行训练。在七个完全排名目标和三个基准下,贪心批大小为 1 的解码中,OoO-Spec 在所有 21 个目标-基准组合中是最快的,达到 2.46 倍加速。
OoO-Spec 的核心创新在于将工具调用的语义预测从自回归解码中解耦,通过侧车模型并行预测函数和参数,从而减少目标模型的解码步骤。这种方法避免了为每个目标模型训练专门的草稿模型,而是使用一个通用的侧车,通过 LoRA 在教师轨迹上训练,并跨多个目标模型使用。这暗示了推测解码的另一种范式:将语义预测与 token 生成分离,可能对工具调用场景特别有效。
工具调用是 Agent 工作流的关键环节,OoO-Spec 的加速效果可能降低 Agent 的延迟和成本,从而提升 Agent 的实用性和用户体验。该方法无需针对目标模型训练,降低了部署成本,可能加速其在多模型环境中的采用。
OoO-Spec 通过加速工具调用,直接降低 Agent 的推理延迟和计算成本,从而提升单位时间内的任务吞吐量。对于提供 Agent 服务的公司,这意味着更低的运营成本和更好的用户体验,可能转化为竞争优势。
未来,OoO-Spec 可能扩展到更多模型和更复杂的工具调用场景,并可能与其他推测解码方法结合。可验证的下一信号是:该方法是否被集成到主流推理框架(如 vLLM、TensorRT-LLM)中,以及是否在真实 Agent 工作负载中展示出显著的端到端延迟降低。