FutureBridge: Token Selection Beyond Local Preference in Collaborative Decoding
FutureBridge 是一种协作解码方法,在训练时使用答案验证的 LLM 轨迹提供固定共享未来,冻结的 SLM 评估每个候选 token,训练轻量级重排序器。推理时仅用 LLM 扩展候选池,选择 token 后交还 SLM 生成。在五个数学推理基准上,Qwen3-1.7B SLM 的 Math Avg. 相对贪心解码提升 35.1%。
Development
- First ReportFutureBridge: Token Selection Beyond Local Preference in Collaborative DecodingarXiv cs.CL
- Current Assessment该研究展示了小模型在 LLM 辅助下性能大幅提升的潜力,可能推动更高效的模型协作范式。未来,这种协作解码方法可能被集成到推理系统中,以较低成本提升小模型能力,对边缘计算和实时应用有重要意义。Agent Pulse · analysis
FutureBridge 提出了一种新的 token 级协作解码方法,用于大语言模型(LLM)辅助小语言模型(SLM)生成。现有方法依赖 LLM 的局部偏好(如干预 token 或 next-token 概率),但 LLM 选择的 token 可能不利于 SLM 后续推理。FutureBridge 通过训练时使用答案验证的 LLM 轨迹提供固定共享未来,让冻结的 SLM 在该共同上下文下评估每个候选 token,得到反事实分数,并监督一个轻量级 token 重排序器。推理时,LLM 仅用于扩展候选池,重排序器选择 token 后交还 SLM 生成,无需生成或附加未来后缀。在五个数学推理基准上,FutureBridge 使 Qwen3-1.7B SLM 的 Math Avg. 相对贪心解码提升 35.1%。结果表明,token 选择受益于建模接收方(SLM)的后续推理能力。
FutureBridge 的核心创新在于将 token 选择从局部偏好转向对接收方模型后续推理的建模。通过训练时使用固定共享未来(answer-verified LLM trajectory)和冻结 SLM 评估候选 token,生成反事实分数,训练轻量级重排序器。推理时仅用 LLM 扩展候选池,避免生成未来后缀,降低推理成本。该方法在数学推理任务上显著提升 SLM 性能,表明协作解码中考虑接收方模型的能力是关键。
该研究展示了小模型在 LLM 辅助下性能大幅提升的潜力,可能推动更高效的模型协作范式。未来,这种协作解码方法可能被集成到推理系统中,以较低成本提升小模型能力,对边缘计算和实时应用有重要意义。
该方法可降低对大型模型的依赖,通过协作解码提升小模型性能,从而降低推理成本。对提供 LLM API 或边缘 AI 解决方案的公司,这可能带来成本优势和新产品机会。
未来可验证的信号包括:该方法在其他任务(如代码生成、常识推理)上的泛化表现;重排序器在不同 SLM 和 LLM 组合下的鲁棒性;以及推理时开销的实际测量。若这些信号积极,可能推动协作解码成为标准实践。