When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories
arXiv 论文 2608.06057v1 提出,在持久多轮工具调用中,历史轨迹可能结构有效但语义误导,导致模型决策被劫持。在 Qwen3-1.7B 上,污染使 32.1% 原本正确的决策翻转。论文引入配对基准 bench,包含原始、污染和 Oracle 状态视图,并提出方法 ours,通过软监督将 Oracle 条件教师策略迁移到仅观察污染历史的学生,达到 87.0% 的平衡工具使用准确率,优于 Gold-SFT (66.3%)、Oracle 序列蒸馏 (82.3%) 和离策略 token 蒸馏 (85.0%)。
发展脉络
- 首次出现When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn HistoriesarXiv cs.AI
- 当前判断该研究对 Agent 系统的可靠性提出警示:多轮工具调用中历史污染可能导致错误决策,影响企业级 Agent 的稳定性。基准 bench 和干预方法为评估和改进工具调用鲁棒性提供了工具,可能推动 Agent 开发中更严格的历史管理实践。可验证的下一信号:是否有主流 Agent 框架采用类似的历史污染防护机制。Agent Pulse · 分析
该论文研究工具调用智能体在多轮对话中因历史轨迹误导而失败的问题。作者指出,在持久交互中,历史痕迹可能保持结构有效和语义合理,但不再对当前请求具有权威性,从而劫持模型已有的策略。实验表明,在 Qwen3-1.7B 上,污染历史导致 32.1% 原本正确的决策被翻转,并频繁诱导模型重用损坏的实体或接口约定。为系统评估,作者引入配对基准 bench,提供同步的原始、污染和 Oracle 状态视图,保留系统策略、当前工具、最新请求和黄金下一步动作。通过十一种保留黄金的干预措施,隔离了决策状态、实体绑定和接口执行中的失败。作者提出方法 ours,通过软监督将 Oracle 条件教师策略迁移到仅观察污染历史的学生,在 Qwen3-1.7B 上达到 87.0% 的平衡工具使用准确率,优于 Gold-SFT (66.3%)、Oracle 序列蒸馏 (82.3%) 和离策略 token 蒸馏 (85.0%)。
该研究揭示了工具调用智能体在长对话中的脆弱性:历史轨迹的语义误导可导致策略翻转,即使模型已具备正确策略。提出的方法 ours 通过软监督蒸馏 Oracle 条件教师,在污染历史下显著提升准确率,表明从 Oracle 状态迁移知识是可行的。可验证的下一信号:该方法在更大模型(如 Qwen3-30B)上的效果,以及是否能在真实多轮工具调用场景中复现。
该研究对 Agent 系统的可靠性提出警示:多轮工具调用中历史污染可能导致错误决策,影响企业级 Agent 的稳定性。基准 bench 和干预方法为评估和改进工具调用鲁棒性提供了工具,可能推动 Agent 开发中更严格的历史管理实践。可验证的下一信号:是否有主流 Agent 框架采用类似的历史污染防护机制。
对于构建多轮工具调用 Agent 的企业,该研究提供了提升可靠性的方法,可能减少因历史污染导致的错误操作,降低运维成本。基准 bench 可用于评估 Agent 鲁棒性,方法 ours 可作为训练改进的参考。可验证的下一信号:是否有企业采用该方法或基准进行 Agent 质量评估。
未来,工具调用 Agent 可能需要引入历史权威性检测或 Oracle 条件训练,以抵御误导性历史。该研究的方法可能扩展到其他模型和场景,但需验证泛化性。可验证的下一信号:论文是否发布代码和基准,以及后续研究是否在更大模型上复现结果。