An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures
论文研究多语言多智能体系统中的规划失败,提出可操作的失败分类法,并引入TART方法。在GAIA基准上,TART将SOTA系统在11种语言上的平均准确率提升5.6个百分点。
发展脉络
- 首次出现An Actionable Diagnosis of Multilingual, Multi-Agent Planning FailuresarXiv cs.CL
- 当前判断多语言多智能体系统的性能差距是实际部署中的关键障碍,TART提供了一种可操作的缓解方法,可能推动多语言AI应用的落地。Agent Pulse · 分析
该论文指出多语言多智能体系统在非英语场景下性能显著下降,但以往研究很少识别用户请求转化为可执行计划时关键信息的丢失。作者将多智能体系统中的规划器视为请求到动作的接口,从真实世界失败执行中推导出规划-接地失败的分类法。基于LLM的分析显示,随着语言资源可用性下降,这些失败在失败执行中占比增加,在低资源语言中影响最强。为验证分类法是否支持缓解,作者提出TART(Taxonomy-Guided Actionable Representation),将分类法的关键方面显式提供给规划器和下游子代理。在多种语言、三个LLM骨干、两个数据集和两种代理配置下,TART持续提升性能。在多语言GAIA上,TART将SOTA系统的准确率在11种语言上平均提升5.6个百分点。
TART通过将失败分类法的关键方面显式编码到规划器的表示中,帮助规划器和子代理更好地对齐任务关键信息,从而减少多语言环境下的规划失败。这表明,针对失败模式的显式表示可能比单纯增加模型规模更有效地提升多智能体系统的鲁棒性。
多语言多智能体系统的性能差距是实际部署中的关键障碍,TART提供了一种可操作的缓解方法,可能推动多语言AI应用的落地。
对于提供多语言AI服务的公司,TART可提升系统在低资源语言上的可靠性,扩大市场覆盖,减少因语言差异导致的用户流失。
未来可验证的信号包括:TART在更多语言和任务上的泛化表现,以及其是否被集成到主流多智能体框架中。