Two Calls Beat Five Agents: Evaluating Multi-Agent Pipelines Against Self-Refinement for Local Language Models
arXiv 论文 2607.26922v1 研究 Parishad 多智能体系统(五个角色)在本地模型 Qwen2.5-7B-Instruct 上的表现。在 GSM8K 上,JSON 格式准确率从 75.0% 降至 45.0%,纯文本格式恢复至 82.0%;两次调用自优化(V1)达到 86.2%,token 使用量降低 7.4 倍。在 HumanEval 上,V1 将准确率从 96.3% 破坏至 66.5%,任务感知门控设计(V2)保持 95.1%。
Development
- First ReportTwo Calls Beat Five Agents: Evaluating Multi-Agent Pipelines Against Self-Refinement for Local Language ModelsarXiv cs.LG
- Current Assessment该研究挑战了多智能体系统在本地小模型上的有效性,表明架构复杂性并非决定性因素,通信格式和实现细节更关键。对于资源受限的本地部署,简单方法(如两次调用自优化)可能更高效。这提示行业在构建 Agent 系统时,应优先优化任务分解和通信协议,而非盲目增加角色数量。同时,任务感知的自适应策略(如门控)对避免性能退化至关重要,可能成为未来 Agent 设计的重要方向。Agent Pulse · analysis
该研究评估了多智能体流水线(Parishad,五个角色)与自优化方法在本地 7B 模型上的表现。在 GSM8K 上,多智能体系统因 JSON 格式导致错误累积,准确率从 75.0% 降至 45.0%,改用纯文本后恢复至 82.0%。两次调用自优化(V1)达到 86.2%,且 token 使用量降低 7.4 倍。在 HumanEval 上,直接提示准确率已高达 96.3%,V1 反而破坏性能至 66.5%,而任务感知门控的 V2 保持 95.1%。结果表明,通信格式和实现细节比架构复杂性更关键,简单方法在本地 7B 模型上可匹配或超越多智能体流水线。
多智能体流水线的性能高度依赖角色间通信格式:JSON 结构化格式在 GSM8K 上导致错误累积,准确率下降 30 个百分点,而纯文本格式恢复并提升至 82.0%。这表明中间表示的序列化方式直接影响错误传播。自优化(两次调用)在 GSM8K 上以 7.4 倍更低的 token 消耗达到 86.2%,但在 HumanEval 上因任务饱和而破坏性能,提示自优化适用于初始准确率较低的任务。任务感知门控(V2)通过条件性应用自优化,在 HumanEval 上保持 95.1%,说明自适应策略对避免性能退化至关重要。
该研究挑战了多智能体系统在本地小模型上的有效性,表明架构复杂性并非决定性因素,通信格式和实现细节更关键。对于资源受限的本地部署,简单方法(如两次调用自优化)可能更高效。这提示行业在构建 Agent 系统时,应优先优化任务分解和通信协议,而非盲目增加角色数量。同时,任务感知的自适应策略(如门控)对避免性能退化至关重要,可能成为未来 Agent 设计的重要方向。
对于部署本地 LLM 的企业,该研究提供了成本效益证据:两次调用自优化在 GSM8K 上以 7.4 倍更低的 token 消耗达到更高准确率,可显著降低推理成本。同时,多智能体系统在 JSON 格式下的性能崩溃警示了实现细节的重要性,企业应避免盲目采用复杂架构,而应基于任务特性选择简单或自适应方案,以优化资源利用和系统稳定性。
后续可验证的信号包括:更多研究探索不同通信格式(如 JSON、纯文本、代码)对多智能体性能的影响;任务感知门控策略在更大模型和更多任务上的泛化能力;以及本地模型上多智能体与自优化方法的成本-性能权衡的进一步量化。