Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training
CoPES 是一种合作协同进化方法,将全参数空间分解为低维子空间进行协同搜索,用于资源受限的 Agentic LLM 后训练。在 Qwen3.5-4B 工具使用智能体的数学任务上,在 GRPO 最佳验证检查点的 GPU 小时预算下,CoPES 恢复了 GRPO 验证准确率提升的 92%,而标准 ES 为 67%,理论 GPU 内存需求低于全参数 GRPO 的八分之一。
Development
- First ReportCooperative Coevolution for Resource-Constrained Agentic LLM Post-TrainingarXiv cs.LG
- Current Assessment该研究针对资源受限场景下的 Agentic LLM 后训练,表明在少量 GPU 环境下,协同进化方法可以接近梯度强化学习的性能,同时大幅降低内存需求。这可能推动更多研究机构在有限算力下进行 Agent 模型的后训练,但实际应用仍需验证。Agent Pulse · analysis
CoPES 是一种合作协同进化方法,将全参数空间分解为低维子空间进行协同搜索,用于资源受限的 Agentic LLM 后训练。在 Qwen3.5-4B 工具使用智能体的数学任务上,在 GRPO 最佳验证检查点的 GPU 小时预算下,CoPES 恢复了 GRPO 验证准确率提升的 92%,而标准 ES 为 67%,理论 GPU 内存需求低于全参数 GRPO 的八分之一。
CoPES 通过将全参数空间分解为低维子空间并协同搜索,在资源受限环境下显著提升了进化策略的优化效率。相比标准 ES,CoPES 在相同 GPU 小时预算下恢复了更高的验证准确率提升(92% vs 67%),同时理论内存需求低于全参数 GRPO 的八分之一。这表明参数子空间分解可能是一种有效的策略,但具体分解方式和协同机制未在摘要中详述。
该研究针对资源受限场景下的 Agentic LLM 后训练,表明在少量 GPU 环境下,协同进化方法可以接近梯度强化学习的性能,同时大幅降低内存需求。这可能推动更多研究机构在有限算力下进行 Agent 模型的后训练,但实际应用仍需验证。
对于算力有限的企业或研究团队,CoPES 提供了一种低内存、低 GPU 小时的后训练方案,可能降低 Agent 模型定制的成本。但当前仅验证了数学任务,商业价值需进一步评估。
后续可关注 CoPES 在更大模型和更多任务上的表现,以及其与 LoRA 等参数高效微调方法的对比。若该方法能稳定复现,可能成为资源受限环境下 Agent 后训练的实用选择。