Prime Agent: A Self-Improving RLM Harness
Prime Agent 是一个开源 harness,用于长时程评估和编码 agent 工作流。它引入持久 IPython REPL,遵循递归语言模型抽象,支持程序化上下文处理和测试时计算。Continual Harness 跨轨迹保留历史、记忆、技能、提示和子代理规范。递归子代理通过直接代理间通信协调,Agents View 允许人类检查和管理守护进程支持的会话。Prime Agent 标准化执行、恢复、验证和资源核算,同时将策略构建留给模型。在 ARC-AGI-3 RHAE Best@1 上,Prime Agent 将性能从 30% 提升到 95.5%,并在长上下文编码、GPU 内核生成、模拟器构建和自主 nanoGPT 速度运行方面匹配或超过原生和流行 harness。
Development
- First ReportPrime Agent: A Self-Improving RLM HarnessHugging Face Daily Papers
- Industry ResponsePrime Agent: A Self-Improving RLM HarnessarXiv cs.AI
- Current AssessmentPrime Agent 的出现表明,在 agent 开发中,harness 设计正成为与模型能力同等重要的因素。通过开源 harness 并展示显著性能提升,可能推动行业对 agent 基础设施的标准化和投资。可验证的下一步是观察是否有其他团队采用类似抽象,以及是否出现基于 Prime Agent 的商业产品。Agent Pulse · analysis
Prime Agent 是一个开源 harness,用于长时程评估和编码 agent 工作流。它引入持久 IPython REPL,遵循递归语言模型抽象,支持程序化上下文处理和测试时计算。Continual Harness 跨轨迹保留历史、记忆、技能、提示和子代理规范。递归子代理通过直接代理间通信协调,Agents View 允许人类检查和管理守护进程支持的会话。Prime Agent 标准化执行、恢复、验证和资源核算,同时将策略构建留给模型。在 ARC-AGI-3 RHAE Best@1 上,Prime Agent 将性能从 30% 提升到 95.5%,并在长上下文编码、GPU 内核生成、模拟器构建和自主 nanoGPT 速度运行方面匹配或超过原生和流行 harness。
Prime Agent 的核心贡献在于将 harness 与模型策略分离,通过持久 REPL 和 Continual Harness 提供程序化上下文和跨轨迹记忆,从而减少 harness 失败对模型性能的影响。其显著提升 ARC-AGI-3 分数表明,标准化的执行和恢复机制可能释放模型潜在能力。可验证的下一步是检查其在不同模型和任务上的泛化性,以及其资源核算方法是否影响测试时计算效率。
Prime Agent 的出现表明,在 agent 开发中,harness 设计正成为与模型能力同等重要的因素。通过开源 harness 并展示显著性能提升,可能推动行业对 agent 基础设施的标准化和投资。可验证的下一步是观察是否有其他团队采用类似抽象,以及是否出现基于 Prime Agent 的商业产品。
对于构建 agent 产品的公司,Prime Agent 提供了一种低成本、高表达的 harness,可能降低开发长时程 agent 的工程成本,并提高模型利用率。其开源许可可能减少供应商锁定,但需要评估其与现有工作流的集成成本。可验证的下一步是观察是否有公司将其集成到产品中。
如果 Prime Agent 的方法被广泛采用,可能加速长时程 agent 的部署,特别是在编码和自动化任务中。其开源特性可能促进社区贡献,进一步改进 harness 的鲁棒性和效率。可验证的下一步是跟踪其 GitHub 星标和社区采用情况。