AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 5, 2026 · Argus

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

What Happened

Argus 是一个持久化、自演化的 agentic runtime,由 Manager、Planner、Engineer、Reviewer 角色在持久项目状态上执行有界任务。它分离稳定用户意图与操作目标、约束和验证标准,记忆、技能、程序、验证器、路由决策和拒绝路径仅在角色拥有的审查和任务原生验证后进入。模型权重固定,自演化通过持久运行时状态和控制策略发生,在操作者拥有的升级点之间自主执行。在七个 GPT-5.5 基准竞技场中,Argus 在 SWE-Bench Pro 上达到约 78%,而 Direct Copilot 为 59%,同时使用 1.41 倍的总 token。经过验证门控的自演化后,成熟 SWE-Bench 波次每个任务使用的求解输入 token 减少 21%,活跃工作流时间减少 15%,记录了 34 次验证器恢复和 22 次严格审查循环救援。

EVENT STORY

Development

  1. First ReportArgus: A General-Purpose Agentic Runtime for Long-Horizon ReasoningarXiv cs.AI
  2. Current AssessmentArgus 代表了 agentic runtime 设计的一个方向,即通过持久化状态和验证门控实现自我演化,而非依赖模型微调。这可能影响 agent 平台的架构选择,推动更多关注运行时基础设施而非仅模型能力。其角色分离和验证机制可能成为 agent 系统设计的参考模式,尤其是在需要可靠性和可审计性的场景。Agent Pulse · analysis
What Changed

Argus 是一个通用 agentic runtime,专为长时程推理设计,通过持久化运行时状态实现自我演化,而模型权重保持不变。它由 Manager、Planner、Engineer 和 Reviewer 四个角色组成,在持久项目状态上执行有界任务,并分离稳定用户意图与操作目标、约束和验证标准。Argus 仅在角色拥有的审查和任务原生验证后,才接纳记忆、技能、程序、验证器、路由决策和拒绝路径。在七个 GPT-5.5 基准竞技场中,Argus 在 SWE-Bench Pro 上达到约 78% 的准确率,而 Direct Copilot 为 59%,同时使用 1.41 倍的总 token。经过验证门控的自演化,成熟 SWE-Bench 波次每个任务使用的求解输入 token 减少 21%,活跃工作流时间减少 15%,并记录了 34 次验证器恢复和 22 次严格审查循环救援。

How the Capability Boundary Shifted

Argus 的核心创新在于将自演化从模型权重转移到运行时状态和控制策略,这允许在固定权重下实现能力提升。其验证门控机制确保记忆、技能和程序仅在通过角色审查和任务原生验证后进入,从而保证演化质量。SWE-Bench Pro 上 78% 对 59% 的提升,以及 token 使用量仅 1.41 倍,表明这种架构在效率和效果之间取得了平衡。成熟波次中 token 和时间减少 21% 和 15%,暗示运行时状态积累带来了持续改进。

Why It Matters

Argus 代表了 agentic runtime 设计的一个方向,即通过持久化状态和验证门控实现自我演化,而非依赖模型微调。这可能影响 agent 平台的架构选择,推动更多关注运行时基础设施而非仅模型能力。其角色分离和验证机制可能成为 agent 系统设计的参考模式,尤其是在需要可靠性和可审计性的场景。

Who It Affects

Argus 展示了通过运行时优化而非模型升级来提升 agent 性能的路径,这可能降低对频繁模型更新的依赖,从而节省成本。其 token 效率提升(成熟波次减少 21% 输入 token)对推理成本敏感的应用有直接价值。对于构建 agent 平台的公司,这种架构可能提供更可控的演化方式,减少模型更新带来的不确定性。

What to Watch Next

后续可验证信号包括:Argus 在更多基准上的表现、其自演化机制在长期运行中的稳定性、以及是否被其他系统采用或扩展。关注其 token 效率是否在更大规模任务中保持,以及验证门控机制是否成为 agent 平台的标准组件。