AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月2日 · Microsoft 365 Copilot

Who Belongs in the Eval Set? A Capability-Taxonomy-Driven Pipeline for Curating Regression Eval Sets in Agent-Extensibility Platforms

发生了什么

微软 365 Copilot 平台团队提出一种基于能力分类学的回归评测集筛选流程,用于代理扩展平台。该流程以代理规范和客户评测集为输入,将每个查询映射到平台拥有的能力分类学,并输出每个查询的决策(接受、丢弃、替换或人工审查)。其理念是健康的回归集是捕获最大能力签名覆盖的最小查询集。

EVENT STORY

发展脉络

  1. 首次出现Who Belongs in the Eval Set? A Capability-Taxonomy-Driven Pipeline for Curating Regression Eval Sets in Agent-Extensibility PlatformsarXiv cs.AI
  2. 当前判断该论文表明,随着代理平台扩展,平台侧评测集管理成为关键问题。现有评测框架多为客户侧,平台侧缺乏系统化方法。该流程可能成为平台工程的最佳实践,影响代理平台如何管理回归评测。Agent Pulse · 分析
改变了什么

微软 365 Copilot 平台团队在 arXiv 发表论文,提出一种基于能力分类学的回归评测集筛选流程,用于代理扩展平台。该流程解决平台端回归评测的经济学悖论:每个客户都会带来针对其领域的评测集,但平台回归集必须受限于发布节奏的硬查询数上限。现有评测框架多为客户侧,基准压缩工作将基准视为固定池而非流入集。该流程以代理规范和客户评测集为输入,将每个查询投影到平台拥有的能力分类学,输出每个查询的决策(接受、丢弃、替换或人工审查),理念是健康回归集是捕获最大能力签名覆盖的最小查询集。

能力边界怎么变了

该流程的核心是能力签名概念,即查询共同调用的能力组合。通过混合确定性规范方法和分类器,对每个查询-能力对给出判定。这提供了一种系统化方法,在查询数上限下最大化能力覆盖,可能比随机采样或基于相似度的方法更有效。下一步可验证信号:论文是否公开分类学细节或评估指标。

为什么重要

该论文表明,随着代理平台扩展,平台侧评测集管理成为关键问题。现有评测框架多为客户侧,平台侧缺乏系统化方法。该流程可能成为平台工程的最佳实践,影响代理平台如何管理回归评测。

对谁有影响

该流程可帮助平台团队在有限查询预算下维持高质量回归评测,降低发布风险,提升平台稳定性,从而增强客户信任和平台竞争力。

接下来观察

该流程可能被其他代理平台采用,或催生相关工具。未来可能看到更多关于能力分类学自动构建或动态调整的研究。