Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation
Messier 是一个统一语料库,包含 957,253 条记录,覆盖 30 个基准、714 个智能体、11,891 个任务和 74,205 个验证器。它整合了公开基准分数,并补充了六个专业和科学领域的五智能体运行结果。每个记录按模型、脚手架、环境、任务、验证器和聚合规则标准化,并带有 SOC/NAICS 分类。分析显示前沿进展不均衡:"function calling" 饱和,"programming" 进步最快,"enterprise workflows" 最具挑战性。反事实重新评分表明,多验证器任务中的严格全通过聚合可能掩盖进展并人为改变智能体排名。
Development
- First ReportMessier: A High-Resolution Corpus for Cross-Benchmark Agent EvaluationarXiv cs.AI
- Current Assessment智能体评估碎片化是行业痛点,Messier 的统一语料库为跨基准比较提供了基础设施。企业工作流(enterprise workflows)被识别为最具挑战性的领域,暗示当前智能体在复杂业务场景中能力不足,需要针对性改进。Agent Pulse · analysis
Messier 是一个高分辨率统一语料库,旨在解决 AI 智能体评估中因任务、脚手架、验证器和评分规则碎片化导致的结果不可比问题。该语料库包含 957,253 条记录,涵盖 30 个基准、714 个智能体、11,891 个任务和 74,205 个验证器。它整合了公开基准分数,并补充了六个专业和科学领域(包括一个近期法律基准)的五智能体运行结果。每条记录按模型、脚手架、环境、任务、验证器和聚合规则标准化,并带有 SOC/NAICS 职业和行业分类。利用该语料库,研究发现前沿进展在不同基准类型上不均衡:"function calling" 已饱和,"programming" 进步最快,而 "enterprise workflows" 仍最具挑战性。此外,反事实重新评分显示,在多验证器任务中采用严格全通过聚合会掩盖进展并人为改变智能体排名。从这些标准化记录中,研究者推导出能力量表,以对齐不同基准的进展。
Messier 通过标准化记录和反事实重新评分揭示了评估聚合规则对智能体排名的影响。严格全通过聚合在多验证器任务中会掩盖部分成功,导致排名失真。这提示评估设计需谨慎选择聚合策略,或报告多种聚合结果。
智能体评估碎片化是行业痛点,Messier 的统一语料库为跨基准比较提供了基础设施。企业工作流(enterprise workflows)被识别为最具挑战性的领域,暗示当前智能体在复杂业务场景中能力不足,需要针对性改进。
对于构建企业智能体产品的公司,Messier 提供了清晰的进展图景:企业工作流是当前瓶颈,而函数调用已饱和。这有助于资源分配,优先攻克复杂工作流,避免在已饱和领域过度投资。
Messier 语料库的发布可能推动智能体评估标准化,促使更多研究关注聚合规则的影响。未来可能出现基于 Messier 的标准化评估套件,以及针对企业工作流的专项基准。