RepBench: Compiling Benchmarks into Capability Representations for Large Language Models
RepBench 是一个面向大语言模型能力对齐表征探测的基准数据层。它爬取了 13,427 篇基准论文,得到 13 个家族、182 个能力簇的分类体系;从 353 个公开基准数据集中整理出 46,149 条经审计的探测文本,覆盖 94 种能力,每种能力至少由两个独立基准支持。在 12 个模型上,基准池化的能力向量在小簇数处呈现内部聚类最优,且与人工分类体系一致性低。跨基准迁移评估中,均值差法在 10 个模型上取得最高模型级均值,逻辑回归赢得最多能力-模型单元。
Development
- First ReportRepBench: Compiling Benchmarks into Capability Representations for Large Language ModelsarXiv cs.CL
- Current AssessmentRepBench 的出现反映了 AI 评测领域对标准化和可复现性的需求。通过构建大规模基准数据层,它可能推动能力探测方法从论文特有数据转向更通用的基准,从而促进不同研究之间的比较。其分类体系和探测文本库可能成为社区资源,影响后续能力评估和模型理解研究。然而,其与人工分类体系的一致性较低,提示自动聚类与人类认知之间的差距仍需弥合。Agent Pulse · analysis
Representation engineering 通过读取和引导大语言模型中的能力方向来工作,但现有方法通常在论文特有的合成数据上评估,导致测量难以比较或复现,且可能反映表面模式而非真实能力。RepBench 通过构建基准数据层来解决这一问题:它从 13,427 篇基准论文中提取出 13 个家族、182 个能力簇的分类体系,并从 353 个公开基准数据集中整理出 46,149 条经审计的探测文本,覆盖 94 种能力,每种能力至少由两个独立基准支持。这种多基准设计减少了对单一数据源的依赖。实验表明,原始逐文本向量没有自然的簇粒度,而基准池化的能力向量在 12 个模型上均在小簇数处呈现内部聚类最优,但与人工分类体系的一致性较低。在跨基准迁移评估中,均值差法在 10 个模型上取得最高模型级均值,而逻辑回归在最多能力-模型单元上获胜。这些结果显示了不同读出头在能力探测中的表现差异。
RepBench 的核心贡献在于将能力探测从论文特有的合成数据转向基准数据层,通过多基准池化来构建能力向量。其发现原始逐文本向量缺乏自然簇粒度,而基准池化后在小簇数处出现聚类最优,这表明基准池化能有效提取能力信号。跨基准迁移评估中,均值差法在模型级表现突出,而逻辑回归在能力-模型单元级更优,说明不同读出头在不同粒度上有各自优势。这一设计减少了对单一基准的依赖,可能提高能力测量的可复现性和可比性。
RepBench 的出现反映了 AI 评测领域对标准化和可复现性的需求。通过构建大规模基准数据层,它可能推动能力探测方法从论文特有数据转向更通用的基准,从而促进不同研究之间的比较。其分类体系和探测文本库可能成为社区资源,影响后续能力评估和模型理解研究。然而,其与人工分类体系的一致性较低,提示自动聚类与人类认知之间的差距仍需弥合。
RepBench 通过提供标准化的能力探测数据层,可能降低模型评估和比较的成本,提高评测的可复现性。对于依赖模型能力评估的企业,这可能带来更可靠的模型选择依据。其多基准设计可能减少对单一基准的依赖,降低评估偏差风险。然而,其商业价值尚需通过社区采用和实际应用来验证。
RepBench 的后续发展可能包括扩展基准覆盖范围、优化能力簇的划分,以及探索不同读出头在更多模型上的表现。其数据层可能被社区采用,成为能力探测的标准资源。未来研究可能关注如何提高自动聚类与人工分类的一致性,以及如何将能力表征应用于模型编辑和可解释性。