When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability
arXiv 论文《When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability》提出,当评估者(judge)改变而候选回答不变时,LLM-as-judge 评分可能变化,并将此视为测量有效性问题。研究跨四个判断数据集,比较了两种实际可用的升级路径:将 Qwen3 稠密 judge 从 1.7B 规模扩展。
发展脉络
- 首次出现When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge ReliabilityarXiv cs.AI
- 当前判断评测方法的可靠性直接影响行业对模型能力的判断和比较。评估者更换导致的评分变化可能引发对模型排名的争议,影响技术选型和投资决策。行业需要建立更稳健的评测标准,减少评估者带来的偏差。Agent Pulse · 分析
该论文将 LLM-as-judge 评分随评估者更换而变化的现象定义为测量有效性问题,而非模型能力问题。研究在四个判断数据集上比较了两种升级路径,包括扩展 Qwen3 稠密 judge 的规模。核心发现是评估者的选择本身会影响评分结果,即使候选回答保持不变。这提示在评测中,评估者的变更可能引入系统性偏差,影响对模型能力的判断。
LLM-as-judge 的可靠性不仅取决于候选模型,还取决于评估者本身。评估者更换可能导致评分漂移,即使候选回答固定。这要求评测设计必须控制评估者变量,或采用多评估者交叉验证。可验证的下一信号是:评估者规模或架构变化对评分一致性的具体影响程度。
评测方法的可靠性直接影响行业对模型能力的判断和比较。评估者更换导致的评分变化可能引发对模型排名的争议,影响技术选型和投资决策。行业需要建立更稳健的评测标准,减少评估者带来的偏差。
对依赖 LLM-as-judge 进行模型评估的企业,评估者更换可能带来评分波动,影响产品决策和客户信任。建立可靠的评测流程可降低风险,提升模型评估的可信度。
未来评测可能更注重评估者的标准化和审计,以减少测量误差。可能出现专门的评估者可靠性审计工具或方法,帮助团队验证评测结果的一致性。