Mitigating Scoring Bias in LLM-as-a-Judge via Random Number Generation
arXiv 论文 2608.05726v1 提出一种通过随机数生成缓解 LLM-as-a-Judge 评分偏差的方法。该方法让 LLM 随机生成数字 token,通过观测数字分布与均匀分布的偏差识别潜在数值偏差,并在评估时修正 token 生成概率。实验覆盖四个任务:LLM 对齐评估、摘要评估、语义文本相似性和语义文本相关性,结果显示该方法优于未去偏的 LLM 和先前基线。
Development
- First ReportMitigating Scoring Bias in LLM-as-a-Judge via Random Number GenerationarXiv cs.CL
- Current AssessmentLLM-as-a-Judge 被广泛用于模型评估和数据筛选,评分偏差可能导致评估结果失真。该方法提供了一种实用的去偏方案,可能提升 LLM 评估的可靠性。可验证的下一信号:是否有主流评估框架(如 OpenAI Evals、LangChain)集成该方法。Agent Pulse · analysis
该研究针对 LLM-as-a-Judge 中的评分偏差问题,提出一种基于随机数生成的去偏方法。LLM 评估器常倾向于生成特定分数,与文本内容无关。方法通过让 LLM 随机生成数字 token,测量其分布与均匀分布的偏差,从而识别潜在数值偏差。同时,将下游任务定义加入提示,以测量任务特定的潜在数值偏差。在评估时,根据该偏差修正 token 生成概率。实验在四个任务上验证,包括 LLM 对齐评估、摘要评估、语义文本相似性和语义文本相关性,结果表明该方法优于未去偏的 LLM 和先前基线。
该方法的核心在于利用随机数生成任务暴露 LLM 的潜在数值偏差,并通过概率修正来抵消该偏差。这提供了一种无需额外训练或外部数据的轻量级去偏手段。可验证的下一信号:该方法是否能在更多任务和模型上复现,以及修正概率是否会影响评估的区分度。
LLM-as-a-Judge 被广泛用于模型评估和数据筛选,评分偏差可能导致评估结果失真。该方法提供了一种实用的去偏方案,可能提升 LLM 评估的可靠性。可验证的下一信号:是否有主流评估框架(如 OpenAI Evals、LangChain)集成该方法。
对于依赖 LLM 评估的 AI 公司,该方法可提高评估准确性,减少人工复核成本,从而提升模型迭代效率。可验证的下一信号:是否有企业采用该方法并报告评估质量提升。
该方法可能成为 LLM 评估的标准预处理步骤,但需验证其在不同模型规模和任务类型上的泛化性。未来可能结合其他去偏技术,或扩展到多维度评估。