Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency
arXiv 论文 2608.16003 报告,在 ProcessBench 轨迹上,将已完成的审计-修复片段放入 LLM 验证器上下文,在 15/15 模型×措辞组合中降低了误报率,降幅为 2.8 至 11.5 个百分点(相对减少 9-25%)。信号检测分析显示标准移动在 15/15 组合中显著,而判别力 d' 无显著变化。
发展脉络
- 首次出现Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward LeniencyHugging Face Daily Papers
- 行业反馈Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward LeniencyarXiv cs.CL
- 当前判断该研究对自动化检查流水线的设计有启示:将审计-修复片段放入上下文可能使验证器更宽容,减少误报,但可能增加漏报风险。这影响流水线的可靠性,需要权衡。Agent Pulse · 分析
该研究测试了自动化检查流水线中,将审计-修复片段放入 LLM 验证器上下文是否改变其报告行为。在人类验证正确的 ProcessBench 轨迹上,保持任务字节不变,发现已完成的审计-修复片段将误报率在 15/15 模型×措辞组合中降低 2.8 至 11.5 个百分点,相对减少 9-25%。这一方向与累积消息文献的预测相反:审计报告错误的片段进一步降低误报率,在所有五种措辞上均如此,尽管负性不对称预测更多标记。分解片段发现修复内容和审计结论互补:不同组件在不同模型家族上承载效果。信号检测分析将变化定位在阈值而非判别力——标准在 15/15 组合中移动,13 个在校正后仍显著,而 d' 无显著变化。
该研究通过信号检测理论区分了阈值移动和判别力变化,表明上下文中的审计-修复片段主要影响验证器的决策阈值而非其区分能力。这提示 LLM 验证器的行为受上下文情节影响,可能通过调整内部标准来改变误报率。
该研究对自动化检查流水线的设计有启示:将审计-修复片段放入上下文可能使验证器更宽容,减少误报,但可能增加漏报风险。这影响流水线的可靠性,需要权衡。
对于构建 LLM 验证器的团队,该研究提示上下文情节可调节验证器行为,可能用于优化误报与漏报的平衡,但需谨慎评估。
未来可探索不同审计-修复片段长度、内容对阈值移动的影响,以及如何校准验证器以避免过度宽容。