ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation
ARB 基准数据集由 1,800 篇人类源文本(XSum、WritingPrompts、OpenWebText 各 600 篇)和四个开源生成器(Llama-3.2-3B、Qwen2.5-7B、Mistral-7B、Gemma-2-9B)构建,每个源文本生成四种变体:HUMAN、Free-LLM、H2L、LLM2L。在 1% 假阳性率下,FastDetectGPT 和 Binoculars-falcon-7b 对直接 LLM 文本的检测率为 91.2% 和 93.5%,但对 LLM 改写的人类文本仅检测出 30.8% 和 15.1%,性能下降 60-78 个百分点。
发展脉络
- 首次出现ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector EvaluationarXiv cs.AI
- 当前判断AI 文本检测器的可靠性受到质疑,可能影响依赖检测的行业,如学术诚信、内容审核和虚假信息治理。检测器在改写场景下的低性能可能导致误判或漏判,促使行业重新评估检测工具的有效性,并推动开发更鲁棒的检测方法。Agent Pulse · 分析
ARB 基准数据集揭示了 AI 文本检测器在应对 LLM 改写的人类文本时性能显著下降。传统基准测试仅比较人类文本与直接生成的 LLM 文本,而 ARB 引入了匹配的改写变体,模拟真实场景中人类作者使用 LLM 改写的情况。实验表明,FastDetectGPT 和 Binoculars-falcon-7b 对直接 LLM 文本的检测率超过 90%,但对改写后的人类文本检测率骤降至 30.8% 和 15.1%,下降幅度达 60-78 个百分点。这表明现有检测器在真实场景中可能失效,对 AI 内容检测的可靠性构成挑战。
ARB 基准的构建方法(匹配的改写变体)为检测器评估提供了更贴近实际的测试集。检测性能的显著下降表明,检测器可能过度依赖文本的统计特征,而改写过程破坏了这些特征。未来检测器需考虑语义层面的鲁棒性,或引入对抗性训练。可验证的下一信号:检测器在 ARB 上的性能是否成为新基准,以及是否有检测器针对改写场景进行优化。
AI 文本检测器的可靠性受到质疑,可能影响依赖检测的行业,如学术诚信、内容审核和虚假信息治理。检测器在改写场景下的低性能可能导致误判或漏判,促使行业重新评估检测工具的有效性,并推动开发更鲁棒的检测方法。
对于提供 AI 文本检测服务的公司,ARB 揭示了产品在真实场景中的局限性,可能影响客户信任和市场份额。这促使企业投资于更鲁棒的检测技术,或开发结合改写检测的解决方案,以维持竞争力。
未来可能出现针对改写场景的检测器改进,或结合水印等技术。ARB 基准可能成为标准评估工具,推动检测器在真实场景中的性能提升。可验证的下一信号:是否有检测器在 ARB 上报告改进结果,或 ARB 被广泛采用。