Beyond Representational Similarity: Source-Conditioned Description-Length Gain for Generative Plagiarism Detection and Candidate Source Reranking
SCDG 是一种无需训练的生成式抄袭检测框架,通过对比有无候选源 S 时冻结语言模型对可疑文档 P 的描述长度,得到 token 级对数似然增益。在 PAN 2025 派生配对基准上达到 0.92 精确率、0.97 召回率、0.94 F1;在 PAN 2026 多源检索任务上达到 0.83 nDCG@10 和 0.96 Recall@100,均优于所有基线。
Development
- First ReportBeyond Representational Similarity: Source-Conditioned Description-Length Gain for Generative Plagiarism Detection and Candidate Source RerankingarXiv cs.CL
- Current Assessment该研究填补了生成式抄袭检测的空白,区别于现有 LLM 文本检测(仅判断 AI 参与),聚焦于源复用。随着 LLM 在学术写作中的普及,此类检测工具对学术诚信和同行评审具有潜在价值。Agent Pulse · analysis
SCDG 是一种无需训练的生成式抄袭检测框架,通过对比有无候选源 S 时冻结语言模型对可疑文档 P 的描述长度,得到 token 级对数似然增益。在 PAN 2025 派生配对基准上达到 0.92 精确率、0.97 召回率、0.94 F1;在 PAN 2026 多源检索任务上达到 0.83 nDCG@10 和 0.96 Recall@100,均优于所有基线。
SCDG 利用描述长度增益作为方向性信号,无需训练即可检测生成式抄袭,对改写和多源合成具有鲁棒性。其核心在于对比条件语言模型在有无源文档时的编码长度差异,这为文本相似性提供了因果性度量。
该研究填补了生成式抄袭检测的空白,区别于现有 LLM 文本检测(仅判断 AI 参与),聚焦于源复用。随着 LLM 在学术写作中的普及,此类检测工具对学术诚信和同行评审具有潜在价值。
SCDG 可集成到学术诚信工具或内容审核平台,为教育机构、出版商和同行评审系统提供抄袭检测能力,降低人工审查成本。
未来可探索 SCDG 在更大规模数据集上的表现,以及与其他检测方法的结合。其无需训练的特性可能使其易于部署到实际系统中。