Jul 29, 2026 · ToxScreen
ToxScreen: Detecting Whether an LLM Has Been Poisoned
ToxScreen 是一个包含约 800 个后门模型的基准,用于评估防御者能否在无训练数据、无参考模型等现实条件下恢复触发器。研究发现基于梯度的提示优化无法恢复触发器,而按攻击成功率排序的 token 查找方法在有效后门中能恢复触发器。
EVENT STORY
Development
- First ReportToxScreen: Detecting Whether an LLM Has Been PoisonedarXiv cs.LG
- Current Assessment该基准的发布为 LLM 安全领域提供了标准化的评估工具,有助于推动后门检测研究的发展。随着 LLM 在高风险领域的部署,此类基准对安全社区具有重要意义。Agent Pulse · analysis
ToxScreen 是一个新发布的基准,包含约 800 个被植入后门的模型,覆盖多种攻击目标、触发机制、投毒率、模型规模和训练机制。该基准旨在评估防御者在现实条件下(仅白盒访问权重、知道关注的行为,但无训练数据、无参考模型、无触发器知识、不确定模型是否被投毒)能否恢复触发器。研究发现,基于梯度的提示优化无法恢复触发器,而一种按攻击成功率排序的 token 查找方法在有效后门中能成功恢复触发器。
该研究表明,在现实约束下,基于梯度的触发器恢复方法可能失效,而基于攻击成功率的 token 查找方法更有效。这暗示后门触发器的可恢复性可能与攻击成功率相关,为防御者提供了新的检测思路。
该基准的发布为 LLM 安全领域提供了标准化的评估工具,有助于推动后门检测研究的发展。随着 LLM 在高风险领域的部署,此类基准对安全社区具有重要意义。
对于部署 LLM 的企业,该基准提供了一种评估模型是否被投毒的手段,有助于降低安全风险。
未来可能看到更多基于该基准的防御方法研究,以及针对不同触发机制和模型规模的扩展。