LoRAScan: Detecting Backdoor Prompts in Low-Rank Adapters for Large Language Models via Down-Projection Activation Spikes
LoRAScan 是一种针对低秩适配器(LoRA)的后门提示检测方法,在推理时通过下投影激活尖峰检测并拒绝触发输入,无需修改适配器参数。该方法由 arXiv 论文提出,发表于 2026 年 8 月 7 日。
Development
- First ReportLoRAScan: Detecting Backdoor Prompts in Low-Rank Adapters for Large Language Models via Down-Projection Activation SpikesarXiv cs.CL
- Current AssessmentLoRA 适配器的广泛使用带来了供应链安全风险,LoRAScan 的出现表明社区开始关注适配器本身的安全性。这可能会推动适配器分发平台和模型市场引入安全检测机制,形成新的安全工具类别。Agent Pulse · analysis
LoRAScan 是首个适配器感知的防御方法,用于在推理时检测并拒绝低秩适配器中的后门提示。论文指出,不可信的适配器可能引入供应链威胁,导致模型在触发词出现时生成有害内容。现有防御方法要么合并适配器稀释后门信号,要么训练防御适配器修复基座模型,但都未解决如何安全使用潜在后门适配器的问题。LoRAScan 的关键观察是,后门适配器中触发输入会产生独特的潜在空间签名,通过下投影激活尖峰可识别这些输入,且无需修改适配器参数。
LoRAScan 利用 LoRA 插入点的下投影激活尖峰来检测后门提示,这表明后门触发在潜在空间中具有可区分的特征。该方法无需修改适配器参数,可在推理时实时检测,为适配器安全提供了一种轻量级方案。未来可进一步研究尖峰特征在不同模型和适配器配置下的鲁棒性。
LoRA 适配器的广泛使用带来了供应链安全风险,LoRAScan 的出现表明社区开始关注适配器本身的安全性。这可能会推动适配器分发平台和模型市场引入安全检测机制,形成新的安全工具类别。
对于使用第三方 LoRA 适配器的企业,LoRAScan 提供了一种在推理时检测后门提示的方法,降低了供应链安全风险。这有助于增强企业对开源模型生态的信任,促进适配器市场的健康发展。
LoRAScan 可能推动适配器安全检测工具的发展,未来或可集成到模型部署流程中。可验证的下一信号是:该方法的开源实现或后续工作在其他模型上的复现结果。