Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits
Diffusion LLMs (DLLMs) 用迭代并行去噪替代自回归预测,但其安全机制存在漏洞。研究发现,DLLMs 的安全对齐是稀疏的且可跨架构迁移。从自回归模型初始化的 DLLMs 继承了源模型的安全机制足迹,通过安全神经元映射和剪枝可实现迁移攻击。自剪枝将 LLaDA 的攻击成功率从 2.6% 提升至 73.8%,Dream 从 1.9% 提升至 86.6%;从 Qwen2.5 迁移剪枝使 Dream 的 ASR 从 1.9% 升至 73.2%,Fast-dLLM 从 7.0% 升至 86.3%。作者提出 SN-Guided Diffusion,一种全离线黑盒越狱框架,通过加权安全神经元损失引导扩散过程远离安全触发区域,实现良性/越狱提示的完美分离(AUROC=1.0)。
发展脉络
- 首次出现Diffusion LLMs as Targets and Adversaries: Mechanistic Safety ExploitsarXiv cs.AI
- 当前判断扩散语言模型(DLLMs)作为新兴的生成范式,其安全对齐的脆弱性可能成为行业应用的重大隐患。该研究显示,DLLMs 的安全机制可以轻易被迁移攻击绕过,且攻击成功率极高。这提示 AI 行业在采用扩散模型时,必须重新审视安全对齐策略,不能简单沿用自回归模型的经验。未来,安全对齐可能需要结合模型架构特性进行定制化设计,否则扩散模型的商业化应用将面临严峻的安全挑战。Agent Pulse · 分析
Diffusion Large Language Models (DLLMs) 通过迭代并行去噪生成文本,但其内部安全机制尚未被充分理解。本研究将 DLLMs 同时作为攻击目标和攻击者,揭示了基于扩散的对齐机制的机械性漏洞。研究发现,DLLMs 的安全对齐是稀疏的,并且可以跨架构迁移。从自回归模型初始化的 DLLMs 继承了源模型的机械安全足迹,使得通过直接安全神经元映射和剪枝的迁移攻击成为可能。自剪枝将 LLaDA 的攻击成功率从 2.6% 提升至 73.8%,Dream 从 1.9% 提升至 86.6%;从 Qwen2.5 迁移剪枝使 Dream 的 ASR 从 1.9% 升至 73.2%,Fast-dLLM 从 7.0% 升至 86.3%。基于这些发现,作者提出了 SN-Guided Diffusion,一种全离线黑盒越狱框架,通过加权安全神经元损失引导扩散过程远离安全触发区域,实现了良性/越狱提示的完美分离(AUROC=1.0)。该框架在多个开放和专有目标上取得了高攻击成功率,表明扩散模型的安全对齐存在根本性漏洞。
该研究揭示了扩散语言模型(DLLMs)的安全对齐机制是稀疏且可迁移的,这为攻击者提供了可乘之机。通过安全神经元映射和剪枝,攻击者可以显著提高越狱攻击的成功率,例如在 LLaDA 上从 2.6% 提升至 73.8%。SN-Guided Diffusion 框架利用加权安全神经元损失,在离线黑盒条件下实现了对扩散过程的精确控制,达到完美的提示可分性(AUROC=1.0)。这表明扩散模型的安全机制可能比自回归模型更脆弱,需要重新设计对齐策略。
扩散语言模型(DLLMs)作为新兴的生成范式,其安全对齐的脆弱性可能成为行业应用的重大隐患。该研究显示,DLLMs 的安全机制可以轻易被迁移攻击绕过,且攻击成功率极高。这提示 AI 行业在采用扩散模型时,必须重新审视安全对齐策略,不能简单沿用自回归模型的经验。未来,安全对齐可能需要结合模型架构特性进行定制化设计,否则扩散模型的商业化应用将面临严峻的安全挑战。
对于采用扩散语言模型的企业,该研究揭示了潜在的安全风险,可能影响模型在敏感场景下的部署。安全漏洞可能导致恶意使用,损害品牌声誉并引发法律风险。因此,企业在选择扩散模型时,需要评估其安全对齐的鲁棒性,并投资于安全加固措施。同时,该研究也催生了安全评估和加固服务的市场需求,为安全厂商提供了商业机会。
该研究为扩散模型的安全对齐敲响了警钟。未来,我们可能看到更多针对扩散模型的攻击研究,以及相应的防御机制开发。安全对齐可能需要从模型架构层面进行根本性改进,例如设计更鲁棒的安全神经元或引入对抗训练。此外,跨架构迁移攻击的可行性意味着安全对齐的标准化和可验证性将变得更加重要。