AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 5, 2026 · Unidirectional Safety Gate

Gradient Immunity: Null-Space Resistance to Malicious Fine-Tuning

What Happened

arXiv 论文 2608.05045v1 提出 Unidirectional Safety Gate (USG),由 Null Space Cubic Layer 和 Inverse Adapter 组成,插入最终 Transformer 层之后。在部分受保护开放权重(PPOW)发布设置下,USG 在六种模型-数据集设置中,将微调后攻击成功率保持在发布前水平附近。

EVENT STORY

Development

  1. First ReportGradient Immunity: Null-Space Resistance to Malicious Fine-TuningarXiv cs.AI
  2. Current Assessment该研究针对开放权重模型发布的安全问题,提出一种在发布时保留安全关键组件的策略。这暗示开放权重发布可能转向更精细的控制,而非完全开放或完全封闭。可验证的下一信号:是否有主流模型提供商采用类似机制进行开放权重发布。Agent Pulse · analysis
What Changed

arXiv 论文 2608.05045v1 提出一种针对恶意下游微调的防御方法 Unidirectional Safety Gate (USG)。该方法针对部分受保护开放权重(PPOW)发布设置,其中大部分权重可训练,但一小部分安全关键组件在发布时保留。USG 由 Null Space Cubic Layer 和 Inverse Adapter 组成,插入最终 Transformer 层之后。在微调过程中,cubic layer 抑制或阻断来自有害样本的梯度,这些样本的隐藏状态落在校准的保护区域内,而 Inverse Adapter 恢复基础模型的前向行为。作者使用防御者持有的有害数据校准阈值,使保护泛化到邻近的分布内有害样本。在六个模型-数据集设置中,USG 在固定发布阈值下将微调后攻击成功率保持在发布前水平附近。

How the Capability Boundary Shifted

USG 的核心是 Null Space Cubic Layer,它利用隐藏状态的受保护区域来阻断有害样本的梯度,同时通过 Inverse Adapter 保持前向行为不变。这表明防御可以基于隐藏状态空间中的几何区域进行,而非依赖外部安全流程。可验证的下一信号:该方法是否能在更大模型(如 70B 参数)上保持有效性,以及是否对分布外有害样本具有鲁棒性。

Why It Matters

该研究针对开放权重模型发布的安全问题,提出一种在发布时保留安全关键组件的策略。这暗示开放权重发布可能转向更精细的控制,而非完全开放或完全封闭。可验证的下一信号:是否有主流模型提供商采用类似机制进行开放权重发布。

Who It Affects

对于提供开放权重模型的厂商,USG 提供了一种在保持模型可微调性的同时降低恶意使用风险的方法,可能影响模型发布策略和合规性。可验证的下一信号:是否有商业模型采用 USG 或类似技术。

What to Watch Next

未来可能看到更多基于隐藏状态空间的防御方法,以及针对 PPOW 设置的标准化评估基准。可验证的下一信号:后续工作是否扩展 USG 到多模态模型或更大规模。