2026年8月4日 · Sparse Weight Decomposition
Sparse Weight Decomposition for Efficient Circuit Extraction
SWD 将预训练线性投影的权重矩阵分解为两个稀疏因子,共享中间坐标作为可寻址电路单元,无需训练替代网络。在单矩阵替换中,SWD 以不到 Transcoder 等基线 1% 的数据达到相同保真度,并以更少的活跃读写边和单元达到相同的电路充分性和必要性目标。
EVENT STORY
发展脉络
- 首次出现Sparse Weight Decomposition for Efficient Circuit ExtractionarXiv cs.CL
- 当前判断SWD 可能降低电路提取的计算成本,推动可解释性研究在更大模型上的应用,但需关注其与现有稀疏特征方法的兼容性。Agent Pulse · 分析
Sparse Weight Decomposition (SWD) 提出了一种新的电路提取方法,通过将预训练 transformer 的权重矩阵分解为两个稀疏因子,共享中间坐标作为可寻址电路单元,无需训练替代网络。该方法在单矩阵替换中,以不到 Transcoder 等基线 1% 的数据达到相同的保真度,并以更少的活跃读写边和单元达到相同的电路充分性和必要性目标。
SWD 通过参数化重分解避免了训练稀疏替代模型的额外计算,同时保持了与原始模型的保真度。其稀疏因子分解可能提供更细粒度的电路单元,但需验证其在不同模型规模和任务上的泛化性。
SWD 可能降低电路提取的计算成本,推动可解释性研究在更大模型上的应用,但需关注其与现有稀疏特征方法的兼容性。
SWD 可降低模型可解释性分析的成本,对依赖模型审计和合规的企业具有潜在价值,但当前仍处于研究阶段。
未来可观察 SWD 在更大模型和多任务上的扩展性,以及其是否被集成到主流可解释性工具中。