Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations
Fairness Pruning 是一种轻量级结构干预方法,用于定位和缓解大语言模型中的群体偏见。该方法通过最小对比提示对和推理时激活捕获,在 GLU 架构的 down_proj 输入处识别对人口统计属性做出不同反应的神经元。在 Llama-3.2 系列和 Salamandra-2B 等高达 30 亿参数的模型上进行了评估,结合标准化基准评估和定性文本生成实验。结果表明,将识别出的神经元置零会改变模型对相关人口统计变量的响应,但会导致双向偏见不稳定,因为 BiasScore 是无符号的,候选集混合了推动和反对刻板印象的神经元。干预非常精准,最多置零 40 个神经元。
Development
- First ReportFairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential ActivationsarXiv cs.LG
- Current Assessment该研究为 LLM 偏见缓解提供了结构干预的新思路,可能影响模型对齐和公平性工具的发展。但当前仅验证了定位,缓解效果不稳定,距离实际应用还有距离。Agent Pulse · analysis
该论文提出 Fairness Pruning,一种用于管理和缓解大语言模型中人口统计偏见的轻量级结构干预方法。作为基础实证验证,工作聚焦于因果偏见定位。使用最小对比提示对和推理时激活捕获,在 GLU 架构的 down_proj 输入处识别对人口统计属性做出不同反应的神经元。在 Llama-3.2 系列和 Salamandra-2B 等高达 30 亿参数的模型上进行了评估,结合标准化基准评估和定性文本生成实验。结果表明,将识别出的神经元置零会改变模型对相关人口统计变量的响应,但会导致双向偏见不稳定:由于 BiasScore 是无符号的,候选集混合了推动和反对刻板印象的神经元,对总体偏见的影响取决于哪个符号占主导。干预非常精准,最多置零 40 个神经元。
该方法通过最小对比提示对和推理时激活捕获,在 GLU 架构的 down_proj 输入处定位偏见相关神经元,实现了对模型内部机制的因果定位。干预的精准性(最多置零 40 个神经元)表明偏见可能集中在少数神经元上,但 BiasScore 的无符号性导致双向不稳定,提示需要更精细的符号感知信号。
该研究为 LLM 偏见缓解提供了结构干预的新思路,可能影响模型对齐和公平性工具的发展。但当前仅验证了定位,缓解效果不稳定,距离实际应用还有距离。
对于 AI 安全与合规领域,该方法可能提供一种低成本的偏见审计工具,但当前阶段尚不成熟,商业价值有限。
未来工作可能包括扩展至更大模型、改进 BiasScore 以考虑符号、以及开发更稳定的缓解策略。可验证的信号是后续论文是否报告符号感知的偏见分数或更大规模的实验。