FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation
FairFund-Bench 是一个评估 LLM 在资源分配中分配偏差的基准,包含 600 个基于人工模板的财务援助请求,校准自 130 万真实 GoFundMe 活动,覆盖三个领域、四种种族和两种性别类别,以及五种基于福利应得理论的因果框架。在 14 个模型上,审计格式改变了偏差方向:模型在单独评分时偏向少数群体,但在并排排名时惩罚某些群体。
发展脉络
- 首次出现FairFund-Bench: Evaluating Distributive Bias in LLM Resource AllocationarXiv cs.CL
- 当前判断该基准揭示了 LLM 审计结果的不一致性可能源于方法差异,而非模型本身。这为行业提供了更可靠的评估工具,有助于标准化公平性审计流程,并推动模型开发者在部署前进行更全面的偏差测试。Agent Pulse · 分析
FairFund-Bench 基准系统性地变化了先前审计设计的关键特征:评估任务(评分、排名或分配)、比较上下文(单一或多刺激)以及审计是透明还是伪装的。该基准包含 600 个财务援助请求,基于人工模板创建,并针对 130 万真实 GoFundMe 活动进行校准,涵盖三个领域、四种种族和两种性别类别,以及五种基于福利应得理论的因果框架。在 14 个模型上,审计格式改变了偏差方向:模型在单独评分时偏向少数群体,但在并排排名时惩罚某些群体。偏差幅度虽然有所变化,但方向的变化表明,先前审计结果的不一致可能源于审计格式的差异,而非模型本身的不一致。
审计格式对偏差方向的影响表明,LLM 的分配行为高度依赖于任务设计和上下文。单独评分与并排排名之间的差异可能源于模型在处理多刺激比较时的相对判断机制,而非绝对评分。这提示在评估模型公平性时,需要标准化审计格式,并考虑任务类型和上下文对结果的影响。
该基准揭示了 LLM 审计结果的不一致性可能源于方法差异,而非模型本身。这为行业提供了更可靠的评估工具,有助于标准化公平性审计流程,并推动模型开发者在部署前进行更全面的偏差测试。
对于依赖 LLM 进行资源分配的企业,该基准提供了识别和缓解偏差的工具,有助于避免因不公平分配导致的声誉和法律风险。采用该基准进行模型评估,可以提升系统的可信度和用户满意度。
未来,FairFund-Bench 可能扩展至更多领域和场景,并成为行业标准基准。模型开发者可能需要针对不同审计格式优化模型,以减少分配偏差。监管机构也可能采用此类基准来评估 AI 系统的公平性。