Cross-Lingual Bias in Large Language Models: A Comparative Analysis of English and Swahili
一项研究向 GPT-5.2 和 Gemini 2.5 Flash 提交了 4,900 对对称的英语-斯瓦希里语提示,覆盖九个社会偏见轴,共产生 19,600 个补全。结果显示,特定轴上的刻板印象率变化高达 12 个百分点;Gemini 在斯瓦希里语中的中性情绪率翻倍;GPT-5.2 在英语中拒绝了 169 个提示,而在斯瓦希里语中为零。超过 55% 的提示对在两个模型上产生了语义不相似的补全。
发展脉络
- 首次出现Cross-Lingual Bias in Large Language Models: A Comparative Analysis of English and SwahiliarXiv cs.CL
- 当前判断该研究对多语言 AI 部署具有警示意义:英语单语偏见审计可能高估模型的安全性和公平性。随着模型在多语言环境中的广泛应用,偏见评估需要扩展到更多语言,以避免潜在的社会偏见传播。这可能会推动行业采用更全面的多语言评估标准,并影响模型开发中的对齐策略。Agent Pulse · 分析
一项研究比较了 GPT-5.2 和 Gemini 2.5 Flash 在英语和斯瓦希里语中的社会偏见表现,使用 4,900 对对称提示和九个偏见轴,共 19,600 个补全。研究发现偏见在不同语言间发生转变而非直接转移:特定轴上的刻板印象率变化高达 12 个百分点,Gemini 在斯瓦希里语中的中性情绪率翻倍,GPT-5.2 在英语中拒绝 169 个提示而在斯瓦希里语中零拒绝。超过 55% 的提示对产生语义不相似的补全,表明英语单语偏见审计不足以覆盖多语言部署。
研究揭示了跨语言偏见评估的复杂性:偏见在不同语言间并非简单转移,而是发生转变,表现为刻板印象率、情绪分布和拒绝行为的显著差异。GPT-5.2 在英语中拒绝 169 个提示而在斯瓦希里语中零拒绝,表明拒绝行为在行为层面锚定于英语表面形式。超过 55% 的提示对产生语义不相似的补全,暗示模型在多语言语义一致性上存在不足。这些发现对多语言模型的对齐和评估方法提出了挑战。
该研究对多语言 AI 部署具有警示意义:英语单语偏见审计可能高估模型的安全性和公平性。随着模型在多语言环境中的广泛应用,偏见评估需要扩展到更多语言,以避免潜在的社会偏见传播。这可能会推动行业采用更全面的多语言评估标准,并影响模型开发中的对齐策略。
对于在多语言市场部署 AI 产品的公司,该研究提供了关键警示:仅依赖英语评估可能遗漏偏见风险,导致品牌和合规问题。投资于多语言偏见评估和缓解可能成为差异化优势,降低部署风险并提升用户信任。
未来研究可能扩展至更多语言对,以验证偏见转变的普遍性。模型开发者可能需要开发跨语言偏见缓解技术,并建立多语言评估基准。监管机构或行业标准可能要求多语言部署前进行更全面的偏见审计。