AI systems and the reproduction of (standard) language ideologies in World Englishes
arXiv 论文(2607.28528v1)研究 AI 系统如何再现标准语言意识形态,以 'delve' 争议为例,指出全球北方用户对全球南方英语使用者的语言规范进行规训。
发展脉络
- 首次出现AI systems and the reproduction of (standard) language ideologies in World EnglishesarXiv cs.CL
- 当前判断该研究揭示 AI 行业在数据选择和评估标准上可能存在的偏见,提示开发者在多语言和多文化场景中需关注语言多样性,避免强化标准语言意识形态。Agent Pulse · 分析
该论文探讨大语言模型(LLM)如何反映、强化并偶尔挑战标准语言意识形态,这种意识形态偏向内圈英语规范,边缘化非主流英语。作者利用实证研究、媒体评论、社交媒体辩论和 AI 输出示例,展示 AI 技术在训练数据、设计协议、评估基准、用户反馈和公共评论等层面再现主导语言意识形态。论文以 'delve' 一词引发的争议为例,说明全球北方英语使用者如何规训全球南方英语使用者的语言规范。论文还引用 Christian Mair 的 '标准化悖论':AI 可能通过偏好标准形式使英语同质化,同时通过广泛语料接触使英语多元化。
论文指出 AI 系统在训练数据、设计协议、评估基准等层面再现语言意识形态,这意味着当前 LLM 的训练和评估流程可能隐含对标准英语的偏好,影响模型对非主流英语变体的处理能力。
该研究揭示 AI 行业在数据选择和评估标准上可能存在的偏见,提示开发者在多语言和多文化场景中需关注语言多样性,避免强化标准语言意识形态。
对于面向全球用户的 AI 产品,忽视语言多样性可能导致用户体验不佳或引发争议,企业需在数据策略和产品设计中考虑语言包容性。
未来可能看到更多关于 AI 语言偏见的研究,以及开发者在数据收集和评估中纳入语言多样性考量的趋势。