AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 30, 2026 · arXiv 论文 2607.28528v1

AI systems and the reproduction of (standard) language ideologies in World Englishes

What Happened

arXiv 论文(2607.28528v1)研究 AI 系统如何再现标准语言意识形态,以 'delve' 争议为例,指出全球北方用户对全球南方英语使用者的语言规范进行规训。

EVENT STORY

Development

  1. First ReportAI systems and the reproduction of (standard) language ideologies in World EnglishesarXiv cs.CL
  2. Current Assessment该研究揭示 AI 行业在数据选择和评估标准上可能存在的偏见,提示开发者在多语言和多文化场景中需关注语言多样性,避免强化标准语言意识形态。Agent Pulse · analysis
What Changed

该论文探讨大语言模型(LLM)如何反映、强化并偶尔挑战标准语言意识形态,这种意识形态偏向内圈英语规范,边缘化非主流英语。作者利用实证研究、媒体评论、社交媒体辩论和 AI 输出示例,展示 AI 技术在训练数据、设计协议、评估基准、用户反馈和公共评论等层面再现主导语言意识形态。论文以 'delve' 一词引发的争议为例,说明全球北方英语使用者如何规训全球南方英语使用者的语言规范。论文还引用 Christian Mair 的 '标准化悖论':AI 可能通过偏好标准形式使英语同质化,同时通过广泛语料接触使英语多元化。

How the Capability Boundary Shifted

论文指出 AI 系统在训练数据、设计协议、评估基准等层面再现语言意识形态,这意味着当前 LLM 的训练和评估流程可能隐含对标准英语的偏好,影响模型对非主流英语变体的处理能力。

Why It Matters

该研究揭示 AI 行业在数据选择和评估标准上可能存在的偏见,提示开发者在多语言和多文化场景中需关注语言多样性,避免强化标准语言意识形态。

Who It Affects

对于面向全球用户的 AI 产品,忽视语言多样性可能导致用户体验不佳或引发争议,企业需在数据策略和产品设计中考虑语言包容性。

What to Watch Next

未来可能看到更多关于 AI 语言偏见的研究,以及开发者在数据收集和评估中纳入语言多样性考量的趋势。