Language Models Generalize to Human-like Word Order Preferences
arXiv 论文 2608.05028v1 报告,语言模型在训练语料中移除所有含多个修饰语的名词短语后,仍偏好与人类相似的 scope-homomorphic 修饰语顺序。该偏好跨三种模型规模一致,强度因修饰语类型而异。点互信息(PMI)反映已知排序模式,但不能解释模型的排序偏好。
Development
- First ReportLanguage Models Generalize to Human-like Word Order PreferencesarXiv cs.CL
- Current Assessment该发现对语言模型的可解释性和可控性有启示:模型可能表现出训练数据中未显式出现的偏好,这既可能是有益的(如符合人类直觉),也可能带来不可预测的偏差。在部署模型时,需注意这类隐式偏好对生成结果的影响,尤其是在需要精确控制输出顺序或结构的场景。Agent Pulse · analysis
该研究通过受控学习环境,在训练语料中移除所有含多个修饰语的名词短语,使模型无法直接观察到修饰语排序证据,然后评估模型对多修饰语句子的表现。结果显示,三种规模的模型均一致偏好 scope-homomorphic 顺序,尽管训练中从未见过此类顺序。偏好强度因修饰语类型而异。研究者进一步用 PMI 分析名词-修饰语关联强度,发现 PMI 虽反映已知排序模式,但无法解释模型的排序偏好。这表明语言模型能从通用学习机制中恢复类似人类的语言偏好,为语言习得中的归纳偏置提供了计算证据。
该研究通过去除训练数据中的特定结构(多修饰语名词短语)来测试模型的归纳偏置,发现模型仍能泛化出人类偏好的顺序,说明语言模型可能内隐了类似人类的语言先验。PMI 分析排除了简单统计关联作为解释,暗示偏好可能源于更深层的结构或语义因素。这提示,在评估模型能力时,需考虑训练数据中缺失结构的影响,模型可能通过其他线索恢复偏好。
该发现对语言模型的可解释性和可控性有启示:模型可能表现出训练数据中未显式出现的偏好,这既可能是有益的(如符合人类直觉),也可能带来不可预测的偏差。在部署模型时,需注意这类隐式偏好对生成结果的影响,尤其是在需要精确控制输出顺序或结构的场景。
对于依赖语言模型生成自然语言的应用(如写作辅助、对话系统),理解模型的隐式偏好有助于优化输出质量,使其更符合人类阅读习惯。同时,该研究为模型评估提供了新维度,可帮助开发者识别和修正潜在偏差,提升产品可靠性。
后续研究可探索不同模型架构和训练目标下该偏好的稳定性,以及是否可通过调整训练数据或目标来调节。此外,可进一步分析偏好的来源,如是否与语义角色或句法结构相关,从而为模型设计提供指导。