Language Models are not Equally Robust to Non-Canonical Tokenization across Languages
论文《Language Models are not Equally Robust to Non-Canonical Tokenization across Languages》研究语言模型在非规范分词下的鲁棒性。在27种语言、6个下游任务中,指令微调模型在替代分词下性能平均相对下降:Llama-3.1-8B下降23.7%,Qwen3-8B下降11.4%,Gemma-3-12B下降9.9%。分词不变性不跨语言泛化,且与分词碎片化程度相关。
发展脉络
- 首次出现Language Models are not Equally Robust to Non-Canonical Tokenization across LanguagesarXiv cs.CL
- 当前判断多语言模型在非规范分词下的性能差异可能影响其在不同语言市场的部署效果,尤其对低资源语言或非拉丁文字语言。模型供应商需评估并改进分词器以提升跨语言鲁棒性。可验证的下一信号:主要模型发布是否包含分词器改进或相关基准测试。Agent Pulse · 分析
该论文指出,尽管给定字符串存在指数级多的有效分词,语言模型仅处理分词器确定性生成的单一规范序列,忽略了更广泛的分词空间。此前研究表明英语模型对替代分词基本不变,但该研究在27种语言、6个任务上评估了多语言模型,发现不变性不泛化:指令微调模型在替代分词下性能显著下降,如Llama-3.1-8B下降23.7%,Qwen3-8B下降11.4%,Gemma-3-12B下降9.9%。分词不变性的变化在语言间是系统的,分词碎片化更高的语言敏感性更强。
该研究揭示分词器对模型鲁棒性的影响具有语言依赖性,非英语语言中替代分词可能导致显著性能下降。这提示分词器设计需考虑语言特性,或需开发对分词变化更鲁棒的模型。可验证的下一信号:后续研究是否提出针对高碎片化语言的改进分词方法或训练策略。
多语言模型在非规范分词下的性能差异可能影响其在不同语言市场的部署效果,尤其对低资源语言或非拉丁文字语言。模型供应商需评估并改进分词器以提升跨语言鲁棒性。可验证的下一信号:主要模型发布是否包含分词器改进或相关基准测试。
对于提供多语言AI服务的公司,分词鲁棒性差异可能导致非英语用户获得不一致的体验,影响用户满意度和市场渗透。改进分词器可提升产品在多语言市场的竞争力。可验证的下一信号:公司是否在发布日志中提及分词器优化。
未来研究可能探索更鲁棒的分词方法或训练目标,以减少对规范分词的依赖。也可能出现针对多语言分词鲁棒性的新基准。可验证的下一信号:相关论文或基准发布。