Skill Issue: Are Skills Language-Invariant in LLMs?
arXiv 论文《Skill Issue: Are Skills Language-Invariant in LLMs?》通过多语言自博弈(multilingual self-play)量化了 LLM 跨语言技能不一致性。研究构建了 TextArena 的多语言扩展,评估了三个开源模型在八种语言、六种游戏中的表现,涵盖空间推理、不完全信息、资源分配和重复交互。结果发现同一模型在不同语言下表现出显著不同的游戏强度,存在胜负差距、无效动作和策略倾向的系统性差异,并揭示了空间推理、卡片条件决策和最优动作选择中的语言特定失败。
Development
- First ReportSkill Issue: Are Skills Language-Invariant in LLMs?Hugging Face Daily Papers
- Industry ResponseSkill Issue: Are Skills Language-Invariant in LLMs?arXiv cs.AI
- Current Assessment该研究揭示了 LLM 在多语言场景下的技能不一致性,对多语言 AI 产品的部署有重要影响。开发者需关注模型在不同语言中的实际能力差异,而非仅依赖整体基准分数。这可能推动多语言评估标准和方法的发展。Agent Pulse · analysis
该研究提出了一种正交于知识和通用基准性能的跨语言技能不一致性量化方法。通过多语言自博弈,两个相同模型实例分别使用不同语言界面在文本游戏中竞争,固定模型、对手、规则、状态空间和可用动作,从而隔离语言对模型实际行为的影响。实验覆盖三个开源模型、八种语言和六种游戏,发现模型在不同语言下的游戏强度差异显著,包括胜负差距、无效动作和策略倾向的系统性变化。详细分析揭示了空间推理、卡片条件决策和最优动作选择中的语言特定失败。该工作为评估和改善 LLM 的跨语言能力提供了新视角。
多语言自博弈为评估 LLM 技能提供了一种可控的隔离方法,将语言影响从知识记忆中分离。研究发现语言特定失败模式,如空间推理和卡片条件决策,暗示模型内部表征可能依赖语言表面形式。未来可探索跨语言技能迁移或对齐技术,以提升模型在多语言环境下的鲁棒性。
该研究揭示了 LLM 在多语言场景下的技能不一致性,对多语言 AI 产品的部署有重要影响。开发者需关注模型在不同语言中的实际能力差异,而非仅依赖整体基准分数。这可能推动多语言评估标准和方法的发展。
对于提供多语言 AI 服务的公司,该研究提示需针对不同语言优化模型,以避免因语言导致的性能下降。这可能影响产品本地化策略和资源分配,并催生多语言评估工具的市场需求。
后续研究可能扩展至更多模型和语言,并探索缓解跨语言技能差异的方法,如跨语言微调或提示策略。可验证信号包括:更多模型在 TextArena 多语言基准上的结果,以及针对语言特定失败模式的改进技术。