Divergent large language model predictions from convergent representations in ambiguous word pairs
arXiv 论文 2608.01816v1 研究解码器-only 变压器如何解决词汇歧义,对 GPT-2-Small-117M、Llama-3.2-3B、Qwen2.5-32B 三个模型进行逐层分析。发现同音词和多义词的表示在中间层差异最大,后期部分重新收敛,而下一词预测的 KL 散度在最后层达到最大。激活修补实验表明后期表示差异直接决定输出。单层消融实验显示模型实现等效消歧但层间脆弱性不同。
Development
- First ReportDivergent large language model predictions from convergent representations in ambiguous word pairsarXiv cs.CL
- Current Assessment该研究为嵌入相似性与行为输出低相关性的现象提供了机制解释,可能影响依赖嵌入相似性的下游应用(如检索增强生成、语义搜索)的设计。模型内部表示与行为输出的脱节意味着,仅基于嵌入的评估可能高估或低估模型能力,需要结合行为测试。Agent Pulse · analysis
该研究通过逐层分析三个不同规模的解码器-only 语言模型,揭示了词汇歧义消解的内部机制。研究发现,对于同音词和多义词,模型的内部表示在中间层变得最大程度不同,但在后期层部分重新收敛,然而预测分布的差异却在最后层达到峰值。激活修补实验提供了因果证据,表明后期层的表示差异直接决定输出,尽管嵌入空间中的相似性增加。单层消融实验表明,不同模型实现等效的消歧效果,但层间脆弱性不同。这些发现为近期观察到的模型内部嵌入相似性与行为输出低相关性的现象提供了解释,即语义区分仍然存在,但对基于嵌入的相似性度量越来越不可见,这对语义搜索、检索等应用有影响。
该研究通过逐层分析揭示了表示收敛与预测发散之间的解耦:中间层表示差异最大,后期层表示部分收敛,但预测 KL 散度在最后层最大。激活修补实验表明后期层差异是输出的直接原因,说明模型在后期层将语义区分编码为对相似性度量不敏感的形式。这提示基于嵌入相似性的方法(如语义搜索)可能无法捕捉模型实际使用的语义区分,需要开发新的表示分析方法。
该研究为嵌入相似性与行为输出低相关性的现象提供了机制解释,可能影响依赖嵌入相似性的下游应用(如检索增强生成、语义搜索)的设计。模型内部表示与行为输出的脱节意味着,仅基于嵌入的评估可能高估或低估模型能力,需要结合行为测试。
对于依赖嵌入相似性的产品(如语义搜索、RAG 系统),该研究提示当前方法可能无法充分利用模型的语义区分能力,存在优化空间。企业可关注后续研究,开发更有效的表示利用方法,以提升搜索和检索质量,获得竞争优势。
未来研究可能探索如何利用后期层表示进行更有效的语义提取,或开发新的表示分析方法以捕捉对相似性度量不可见的语义区分。也可能推动模型架构的改进,使语义区分在嵌入空间中更可见,从而提升下游任务性能。