LEX-EC: A Lexical Evidence-Channel Audit Framework for Zero-Shot LLM Personality Classification in Black-Box Settings
LEX-EC 是一个可复用的黑盒审计框架,结合 prevalence 与 agreement 诊断及受控词汇消融,用于区分边际分布效应与受限证据下可恢复的特质关联信号。研究显示:自由文本包含最广泛但仍弱的信号;研究生自我介绍中可观察的外向性关联在掩蔽后减弱;单一 Facebook 状态在特质平衡样本中几乎不提供稳定证据。掩蔽主题与人口统计内容削弱部分关联,但功能词、情感词与认知风格词汇仍保留可检测信号。语言提示改变了模型自我解释但未消除主题内容。
发展脉络
- 首次出现LEX-EC: A Lexical Evidence-Channel Audit Framework for Zero-Shot LLM Personality Classification in Black-Box SettingsarXiv cs.AI
- 当前判断该框架为 LLM 人格分类的可信度评估提供了方法论,可能影响依赖人格标签的行业应用(如个性化推荐、心理测评)。其揭示的文本长度与内容下限,提示当前模型在短文本场景下的人格分类可靠性有限,行业需谨慎使用此类标签。Agent Pulse · 分析
arXiv 论文提出 LEX-EC,一个面向零样本 LLM 人格分类的黑盒审计框架。该框架结合 prevalence 与 agreement 诊断及受控词汇消融,以区分边际分布效应与特质关联信号。实验表明,不同文本体裁呈现不同人格信号剖面:自由文本信号最广但弱;研究生自我介绍中外向性关联在掩蔽后减弱;单一 Facebook 状态在特质平衡样本中几乎无稳定证据,提示内容或长度的可能下限。掩蔽主题与人口统计内容削弱部分关联,但功能词、情感词与认知风格词汇仍保留可检测信号。语言提示改变模型自我解释但未消除主题内容。该框架可复用,用于评估分类 prevalence、项目级关联、机会校正一致性及词汇消融下的持久性。
LEX-EC 提供了一种黑盒审计方法,通过 prevalence 与 agreement 诊断区分边际分布效应与真实特质关联,并用受控词汇消融定位信号来源。其发现表明,LLM 人格分类信号在短文本(如单一 Facebook 状态)中接近下限,而功能词与认知风格词汇在掩蔽后仍保留信号,提示模型依赖表层语言特征而非深层人格特质。这为黑盒模型的可解释性审计提供了可复用的诊断工具。
该框架为 LLM 人格分类的可信度评估提供了方法论,可能影响依赖人格标签的行业应用(如个性化推荐、心理测评)。其揭示的文本长度与内容下限,提示当前模型在短文本场景下的人格分类可靠性有限,行业需谨慎使用此类标签。
对依赖 LLM 人格标签的 To B 应用(如招聘筛选、用户画像)有警示价值:短文本场景下标签可靠性低,需结合长文本或额外验证。框架本身可作为审计工具,为模型供应商提供可解释性卖点。
后续可验证信号:该框架是否被应用于其他黑盒模型或任务(如情感、价值观分类);是否出现针对短文本信号下限的改进方法;以及语言提示对自我解释的影响是否在更大模型上复现。