Where Models Converge and Humans Diverge: A Coverage Framework for Distributional Pluralism in Open-Ended Generation
arXiv 论文 2608.05576v1 提出 LLM Coverage (LLM-Cov) 和 In-Boundary Rate (IBR) 两个指标,用于衡量 LLM 生成内容在人类写作分布上的覆盖广度。在构思和叙事任务中,当前 LLM 生成内容虽合理但狭窄,集中于人类响应中心附近。
发展脉络
- 首次出现Where Models Converge and Humans Diverge: A Coverage Framework for Distributional Pluralism in Open-Ended GenerationarXiv cs.CL
- 当前判断该框架为评估生成式 AI 产品的多样性提供了新工具,可能影响内容生成类产品的质量评估标准。当前 LLM 在创意写作等任务上的'平均化'倾向,可能限制其在需要多样性的场景(如广告文案、故事生成)中的应用。Agent Pulse · 分析
该论文指出,LLM 生成内容与人类写作之间存在分布性差距:LLM 倾向于生成'平均'内容,而人类写作覆盖更广的分布。论文提出基于人类写作经验分布的框架,通过 LLM-Cov 和 IBR 两个指标,将 LLM 内容的合理性与分布广度分离。在构思和叙事任务中,当前 LLM 生成内容虽合理但狭窄,集中于人类响应中心附近。
LLM-Cov 和 IBR 提供了一种可操作的度量方式,用于量化生成内容的多样性。这暗示当前 LLM 的采样策略(如温度、top-p)可能不足以覆盖人类写作的长尾分布。未来可探索通过调整解码策略或训练目标来提升分布覆盖,但需注意避免牺牲合理性。
该框架为评估生成式 AI 产品的多样性提供了新工具,可能影响内容生成类产品的质量评估标准。当前 LLM 在创意写作等任务上的'平均化'倾向,可能限制其在需要多样性的场景(如广告文案、故事生成)中的应用。
对于依赖内容生成的业务(如营销、娱乐),该框架可帮助评估模型输出的多样性,指导模型选型或微调方向。提升多样性可能增强产品差异化,但需平衡合理性与成本。
后续可验证的信号包括:该框架是否被其他研究采用,以及是否有模型通过训练或解码改进在 LLM-Cov 和 IBR 上的表现。若出现显著提升,可能推动生成内容多样性的新标准。