Challenges in annotations by humans and LLMs: A case study of evaluative language
论文对比了受训语言学家、受训中的语言学家与LLM在评价性语言标注上的表现,以英语TED演讲语料为对象,聚焦Appraisal理论的Attitude子系统(Affect、Judgement、Appreciation)。人类标注在句子层面评估,随后开发三种提示词比较模型性能,用最佳提示词评估三个LLM并微调,F1达0.77。模型表现优于受训语言学家标注,受训中的语言学家一致性不高。
发展脉络
- 首次出现Challenges in annotations by humans and LLMs: A case study of evaluative languagearXiv cs.CL
- 当前判断该研究为LLM在语言学标注和内容分析中的应用提供了证据,表明在主观性任务中LLM可辅助人类专家,但需谨慎对待标注一致性问题。对依赖人工标注的NLP数据生产流程有参考价值。Agent Pulse · 分析
该研究以英语TED演讲语料为例,对比语言学受训者、专业语言学家和LLM在评价性语言(Appraisal理论Attitude子系统)标注上的表现。人类标注在句子层面进行,研究者开发三种提示词比较模型性能,用最佳提示词评估三个LLM并微调,F1达0.77。结果显示模型与专业语言学家标注一致性最高,而受训中的语言学家一致性低。结论认为LLM可辅助复杂语言现象标注,但需注意主观性任务挑战。
LLM在高度主观的标注任务(如Appraisal分类)中能达到F1 0.77,接近专业人类水平,但提示词设计对性能影响显著。微调可进一步提升,但模型与专业标注者的一致性优于受训中的标注者,表明LLM可能内化了类似专家的判断模式。
该研究为LLM在语言学标注和内容分析中的应用提供了证据,表明在主观性任务中LLM可辅助人类专家,但需谨慎对待标注一致性问题。对依赖人工标注的NLP数据生产流程有参考价值。
对从事NLP数据标注、内容审核或舆情分析的企业,LLM辅助标注可降低人力成本并提高一致性,但需结合专家审核机制。
后续可探索更复杂的Appraisal子系统(如Graduation、Engagement)的标注,以及跨语言、跨领域的泛化能力。提示词工程和微调策略的优化可能进一步提升性能。