AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月30日 · Challenges in annotations by humans and LLMs

Challenges in annotations by humans and LLMs: A case study of evaluative language

发生了什么

论文对比了受训语言学家、受训中的语言学家与LLM在评价性语言标注上的表现,以英语TED演讲语料为对象,聚焦Appraisal理论的Attitude子系统(Affect、Judgement、Appreciation)。人类标注在句子层面评估,随后开发三种提示词比较模型性能,用最佳提示词评估三个LLM并微调,F1达0.77。模型表现优于受训语言学家标注,受训中的语言学家一致性不高。

EVENT STORY

发展脉络

  1. 首次出现Challenges in annotations by humans and LLMs: A case study of evaluative languagearXiv cs.CL
  2. 当前判断该研究为LLM在语言学标注和内容分析中的应用提供了证据,表明在主观性任务中LLM可辅助人类专家,但需谨慎对待标注一致性问题。对依赖人工标注的NLP数据生产流程有参考价值。Agent Pulse · 分析
改变了什么

该研究以英语TED演讲语料为例,对比语言学受训者、专业语言学家和LLM在评价性语言(Appraisal理论Attitude子系统)标注上的表现。人类标注在句子层面进行,研究者开发三种提示词比较模型性能,用最佳提示词评估三个LLM并微调,F1达0.77。结果显示模型与专业语言学家标注一致性最高,而受训中的语言学家一致性低。结论认为LLM可辅助复杂语言现象标注,但需注意主观性任务挑战。

能力边界怎么变了

LLM在高度主观的标注任务(如Appraisal分类)中能达到F1 0.77,接近专业人类水平,但提示词设计对性能影响显著。微调可进一步提升,但模型与专业标注者的一致性优于受训中的标注者,表明LLM可能内化了类似专家的判断模式。

为什么重要

该研究为LLM在语言学标注和内容分析中的应用提供了证据,表明在主观性任务中LLM可辅助人类专家,但需谨慎对待标注一致性问题。对依赖人工标注的NLP数据生产流程有参考价值。

对谁有影响

对从事NLP数据标注、内容审核或舆情分析的企业,LLM辅助标注可降低人力成本并提高一致性,但需结合专家审核机制。

接下来观察

后续可探索更复杂的Appraisal子系统(如Graduation、Engagement)的标注,以及跨语言、跨领域的泛化能力。提示词工程和微调策略的优化可能进一步提升性能。