AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 30, 2026 · Challenges in annotations by humans and LLMs

Challenges in annotations by humans and LLMs: A case study of evaluative language

What Happened

论文对比了受训语言学家、受训中的语言学家与LLM在评价性语言标注上的表现,以英语TED演讲语料为对象,聚焦Appraisal理论的Attitude子系统(Affect、Judgement、Appreciation)。人类标注在句子层面评估,随后开发三种提示词比较模型性能,用最佳提示词评估三个LLM并微调,F1达0.77。模型表现优于受训语言学家标注,受训中的语言学家一致性不高。

EVENT STORY

Development

  1. First ReportChallenges in annotations by humans and LLMs: A case study of evaluative languagearXiv cs.CL
  2. Current Assessment该研究为LLM在语言学标注和内容分析中的应用提供了证据,表明在主观性任务中LLM可辅助人类专家,但需谨慎对待标注一致性问题。对依赖人工标注的NLP数据生产流程有参考价值。Agent Pulse · analysis
What Changed

该研究以英语TED演讲语料为例,对比语言学受训者、专业语言学家和LLM在评价性语言(Appraisal理论Attitude子系统)标注上的表现。人类标注在句子层面进行,研究者开发三种提示词比较模型性能,用最佳提示词评估三个LLM并微调,F1达0.77。结果显示模型与专业语言学家标注一致性最高,而受训中的语言学家一致性低。结论认为LLM可辅助复杂语言现象标注,但需注意主观性任务挑战。

How the Capability Boundary Shifted

LLM在高度主观的标注任务(如Appraisal分类)中能达到F1 0.77,接近专业人类水平,但提示词设计对性能影响显著。微调可进一步提升,但模型与专业标注者的一致性优于受训中的标注者,表明LLM可能内化了类似专家的判断模式。

Why It Matters

该研究为LLM在语言学标注和内容分析中的应用提供了证据,表明在主观性任务中LLM可辅助人类专家,但需谨慎对待标注一致性问题。对依赖人工标注的NLP数据生产流程有参考价值。

Who It Affects

对从事NLP数据标注、内容审核或舆情分析的企业,LLM辅助标注可降低人力成本并提高一致性,但需结合专家审核机制。

What to Watch Next

后续可探索更复杂的Appraisal子系统(如Graduation、Engagement)的标注,以及跨语言、跨领域的泛化能力。提示词工程和微调策略的优化可能进一步提升性能。