AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月5日 · Skill-Use

Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

发生了什么

Skill-Use 基准评估 LLM 智能体在渐进式披露下使用技能的能力,包含 79 个真实技能和 177 个可执行任务,覆盖九个领域,在隔离的 Docker 沙箱中运行,并通过基于轨迹的评分标准进行评分。评估了两种智能体框架下的八个 LLM,发现可靠的技能使用仍然遥不可及。

EVENT STORY

发展脉络

  1. 首次出现Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?arXiv cs.CL
  2. 当前判断该基准的引入表明,尽管 LLM 在任务执行上表现出色,但在自主技能使用方面仍存在显著不足。这可能会影响智能体框架的设计,促使开发者更注重技能发现和检索机制,而不是仅仅依赖模型的内在能力。Agent Pulse · 分析
改变了什么

Skill-Use 是一个新基准,用于评估 LLM 智能体在智能体框架中自主使用技能的能力。技能是结构化文档,指定何时行动、遵循什么程序以及允许哪些工具。现有评估主要关注技能质量或任务成功,而 Skill-Use 则测试智能体是否能在渐进式披露下识别相关技能并应用它,即智能体只看到技能的名称和简短描述,必须检索完整程序后才能遵循。该基准将技能使用分为三个部分:触发(是否调用相关技能)、合规(是否忠实遵循规定程序)和边界(是否避免禁止操作)。SU 分数结合了这三个部分,并且仅在技能被触发后才计入执行。Skill-Use 包含 79 个真实技能和 177 个可执行任务,涵盖九个领域,在隔离的 Docker 沙箱中运行,并通过基于轨迹的评分标准进行评分。评估了两种智能体框架下的八个 LLM,发现可靠的技能使用仍然遥不可及。

能力边界怎么变了

Skill-Use 基准通过分离触发、合规和边界三个维度,提供了对智能体技能使用能力的细粒度评估。渐进式披露设置模拟了真实场景,其中智能体必须主动检索技能细节,这比传统评估更严格。轨迹级评分标准可能捕捉到任务成功之外的细微行为。

为什么重要

该基准的引入表明,尽管 LLM 在任务执行上表现出色,但在自主技能使用方面仍存在显著不足。这可能会影响智能体框架的设计,促使开发者更注重技能发现和检索机制,而不是仅仅依赖模型的内在能力。

对谁有影响

对于构建智能体产品的公司,Skill-Use 基准提供了评估和改进智能体技能使用能力的工具,有助于提升产品在复杂任务中的可靠性和效率,从而增强竞争力。

接下来观察

未来,我们可能看到更多针对技能使用的基准和评估方法,以及改进的智能体框架,以增强技能触发和合规性。此外,技能库的设计可能会标准化,以促进更好的检索和遵循。