SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation
SKT 是一个验证过的数据合成流水线,用于从大型 Agent 技能集合中构建技能基础任务和可执行轨迹。它从 2,000 个公共技能中生成 4,000 个任务包和 27,164 条验证轨迹,并构建了 SkillEval 基准。实验表明,在 SKT 生成的轨迹上进行监督微调能持续提升技能使用性能。
发展脉络
- 首次出现SKT: Skill-Use Training at Scale via Verified Synthetic Data GenerationarXiv cs.AI
- 当前判断SKT 表明,通过合成数据可以提升 Agent 的技能使用能力,这可能降低对人工演示数据的依赖。这暗示 Agent 训练数据市场可能转向更自动化的合成生成,但合成数据的验证和过滤将成为关键。可验证的信号是:是否有其他团队采用类似验证合成方法,以及合成数据在 Agent 训练中的占比是否上升。Agent Pulse · 分析
SKT 引入了一种验证过的数据合成流水线,旨在提升语言模型 Agent 的技能使用能力。该流水线从大型技能集合中选择合适的单技能和多技能配置,通过基于规则和基于 Agent 的验证以及反馈引导修复来合成任务,并仅保留那些充分使用每个所需技能的成功轨迹。使用 2,000 个公共技能,SKT 生成了 4,000 个任务包和 27,164 条验证轨迹。基于同一流水线和不相交的测试池,作者构建了 SkillEval,一个用于评估技能使用的可执行基准。跨多种模型、基准和 Agent 框架的实验表明,在 SKT 生成的轨迹上进行监督微调能持续提升技能使用性能。验证消融、跨框架评估和扩展实验进一步证明了该方法的有效性。
SKT 的核心在于通过验证和反馈修复来合成高质量技能使用数据,而非依赖人工标注。其验证机制包括规则和基于 Agent 的验证,确保轨迹正确且充分使用每个所需技能。这种数据合成方法可能比现有方法更可扩展,因为技能库可以持续增长。下一步可验证的信号是:SKT 生成的数据是否能在更大规模技能库(如 10,000+)上保持质量,以及其轨迹是否能在不同 Agent 框架间迁移。
SKT 表明,通过合成数据可以提升 Agent 的技能使用能力,这可能降低对人工演示数据的依赖。这暗示 Agent 训练数据市场可能转向更自动化的合成生成,但合成数据的验证和过滤将成为关键。可验证的信号是:是否有其他团队采用类似验证合成方法,以及合成数据在 Agent 训练中的占比是否上升。
SKT 提供了一种低成本、可扩展的 Agent 技能训练数据生成方法,可能降低构建 Agent 应用的成本。对于开发 Agent 产品的公司,采用此类合成数据可加速技能开发,减少人工标注成本。可验证的信号是:是否有公司采用 SKT 或类似方法并报告成本降低或性能提升。
SKT 的扩展实验表明,随着技能库和轨迹数量的增加,性能可能进一步提升。未来可能出现更大规模、更通用的技能使用训练数据集,并可能推动 Agent 在复杂多技能任务上的表现。可验证的信号是:SKT 或类似方法是否被集成到主流 Agent 训练流程中,以及 SkillEval 是否成为标准基准。