SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents
SkillGate 论文提出,在长周期 Agent 中,策略在 episode 中途决定读取哪个技能,但现有信号无法训练这一决策。作者识别并命名了“选择器信用饥饿”问题:在广播的序列级优势下,命名所选技能的少量 token 承担的损失份额极小,且随轨迹变长,其继承的信用错误符号越来越严重。审计已完成运行的训练产物证实了这三个属性,且均随 horizon 单调恶化。SkillGate 通过构造将 token 支持划分为两个不相交的信用通道,结果信用仅到达执行 token,而独立的动作局部优势恰好到达技能命名 token。
Development
- First ReportSkillGate: Training In-Policy Skill Selection in Long-Horizon AgentsHugging Face Daily Papers
- Industry ResponseSkillGate: Training In-Policy Skill Selection in Long-Horizon AgentsarXiv cs.AI
- Current Assessment随着技能库规模扩大,技能选择成为 Agent 性能的关键瓶颈。SkillGate 提出的方法可能推动 Agent 框架在训练时更关注技能选择决策,而非仅优化执行。这可能导致技能库管理和选择策略成为新的研究热点,并影响 Agent 产品的可靠性。Agent Pulse · analysis
SkillGate 论文指出,Agent 框架将程序性知识打包为技能,Agent 按需读取指令文件,公共库中已有数千个技能。选择读取哪个技能成为策略在 episode 中途做出的决策,但现有信号无法训练它。默认的补救措施——对候选列表进行结果奖励的强化学习——无法教会这一决策,原因是结构性的“选择器信用饥饿”:在广播的序列级优势下,命名所选技能的少量 token 承担的损失份额极小,且随轨迹变长,其继承的信用错误符号越来越严重。正确的选择在后续执行失败时受到惩罚,尽管该选择本身是轨迹中最有价值的决策之一。审计已完成运行的训练产物证实了这三个属性,且均随 horizon 单调恶化。SkillGate 通过构造消除了这一失败:它将 token 支持划分为两个不相交的信用通道,结果信用仅到达执行 token,而独立的动作局部优势恰好到达技能命名 token。
该论文揭示了长周期 Agent 训练中的一个关键机制:技能选择 token 在序列级优势下遭受信用饥饿,导致正确选择被错误惩罚。SkillGate 通过分离信用通道,使结果信用只影响执行 token,动作局部优势只影响技能命名 token,从而在构造上避免该问题。这提示我们,在长周期任务中,信用分配需要更细粒度的设计,而非简单的序列级奖励。
随着技能库规模扩大,技能选择成为 Agent 性能的关键瓶颈。SkillGate 提出的方法可能推动 Agent 框架在训练时更关注技能选择决策,而非仅优化执行。这可能导致技能库管理和选择策略成为新的研究热点,并影响 Agent 产品的可靠性。
对于构建长周期 Agent 产品的公司,技能选择的质量直接影响任务成功率。SkillGate 提供了一种训练技能选择的方法,可能提升 Agent 在复杂任务中的表现,从而增强产品竞争力。但该方法尚处于研究阶段,实际效果需进一步验证。
下一步可验证的信号包括:SkillGate 在更长 horizon 任务上的公开基准结果,以及是否有其他团队复现或扩展该方法。若该方法有效,可能被集成到主流 Agent 框架中,改变技能选择训练的标准做法。