Agent Skills Matter: Inferring Proprietary Skills from Execution Trajectories
SigLeak 是一个黑盒框架,通过良性查询引发的执行轨迹重建专有 agent skills,无需参考答案或成功标签。它构建多样化的决策丰富诊断任务,对比启用与禁用 skill 的轨迹,迭代精炼重建的 skill。在五个场景、三个模型家族和三个 agent 框架中,SigLeak 在几乎所有设置中优于或匹配三个基线,平均成功率比禁用 skill 的参考高出 6.88 个百分点,并达到最高的 SkillSim 指标。
Development
- First ReportAgent Skills Matter: Inferring Proprietary Skills from Execution TrajectoriesarXiv cs.AI
- Current AssessmentAgent skills 的可移植性和轻量形式使其适合市场化和私有部署,但 Skill Leakage 表明高价值 skill 的专有性可能被削弱。提供商需重新评估 skill 的保密策略,考虑行为层面的防护。Agent Pulse · analysis
论文提出 Skill Leakage 概念:尽管 agent skills 以轻量可移植形式部署,隐藏其工件并不能掩盖行为效果,这些效果在执行轨迹中可观察,形成行为侧信道。SigLeak 利用 agent 行为中的重复 skill 签名,通过良性查询构建诊断任务,对比 skill 启用与禁用的轨迹,迭代重建专有 skill。实验覆盖五个场景、三个模型家族和三个 agent 框架,SigLeak 在几乎所有设置中优于或匹配三个基线,平均成功率提升 6.88 个百分点,并达到最高 SkillSim 指标。
SigLeak 表明 agent 的专有 skill 可通过行为侧信道被重建,即使工件被隐藏。其方法依赖构建决策丰富的诊断任务和对比轨迹,揭示 skill 的重复签名。这暗示 skill 的保密性不仅依赖工件隐藏,还需考虑行为层面的暴露。
Agent skills 的可移植性和轻量形式使其适合市场化和私有部署,但 Skill Leakage 表明高价值 skill 的专有性可能被削弱。提供商需重新评估 skill 的保密策略,考虑行为层面的防护。
对于提供专有 agent skills 的公司,Skill Leakage 构成知识产权风险,可能影响其商业价值。企业需评估 skill 暴露风险,并考虑在部署中增加行为层面的保护。
未来可能发展出针对 Skill Leakage 的防御方法,如混淆行为签名或限制轨迹可观察性。同时,SkillSim 等指标可能成为评估 skill 重建质量的基准。