Fidelity Is Not Safety: Gently-Compressed LLMs Pass Every Data-Free Quality Guard Yet Invent Procedure Steps in Agentic Execution
arXiv 论文 2607.28196v1 报告,在三个模型家族中,经过温和压缩(低秩 SVD 截断)的 LLM 能通过所有数据无关的质量检查(困惑度、MMLU、输出保真度),但在作为 Agent 执行标准操作程序时,会凭空编造指令中不存在的步骤。幅度剪枝在相同困惑度下不会引发此现象。配对置信区间显示,压缩权重在输出保真度测试中通过,但在编造步骤金丝雀测试中失败。
发展脉络
- 首次出现Fidelity Is Not Safety: Gently-Compressed LLMs Pass Every Data-Free Quality Guard Yet Invent Procedure Steps in Agentic ExecutionarXiv cs.CL
- 当前判断当前模型压缩的验收标准存在系统性盲区,可能导致部署的压缩模型在 Agent 场景中出现不可预测的行为。这会影响依赖压缩模型进行自动化决策的行业,如客服、编程助手等。行业需要建立更全面的评估体系,纳入 Agent 行为测试。Agent Pulse · 分析
arXiv 论文 2607.28196v1 揭示了一个关键盲点:当前数据无关的质量检查无法检测压缩 LLM 在 Agent 执行中的安全隐患。研究者发现,在三个模型家族中,采用低秩 SVD 截断的温和压缩模型,尽管在困惑度、MMLU 准确率和输出保真度等指标上均通过检查,但在执行标准操作程序时,会编造出指令中不存在的步骤。这种效应具有算子特异性:低秩截断会引发,而幅度剪枝在相同困惑度下不会。通过配对置信区间,研究者分离出原因:压缩误差的相干性及其速率是决定性因素,而损伤幅度无法预测。数据无关的保真度探针本质上无法捕捉这一维度。
该研究揭示压缩误差的相干性(而非幅度)是导致 Agent 行为异常的关键。低秩 SVD 截断产生的误差具有结构相干性,可能破坏模型内部的程序执行机制,导致编造步骤。而幅度剪枝的误差更接近随机噪声,不影响该机制。这提示压缩评估需要超越困惑度和保真度,引入针对 Agent 行为的金丝雀测试。
当前模型压缩的验收标准存在系统性盲区,可能导致部署的压缩模型在 Agent 场景中出现不可预测的行为。这会影响依赖压缩模型进行自动化决策的行业,如客服、编程助手等。行业需要建立更全面的评估体系,纳入 Agent 行为测试。
对于使用压缩模型的企业,该发现意味着需要重新评估压缩模型的部署风险,可能增加额外的测试成本。对于模型压缩服务提供商,这是一个差异化机会,提供更安全的压缩方案。
未来压缩评估标准可能加入 Agent 行为金丝雀测试,以检测压缩误差的相干性。研究者可能开发新的压缩方法,控制误差相干性,或设计新的保真度指标。