AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月30日 · Prox

Prox: Training-Free FFN Activation Sparsity via Approximate Intermediate-Channel Salience in LLMs

发生了什么

Prox 是一个无需训练的 FFN 激活稀疏化框架,利用 SwiGLU 中间状态的近似显著性选择通道。在 70% FFN 稀疏度下,端到端解码速度提升最高达 1.99 倍,并在六个模型家族的十个 LLM 上优于无需训练的基线。

EVENT STORY

发展脉络

  1. 首次出现Prox: Training-Free FFN Activation Sparsity via Approximate Intermediate-Channel Salience in LLMsarXiv cs.CL
  2. 当前判断Prox 表明无需训练的稀疏化方法仍有提升空间,可能降低 LLM 推理成本,推动更高效的部署。但需关注其在不同硬件和模型上的泛化性。Agent Pulse · 分析
改变了什么

Prox 提出了一种无需训练的 FFN 激活稀疏化方法,针对 LLM 推理中 FFN 层的内存和计算开销。现有方法在高稀疏度下质量下降,Prox 通过两阶段框架解决:第一阶段利用输入稀疏性和量化代理权重构建共享掩码,第二阶段精确计算所选通道,实现三个投影的稀疏执行。该方法在六个模型家族的十个 LLM 上验证,所有稀疏度水平下均优于基线,70% 稀疏度时解码速度提升 1.99 倍。

能力边界怎么变了

Prox 的关键洞察是稀疏执行仅需中间状态产生的通道掩码,而掩码可由条目幅值排序而非精确值构建。这避免了稠密计算,同时保持选择质量。两阶段设计将掩码构建与精确计算分离,可能为其他稀疏方法提供借鉴。

为什么重要

Prox 表明无需训练的稀疏化方法仍有提升空间,可能降低 LLM 推理成本,推动更高效的部署。但需关注其在不同硬件和模型上的泛化性。

对谁有影响

Prox 可降低 LLM 推理的延迟和成本,对提供 LLM 服务的公司有直接价值,可能提升吞吐量并降低单位成本。

接下来观察

后续可关注 Prox 在更大模型、更长上下文或不同硬件上的表现,以及与其他优化技术(如量化、剪枝)的结合。