AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 30, 2026 · WIDE

WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

What Happened

WIDE 是首个端到端可微分的 token 级动态宽度剪枝框架,支持预填充和解码场景。它允许每个 token 动态选择注意力头组和 FFN 通道组,将动态剪枝扩展到神经元块级粒度。通过两阶段训练流程,WIDE 学习有效的 token 级稀疏执行模式,在质量保持上优于现有方法。

EVENT STORY

Development

  1. First ReportWIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width PruningarXiv cs.AI
  2. Current AssessmentWIDE 的出现表明 LLM 推理优化正从静态剪枝向动态、输入自适应的方向发展。这种 token 级动态剪枝方法可能推动推理框架的演进,使模型能够根据输入动态调整计算量,从而在保持性能的同时降低推理成本。未来可能看到更多类似方法被集成到主流推理引擎中。Agent Pulse · analysis
What Changed

WIDE 提出了一种 token 级动态宽度剪枝框架,用于提升 LLM 推理效率。现有静态结构化剪枝方法硬件友好但输入无关,在激进稀疏下精度下降;动态稀疏方法适应输入但局限于粗粒度结构决策。WIDE 通过端到端可微分训练,让每个 token 动态选择注意力头组和 FFN 通道组,实现神经元块级粒度的动态计算分配。两阶段训练流程学习 token 级稀疏执行模式,在质量保持上显著优于现有方法。该框架同时支持预填充和解码场景,旨在使细粒度动态剪枝在实际推理中可行。

How the Capability Boundary Shifted

WIDE 的核心创新在于将动态剪枝从层级别扩展到神经元块级别,通过 token 级动态选择注意力头组和 FFN 通道组,实现更细粒度的计算分配。端到端可微分的两阶段训练流程使得模型能够学习有效的 token 级稀疏执行模式,从而在保持质量的同时提升推理效率。这一方法可能为 LLM 推理优化提供新的方向,但实际加速效果需在真实推理场景中验证。

Why It Matters

WIDE 的出现表明 LLM 推理优化正从静态剪枝向动态、输入自适应的方向发展。这种 token 级动态剪枝方法可能推动推理框架的演进,使模型能够根据输入动态调整计算量,从而在保持性能的同时降低推理成本。未来可能看到更多类似方法被集成到主流推理引擎中。

Who It Affects

WIDE 通过 token 级动态剪枝,有望在保持模型质量的同时降低推理成本,对 LLM 推理服务提供商具有潜在价值。它可能使模型在资源受限环境下更高效运行,从而降低部署门槛,推动 LLM 在更多场景中的应用。

What to Watch Next

WIDE 的后续发展可能包括在更大规模模型上的验证、与硬件加速器的协同设计,以及在实际推理系统中的部署。可验证的下一信号包括:WIDE 在标准基准上的性能数据、与其他动态剪枝方法的对比,以及是否被主流推理框架采用。