AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年9月1日 · SMELT

SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

发生了什么

SMELT 论文提出在 Mixture-of-Experts Transformer 上循环中间层两次,同时匹配未循环基线的每 token FLOPs、总非嵌入参数和 KV cache。在四个规模(最大 54B 非嵌入参数)上拟合 Chinchilla 风格缩放定律,SMELT 在计算最优前沿节省 6.8-18.0% 训练 FLOPs,优势在代码基准上最大,并随样本长度和上下文示例数量增长。机制分析显示第二次访问减少注意力汇聚并重定向到内容相关 token。

EVENT STORY

发展脉络

  1. 首次出现SMELT: Scaling Laws for Compute-Matched MoE Looped TransformersHugging Face Daily Papers
  2. 行业反馈SMELT: Scaling Laws for Compute-Matched MoE Looped TransformersarXiv cs.LG
  3. 当前判断SMELT 的缩放定律显示循环架构在计算最优前沿具有优势,可能影响未来模型设计中对深度和循环的选择。如果该优势在更大规模上保持,可能推动行业采用循环结构以降低训练成本。但需要更多独立验证和更大规模实验。Agent Pulse · 分析
改变了什么

SMELT 论文研究了循环 Transformer 在 Mixture-of-Experts 架构上的扩展规律,通过匹配每 token FLOPs、总非嵌入参数和 KV cache,提出 SMELT 配方(中间层循环两次)。在四个规模(最大 54B 非嵌入参数)上拟合缩放定律,SMELT 损失下降更快,在计算最优前沿节省 6.8-18.0% 训练 FLOPs。优势在代码基准上最大,并随样本长度和上下文示例数量增长。机制分析显示第二次访问减少注意力汇聚并重定向到内容相关 token,这可能解释了性能提升。

能力边界怎么变了

SMELT 表明在 MoE 架构中循环中间层两次可以在匹配 FLOPs、参数和 KV cache 的情况下提升损失下降速度,节省 6.8-18.0% 训练 FLOPs。机制上,第二次访问减少了注意力汇聚,将注意力权重重定向到内容相关 token,这可能是一种有益的归纳偏置。这提示循环结构可能通过改变注意力分布来提升效率,而非单纯增加深度。

为什么重要

SMELT 的缩放定律显示循环架构在计算最优前沿具有优势,可能影响未来模型设计中对深度和循环的选择。如果该优势在更大规模上保持,可能推动行业采用循环结构以降低训练成本。但需要更多独立验证和更大规模实验。

对谁有影响

SMELT 节省 6.8-18.0% 训练 FLOPs,直接降低训练成本。对于大规模模型训练,这可能转化为显著的成本节约,提升训练效率。但需注意优势在代码任务上最大,其他任务可能较小。

接下来观察

下一步可验证信号包括:SMELT 在更大规模(如 100B+)上的表现,以及在其他基准(如多模态)上的泛化。若优势持续,可能推动循环架构在工业界应用。