AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月3日 · Faster-WAM

Faster-WAM: Do World Action Models Need Deep Action Modules?

发生了什么

Faster-WAM 论文提出 Dock of Transformer (DoT) 设计原则,将预训练视频 Transformer 作为表示中心,通过对接接口连接轻量输出头。Faster-WAM 在 30 层视频骨干上对接单层动作头,无需额外具身预训练,在 LIBERO 和 RoboTwin 2.0 上取得有竞争力的性能,并在 LIBERO-Plus 上展现强分布外泛化。在受控比较中,Faster-WAM 端到端延迟最低,仅需 66.5 毫秒。

EVENT STORY

发展脉络

  1. 首次出现Faster-WAM: Do World Action Models Need Deep Action Modules?arXiv cs.LG
  2. 当前判断Faster-WAM 表明,在具身智能领域,通过架构解耦可以在不牺牲性能的前提下显著降低推理延迟,这可能推动实时机器人控制系统的部署。该工作强调视频世界模型作为通用表示中心的价值,可能影响未来具身模型的设计趋势。可验证的下一信号:是否有更多工作采用类似解耦设计,或 Faster-WAM 被集成到实际机器人产品中。Agent Pulse · 分析
改变了什么

Faster-WAM 论文针对世界动作模型(WAMs)中动作模块深度与视频骨干深度绑定导致的计算开销和推理延迟问题,提出 Dock of Transformer (DoT) 设计原则。DoT 将预训练视频 Transformer 视为表示中心,通过对接接口连接轻量输出头,允许灵活设计输出头并直接访问骨干所有层的表示。Faster-WAM 是 DoT 在 WAM 上的实例化,在 30 层视频骨干上对接单层动作头,对接接口融合所有视频层的键和值并应用 RoPE 重对齐。实验表明,无需额外具身预训练,Faster-WAM 在 LIBERO 和 RoboTwin 2.0 上达到有竞争力的性能,并在 LIBERO-Plus 上展现强分布外泛化。在受控比较中,Faster-WAM 实现最低端到端延迟,仅需 66.5 毫秒。

能力边界怎么变了

Faster-WAM 的核心创新在于将动作模块与视频骨干解耦,通过对接接口融合所有层的键值并应用 RoPE 重对齐,使单层动作头能访问深层表示,从而在保持性能的同时大幅降低延迟。这暗示动作预测可能不需要深层网络,浅层头配合丰富的骨干表示即可。可验证的下一信号:Faster-WAM 是否在更多具身任务或真实机器人上验证,以及 DoT 原则是否推广到其他多模态模型。

为什么重要

Faster-WAM 表明,在具身智能领域,通过架构解耦可以在不牺牲性能的前提下显著降低推理延迟,这可能推动实时机器人控制系统的部署。该工作强调视频世界模型作为通用表示中心的价值,可能影响未来具身模型的设计趋势。可验证的下一信号:是否有更多工作采用类似解耦设计,或 Faster-WAM 被集成到实际机器人产品中。

对谁有影响

Faster-WAM 的低延迟特性对机器人实时控制至关重要,可能降低具身智能产品的硬件成本或提高响应速度,从而加速商业化落地。对于提供机器人解决方案的公司,采用类似架构可提升产品竞争力。可验证的下一信号:是否有公司采用 Faster-WAM 或类似技术,以及相关产品的市场反馈。

接下来观察

Faster-WAM 的 DoT 原则可能启发更多高效模型设计,将预训练骨干作为共享表示中心,通过轻量头适配不同任务。未来可能看到动作模块进一步简化,甚至实现实时控制。可验证的下一信号:Faster-WAM 的代码是否开源,以及后续工作是否在更大规模或更多任务上验证。