WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA
WAM-Diff2 是一个多任务离散扩散 VLA 框架,通过三阶段层次化蒸馏(渐进式块级适配、块级蒸馏、模型级跨尺度蒸馏)将预训练的自回归通用模型转化为并行扩散模型,以降低自动驾驶 VLA 的推理延迟并缓解暴露偏差。
Development
- First ReportWAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLAarXiv cs.AI
- Current Assessment该研究反映了自动驾驶 VLA 模型从自回归向扩散范式迁移的趋势,旨在平衡认知能力与执行效率。若成功,可能推动端到端自动驾驶模型在车端低延迟部署,但论文未提供实验数据或部署细节,实际效果待验证。Agent Pulse · analysis
WAM-Diff2 提出了一种将预训练自回归 VLA 模型转化为并行扩散模型的方法,以解决自动驾驶中自回归解码的高延迟和暴露偏差问题。该方法通过三阶段层次化蒸馏(渐进式块级适配、块级蒸馏、模型级跨尺度蒸馏)保留基础模型的语义基础,同时实现低延迟并行执行。论文指出,从零训练的扩散策略通常产生窄的单任务架构,缺乏整体视觉-语言推理能力,而 WAM-Diff2 旨在结合多任务认知智能与执行效率。
WAM-Diff2 的核心技术挑战在于自回归模型的因果注意力与扩散模型的双向注意力不匹配,以及优化目标的分歧。三阶段蒸馏策略通过渐进式块级适配逐步调整注意力模式,块级蒸馏传递语义知识,模型级跨尺度蒸馏实现多尺度对齐,从而在架构转换中保留基础模型的语义基础。
该研究反映了自动驾驶 VLA 模型从自回归向扩散范式迁移的趋势,旨在平衡认知能力与执行效率。若成功,可能推动端到端自动驾驶模型在车端低延迟部署,但论文未提供实验数据或部署细节,实际效果待验证。
若 WAM-Diff2 有效,可降低自动驾驶 VLA 的推理成本,提升实时性,对自动驾驶解决方案提供商和车端芯片厂商具有潜在商业价值,但当前阶段仍属研究探索。
后续可关注 WAM-Diff2 的完整实验数据、与其他扩散 VLA 方法的对比,以及其在真实自动驾驶场景中的部署案例。