DraftExpert: Expansion-Aware Self-Speculative Decoding for End-Device MoE Inference
DraftExpert 是一种面向端侧 MoE 推理的自推测解码框架,通过训练轻量级驻留专家,结合置信度扩展截断和目标专家预取,在专家卸载场景下加速推理,同时保证最终 token 由目标模型精确验证。
发展脉络
- 首次出现DraftExpert: Expansion-Aware Self-Speculative Decoding for End-Device MoE InferencearXiv cs.AI
- 当前判断该研究针对端侧 MoE 推理的延迟关键场景,表明 MoE 模型在端侧部署时,专家卸载带来的内存带宽瓶颈正成为研究热点。DraftExpert 通过自推测解码优化,可能推动端侧 AI 推理效率提升,但尚处于研究阶段,距离产品化仍有距离。Agent Pulse · 分析
DraftExpert 提出了一种面向端侧 MoE 推理的扩展感知自推测解码框架。在 MoE 模型中,每个 token 仅激活少量专家,但路由专家权重常超出加速器内存,因此需要按需从 CPU 或 Flash 加载。自推测解码在此场景下遇到新瓶颈:增加草稿专家集可提升准确率但增加加载开销,而小足迹草稿接受率低;多 token 验证会激活目标专家的并集,不再接近单步。DraftExpert 通过自蒸馏冻结目标 MoE 的残差、logit/token 和路由器一致信号,为每层训练一个轻量级驻留草稿专家。推理时使用固定足迹的共享+top-1+草稿专家草稿器,结合置信度扩展截断和目标专家预取,最终 token 仍由目标模型精确验证。
DraftExpert 的核心创新在于扩展感知的草稿策略:通过训练驻留草稿专家,在固定内存足迹下提高草稿接受率,同时利用置信度截断控制草稿长度,避免过度加载专家。目标专家预取进一步隐藏了加载延迟。这为端侧 MoE 推理提供了一种新的优化方向,但论文未提供具体加速比或内存节省数据,需关注后续实验细节。
该研究针对端侧 MoE 推理的延迟关键场景,表明 MoE 模型在端侧部署时,专家卸载带来的内存带宽瓶颈正成为研究热点。DraftExpert 通过自推测解码优化,可能推动端侧 AI 推理效率提升,但尚处于研究阶段,距离产品化仍有距离。
对于端侧 AI 推理服务提供商,DraftExpert 可能降低 MoE 模型的部署成本,提升响应速度,从而改善用户体验。但当前仅为研究论文,商业价值尚未验证,需关注后续工程化进展。
后续可关注论文的完整实验数据,包括加速比、内存占用和模型质量对比。若效果显著,可能被集成到端侧推理框架中,但需验证在不同硬件(如移动 NPU)上的泛化性。