xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding
xPress 是一种用于扩散草稿模型的轻量级因果精炼器,通过并行精炼恢复扩散草稿中的因果依赖,无需逐 token 循环。在 Qwen3-8B 上,跨七个数学、代码和聊天基准,接受长度提升约 30%。
Development
- First ReportxPress: Parallel Refinement for Diffusion Drafters in Speculative DecodingarXiv cs.AI
- Current Assessment投机解码是加速 LLM 推理的关键技术,xPress 针对扩散草稿模型的因果缺失问题提出改进,可能提升扩散模型在投机解码中的实用性。这暗示扩散模型在推理加速领域的竞争力增强,可能影响未来推理加速方案的选择。可验证的下一信号是:是否有主流推理框架(如 vLLM、TensorRT-LLM)集成 xPress 或类似方法。Agent Pulse · analysis
xPress 论文针对块扩散草稿模型(如 dFlash)在投机解码中的问题提出解决方案。这类模型通过单次前向传播生成整个草稿块,但最终采样步骤使用每个位置的 logit 分布独立采样 token,导致草稿是边际分布的集合而非联合分布,缺乏 token 间的因果依赖。这会使草稿中的 token 单独看可能合理,但联合起来在目标模型的条件验证下概率较低,导致早期拒绝和接受长度受限。xPress 通过轻量级因果精炼器,以并行方式调和整个扩散块,恢复并传播因果依赖,无需逐 token 循环。在 Qwen3-8B 上,跨七个数学、代码和聊天基准,接受长度提升约 30%。
xPress 的核心创新在于用并行精炼替代逐 token 循环来恢复因果依赖,这可能在推理延迟和接受长度之间取得更好平衡。其轻量级设计暗示额外计算开销较小,但具体参数和延迟影响未在摘要中给出。可验证的下一信号是:xPress 是否能在更大模型(如 Qwen3-32B)或更多样化的任务上保持约 30% 的接受长度提升,以及实际端到端推理速度的提升幅度。
投机解码是加速 LLM 推理的关键技术,xPress 针对扩散草稿模型的因果缺失问题提出改进,可能提升扩散模型在投机解码中的实用性。这暗示扩散模型在推理加速领域的竞争力增强,可能影响未来推理加速方案的选择。可验证的下一信号是:是否有主流推理框架(如 vLLM、TensorRT-LLM)集成 xPress 或类似方法。
xPress 通过提升接受长度约 30%,可能降低投机解码中的验证开销,从而降低推理成本。对于提供 LLM 推理服务的公司,这意味着更低的单位 token 成本或更低的延迟,可能转化为成本优势或更好的用户体验。可验证的下一信号是:是否有云服务商或推理平台采用 xPress 并公布性能数据。
xPress 的并行精炼方法可能推广到其他需要恢复序列依赖的生成场景,如多模态生成或长序列生成。未来可能看到更多基于并行精炼的推理优化技术,以及扩散模型在投机解码中的更广泛应用。可验证的下一信号是:xPress 是否被后续工作引用或扩展,以及是否有实际部署案例。