From Chains to Trees: Parent-Conditioned Drafting for Semi-Autoregressive Speculative Decoding
PCTree 将 DSpark 的线性草稿转换为树状结构,利用预训练的马尔可夫头为每个父节点评分备选子节点,并在固定验证预算内分配最可能路径。在 Qwen3-{4B,8B,14B} 和九个基准上,B=7 时相对 DSpark 的加速增益为 3.1% 至 29.5%。在 Qwen3-4B GSM8K 上,B=16 时平均接受长度从 9.41 提升至 11.16。
Development
- First ReportFrom Chains to Trees: Parent-Conditioned Drafting for Semi-Autoregressive Speculative DecodingarXiv cs.CL
- Current Assessment投机解码是当前 LLM 推理优化的重要方向,PCTree 展示了在不增加模型规模或训练成本的情况下,通过改进解码算法即可获得显著加速。这表明推理优化仍有较大空间,且算法创新可以成为提升模型效率的关键杠杆。Agent Pulse · analysis
投机解码通过草稿-验证机制加速 LLM 推理,但半自回归草稿器如 DSpark 以单链方式解码块,早期不匹配会浪费后续草稿。PCTree 利用 DSpark 已学习的条件结构,在不重训练或增加骨干网络前向的前提下,将线性草稿转换为树状结构。它使用预训练的马尔可夫头为每个具体父节点评分备选子节点,并将固定验证预算分配给最可能路径,从而在保持单次并行骨干网络的同时提升草稿多样性。实验在 Qwen3-{4B,8B,14B} 和九个基准上进行,B=7 时相对 DSpark 的加速增益为 3.1% 至 29.5%。在 Qwen3-4B GSM8K 上,B=16 时平均接受长度从 9.41 提升至 11.16,三次运行的平均加速比也有提升。
PCTree 的核心在于将草稿生成从链式改为树状,利用条件概率分解来并行探索多个延续路径。这避免了链式解码中早期错误导致后续草稿全部失效的问题,提高了草稿的接受率。其关键创新是无需额外训练,仅通过预训练的马尔可夫头进行父条件评分,并分配验证预算,从而在计算开销几乎不变的情况下提升推理速度。
投机解码是当前 LLM 推理优化的重要方向,PCTree 展示了在不增加模型规模或训练成本的情况下,通过改进解码算法即可获得显著加速。这表明推理优化仍有较大空间,且算法创新可以成为提升模型效率的关键杠杆。
PCTree 能提升 LLM 推理速度,降低单位查询成本,对提供 LLM 服务的公司具有直接商业价值。更快的推理意味着更低的延迟和更高的吞吐量,可改善用户体验并降低运营成本。
PCTree 的树状草稿方法可能进一步扩展到更大模型和更多基准,并与其他推理优化技术结合。未来可验证其在更长序列、更大批量下的表现,以及是否能在不同模型架构上通用。