Interpretable Adaptive Sampling for LLM Test-Time Scaling
arXiv 论文 2608.03961v1 提出一种可解释的自适应采样方法,用轻量模糊控制器将提示复杂度与模型置信度等信号映射为每查询采样预算,为简单或高置信提示分配较少样本,为困难或低置信提示分配较多样本,使推理期计算可检查。在匹配解码设置与受控答案选择的对齐协议下,与 best-of-N、计算感知缩放、自置信基线在问答与数学推理任务上比较,自适应模糊控制在多个模型与数据集上优于若干标准基线,并在减少平均样本数的同时接近选择器匹配的全预算对照。
Development
- First ReportInterpretable Adaptive Sampling for LLM Test-Time ScalingarXiv cs.AI
- Current Assessment测试时扩展正从固定预算转向自适应分配,可解释性成为推理期计算的新关注点。该方法表明,通过轻量控制器即可实现接近全预算的性能并减少计算,可能影响推理成本模型。可验证的下一信号是:是否有推理服务商或框架将自适应采样纳入默认配置,以及模糊控制规则是否被更复杂的可学习策略替代。Agent Pulse · analysis
arXiv 论文 2608.03961v1 提出可解释的自适应采样方法,针对测试时扩展中固定每查询预算的缺陷:固定预算在简单与困难提示上花费相同计算,且难以检查为何某提示获得特定样本数。方法用轻量模糊控制器将提示复杂度与模型置信度等可解释信号映射为每查询采样预算,简单或高置信提示分配较少样本,困难或低置信提示分配较多样本,使推理期计算可检查而非固定或不透明。在匹配解码设置与受控答案选择的对齐协议下,与 best-of-N、计算感知缩放、自置信基线在问答与数学推理任务上比较,自适应模糊控制在多个模型与数据集上优于若干标准基线,并在减少平均样本数的同时接近选择器匹配的全预算对照。
该方法将测试时扩展的预算分配从固定或黑盒转为可解释的模糊控制,输入信号为提示复杂度与模型置信度,输出为每查询采样数。模糊控制器天然可检查,规则可读,这为推理期计算分配提供了可审计性。与 best-of-N 等基线相比,在减少平均样本数的同时保持接近全预算对照的性能,说明自适应分配在计算效率与质量间取得平衡。可验证的下一信号是:该方法在更长推理链或更大模型上的扩展性,以及模糊规则在不同任务族上的迁移性。
测试时扩展正从固定预算转向自适应分配,可解释性成为推理期计算的新关注点。该方法表明,通过轻量控制器即可实现接近全预算的性能并减少计算,可能影响推理成本模型。可验证的下一信号是:是否有推理服务商或框架将自适应采样纳入默认配置,以及模糊控制规则是否被更复杂的可学习策略替代。
对推理服务提供商,该方法可在保持质量的同时降低平均采样数,直接减少推理成本。对依赖测试时扩展的应用,可解释的预算分配有助于成本预测与优化。可验证的下一信号是:是否有云服务商或推理平台采用类似自适应采样并公开成本对比。
自适应采样可能成为测试时扩展的标准组件,尤其在计算成本敏感的生产环境中。可解释的预算分配规则可能被用于审计与调试,未来或与更细粒度的信号(如分步置信度)结合。可验证的下一信号是:该方法是否在更多任务与模型上复现,以及是否出现基于类似原则的工业实现。