Stochastic Autoregressive Learning
arXiv 论文 2608.07224v1 提出随机自回归学习(Stochastic Autoregressive Learning)的 PAC 学习模型,推广了 Joshi 等人 COLT 2025 的确定性框架。模型为每个提示字符串分配伯努利下一个词元分布,从输入提示开始采样并追加词元,重复 M 步。研究三种监督形式:单步样本、思维链(CoT)样本(完整轨迹)和端到端(e2e)样本(仅最终词元)。分析在平方损失误差下学习一步概率和最终词元概率所需的最小样本数,并表明随机自回归学习与确定性理论有根本差异。
Development
- First ReportStochastic Autoregressive LearningarXiv cs.LG
- Current Assessment该研究属于理论机器学习,短期内对工业界影响有限,但可能为 LLM 的采样策略和训练目标提供理论依据。长期看,理解随机自回归学习的样本复杂度有助于优化数据效率和推理成本。Agent Pulse · analysis
该论文引入随机自回归学习的 PAC 学习模型,将确定性自回归学习推广到随机设置。模型由一个固定生成器为每个提示字符串分配伯努利分布,通过迭代采样生成序列。研究三种监督形式:基础单步样本、CoT 样本(完整轨迹)和 e2e 样本(仅最终词元),并分析学习一步概率和最终词元概率所需的样本复杂度。结果表明随机自回归学习与确定性理论有根本差异,为理解 LLM 的采样生成过程提供了理论框架。
该工作为随机自回归生成提供了 PAC 学习保证,区分了不同监督形式下的样本复杂度。CoT 样本可能提供更多信息,但 e2e 样本更符合实际推理场景。理论结果可能指导训练数据收集和模型评估,但需注意理论假设与真实 LLM 的差距。
该研究属于理论机器学习,短期内对工业界影响有限,但可能为 LLM 的采样策略和训练目标提供理论依据。长期看,理解随机自回归学习的样本复杂度有助于优化数据效率和推理成本。
该研究为理论贡献,暂无直接商业价值,但可能间接影响 LLM 训练和推理效率,从而降低长期成本。
后续可关注该理论在真实 LLM 上的验证,以及是否催生新的训练或采样算法。若理论能转化为实践,可能影响数据采集和模型设计。