On-Policy and Off-Policy Learning for Large Action Spaces
arXiv 论文 2607.28408v1 研究大规模动作空间中的策略学习,提出 meTS(混合效应 Thompson 采样)和 dTS(扩散先验 Thompson 采样)用于在线学习,以及 sDM(结构化直接方法)用于离线学习,并指出优化误差在大动作空间中可能主导估计误差。
发展脉络
- 首次出现On-Policy and Off-Policy Learning for Large Action SpacesarXiv cs.AI
- 当前判断该研究为大规模推荐、广告排序等场景提供了更高效的在线学习算法,可能降低探索成本。离线学习部分强调优化误差的重要性,对工业界使用批量数据进行策略优化具有指导意义。Agent Pulse · 分析
该论文研究交互系统中大规模动作空间的策略学习,涵盖在线(on-policy)和离线(off-policy)两种范式。在线学习中,提出 meTS 和 dTS 两种结构化贝叶斯方法,通过共享动作间信息提高样本效率,并给出基于有效动作数的遗憾界。离线学习中,提出基于潜变量的结构化直接方法 sDM,并证明在大动作空间中优化误差可能主导估计误差,同时引入凹且高效的优化目标。论文还讨论了探索效率、数据覆盖、重要性权重方差、外推偏差和优化景观等挑战。
论文的核心贡献在于将结构化先验引入 Thompson 采样和直接方法,以应对大规模动作空间的稀疏反馈。meTS 通过混合效应建模动作间的相关性,dTS 利用扩散启发的先验,两者均能共享信息,遗憾界依赖于有效动作数而非全部动作数。离线部分指出优化误差在大动作空间中可能超过估计误差,提示算法设计需关注优化可行性。
该研究为大规模推荐、广告排序等场景提供了更高效的在线学习算法,可能降低探索成本。离线学习部分强调优化误差的重要性,对工业界使用批量数据进行策略优化具有指导意义。
对于拥有大规模动作空间(如商品推荐、广告投放)的企业,这些方法可能提升策略学习效率,降低试错成本,从而改善用户参与度和收入。
后续可关注这些方法在真实推荐系统或对话系统中的应用验证,以及能否扩展到更复杂的序列决策问题。