AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 30, 2026 · meTS

On-Policy and Off-Policy Learning for Large Action Spaces

What Happened

arXiv 论文 2607.28408v1 研究大规模动作空间中的策略学习,提出 meTS(混合效应 Thompson 采样)和 dTS(扩散先验 Thompson 采样)用于在线学习,以及 sDM(结构化直接方法)用于离线学习,并指出优化误差在大动作空间中可能主导估计误差。

EVENT STORY

Development

  1. First ReportOn-Policy and Off-Policy Learning for Large Action SpacesarXiv cs.AI
  2. Current Assessment该研究为大规模推荐、广告排序等场景提供了更高效的在线学习算法,可能降低探索成本。离线学习部分强调优化误差的重要性,对工业界使用批量数据进行策略优化具有指导意义。Agent Pulse · analysis
What Changed

该论文研究交互系统中大规模动作空间的策略学习,涵盖在线(on-policy)和离线(off-policy)两种范式。在线学习中,提出 meTS 和 dTS 两种结构化贝叶斯方法,通过共享动作间信息提高样本效率,并给出基于有效动作数的遗憾界。离线学习中,提出基于潜变量的结构化直接方法 sDM,并证明在大动作空间中优化误差可能主导估计误差,同时引入凹且高效的优化目标。论文还讨论了探索效率、数据覆盖、重要性权重方差、外推偏差和优化景观等挑战。

How the Capability Boundary Shifted

论文的核心贡献在于将结构化先验引入 Thompson 采样和直接方法,以应对大规模动作空间的稀疏反馈。meTS 通过混合效应建模动作间的相关性,dTS 利用扩散启发的先验,两者均能共享信息,遗憾界依赖于有效动作数而非全部动作数。离线部分指出优化误差在大动作空间中可能超过估计误差,提示算法设计需关注优化可行性。

Why It Matters

该研究为大规模推荐、广告排序等场景提供了更高效的在线学习算法,可能降低探索成本。离线学习部分强调优化误差的重要性,对工业界使用批量数据进行策略优化具有指导意义。

Who It Affects

对于拥有大规模动作空间(如商品推荐、广告投放)的企业,这些方法可能提升策略学习效率,降低试错成本,从而改善用户参与度和收入。

What to Watch Next

后续可关注这些方法在真实推荐系统或对话系统中的应用验证,以及能否扩展到更复杂的序列决策问题。