Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution
arXiv 论文 2608.03483v1 提出 Bernoulli-Continuation Policy (BCP),一种用于自适应执行视界的轻量级即插即用框架,保持基础 VLA 模型冻结。BCP 将执行视界选择分解为一系列继续或重新规划的决策,并使用轨迹级结果的强化学习进行训练,引入重新规划效率奖励,同时奖励任务成功和高效的 VLA 使用。在 RoboTwin 2.0 上以 LingBot-VLA 作为基线进行了评估。
发展脉络
- 首次出现Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon ExecutionarXiv cs.RO
- 当前判断该工作反映了机器人操作领域对自适应执行策略的关注,旨在提升 VLA 模型在真实任务中的鲁棒性和效率。BCP 的轻量级特性可能促进其在现有 VLA 系统中的应用,推动更智能的机器人控制。Agent Pulse · 分析
该论文针对基于块的视觉-语言-动作(VLA)模型在固定执行视界后重新规划的局限性,提出 Bernoulli-Continuation Policy (BCP)。现有方法将重新规划视为与任务进度无关的周期性调度,导致关键操作阶段可能基于过时的块执行。BCP 通过一个延续头将执行视界选择分解为一系列继续或重新规划的决策,对候选视界施加序数、前缀共享的归纳偏置。由于每个块的最优视界不可观测,BCP 使用轨迹级结果的强化学习训练该头,并引入重新规划效率奖励,联合奖励任务成功和高效的 VLA 使用,防止策略崩溃到不必要短的视界。实验在 RoboTwin 2.0 上以 LingBot-VLA 作为基线进行。
BCP 的核心创新在于将执行视界选择建模为序数、前缀共享的决策序列,而非独立类别的分类问题,这利用了候选视界之间的顺序关系。通过强化学习从轨迹级结果训练,避免了逐块最优视界不可观测的问题。重新规划效率奖励平衡了任务成功与计算效率,防止策略过度频繁重新规划。这种即插即用设计保持基础 VLA 冻结,降低了适配成本。
该工作反映了机器人操作领域对自适应执行策略的关注,旨在提升 VLA 模型在真实任务中的鲁棒性和效率。BCP 的轻量级特性可能促进其在现有 VLA 系统中的应用,推动更智能的机器人控制。
BCP 可能降低 VLA 模型在机器人应用中的重新规划成本,提升任务成功率,对机器人自动化解决方案提供商具有潜在价值。
后续可验证的信号包括:BCP 在更多 VLA 基线和真实机器人平台上的验证,以及其与动态环境感知结合的可能性。