EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning
EvoHIL 是一个用于人机交互强化学习(HIL-RL)的统一框架,通过自进化奖励(SER)、动作流稳定(AFS)和保留感知的离线微调,在 Franka FR3 和 SO-101 机械臂的六个操作任务中,在受控光照变化下提升了任务成功率。
Development
- First ReportEvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement LearningarXiv cs.RO
- Current Assessment该研究针对机器人操作中 HIL-RL 的部署瓶颈,通过统一框架提升鲁棒性,可能推动机器人学习从实验室走向实际应用。其强调在光照变化下的适应性,暗示了视觉域迁移在机器人学习中的重要性。可验证的下一信号是:该框架是否被其他团队复现,或在真实工业场景中部署。Agent Pulse · analysis
EvoHIL 论文提出了一种统一框架,用于解决人机交互强化学习(HIL-RL)在接触丰富的操作任务中的三个耦合限制:静态视觉奖励模型在场景变化下失效、独立采样动作导致时间不一致、视觉策略对外观变化敏感。框架包含三个组件:自进化奖励(SER)通过人类确认的正样本和临时弱负样本自适应成功分类器;动作流稳定(AFS)通过流匹配生成时间连贯的动作块,将策略更新锚定在执行的动作前缀和演示行为上;保留感知的离线微调重放重新光照的交互数据,同时将 AFS actor-critic 锚定到先前行为,无需额外机器人交互即可适应视觉域。在 Franka FR3 和 SO-101 机械臂的六个操作任务中,在受控光照变化下,EvoHIL 提高了任务成功率以及与人类确认的一致性。
EvoHIL 的核心创新在于将奖励模型、动作生成器和视觉域的自适应统一到一个分阶段的人机交互学习流程中。SER 利用人类反馈动态更新奖励模型,AFS 通过流匹配生成时间连贯的动作块,保留感知的离线微调则在不增加交互的情况下适应视觉变化。这暗示了 HIL-RL 中奖励模型和策略的联合自适应可能比单独优化更有效。可验证的下一信号是:在更多任务和更复杂光照变化下的成功率提升幅度,以及 AFS 生成动作的时间连贯性指标。
该研究针对机器人操作中 HIL-RL 的部署瓶颈,通过统一框架提升鲁棒性,可能推动机器人学习从实验室走向实际应用。其强调在光照变化下的适应性,暗示了视觉域迁移在机器人学习中的重要性。可验证的下一信号是:该框架是否被其他团队复现,或在真实工业场景中部署。
对于机器人公司,EvoHIL 可能降低部署成本,通过减少人工交互和适应环境变化提升任务成功率,从而加速机器人操作在工业、物流等场景的落地。可验证的下一信号是:是否有公司采用该框架进行产品化。
EvoHIL 可能成为 HIL-RL 的基线方法,后续工作可能扩展其到更复杂的任务和动态环境,或与其他学习范式结合。可验证的下一信号是:论文的代码是否开源,以及后续引用和扩展工作。