AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 29, 2026 · RL^2-VLA

RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models

What Happened

RL^2-VLA 论文提出一种自适应推理时转向框架,利用 VLA 潜在空间上的强化学习。它训练一个轻量级离线 RL 策略,条件于从 VLA 动作专家提取的表达性潜在变量,并在推理时将其流速度与冻结的 VLA 组合。该方法旨在结合大规模模仿学习的行为先验和离线 RL 带来的动作多样性,以解决 VLA 模型在挑战性和分布外任务上性能下降的问题。论文还发现推理时转向在成功和失败情况下遵循根本不同的缩放定律。

EVENT STORY

Development

  1. First ReportRL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action ModelsarXiv cs.RO
  2. Industry ResponseRL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action ModelsarXiv cs.RO
  3. Current Assessment该研究反映了 VLA 模型在机器人领域的一个趋势:通过推理时计算而非大规模重训练来提升模型性能。这类似于 LLM 领域的测试时缩放,可能推动机器人模型向更高效、更灵活的方向发展。同时,组合式转向方法可能促进基础模型与专用策略的协同,降低领域适应成本。Agent Pulse · analysis
What Changed

RL^2-VLA 论文针对 VLA 模型在困难任务上性能下降的问题,提出自适应推理时转向框架。现有测试时转向和缩放方法虽无需大量数据收集和重训练,但动作样本常集中于相似行为,继承相关失败模式,且对所有时间步应用相同干预策略。RL^2 通过训练轻量级离线 RL 策略,利用 VLA 动作专家提取的表达性潜在变量,在推理时组合其流速度与冻结的 VLA,实现组合式转向。该方法结合模仿学习的行为先验和离线 RL 的动作多样性,并发现推理时转向在成功和失败情况下遵循不同缩放定律。

How the Capability Boundary Shifted

RL^2 的核心创新在于将离线 RL 策略应用于 VLA 潜在空间,并通过流速度组合实现推理时转向。这暗示 VLA 模型的潜在表示可能包含可操纵的行为结构,且轻量级 RL 策略能有效利用这些结构。论文发现的缩放定律差异表明,推理时转向的收益可能依赖于任务难度和基础策略的成功概率,这为设计自适应干预策略提供了理论依据。

Why It Matters

该研究反映了 VLA 模型在机器人领域的一个趋势:通过推理时计算而非大规模重训练来提升模型性能。这类似于 LLM 领域的测试时缩放,可能推动机器人模型向更高效、更灵活的方向发展。同时,组合式转向方法可能促进基础模型与专用策略的协同,降低领域适应成本。

Who It Affects

RL^2 可能降低 VLA 模型在特定任务上的部署成本,因为无需大量数据收集和重训练即可提升性能。对于机器人公司,这意味着更快的任务适配和更低的定制化成本。同时,组合式转向可能催生新的工具链或服务,帮助开发者利用基础模型和轻量级 RL 策略构建专用机器人行为。

What to Watch Next

后续可验证的信号包括:RL^2 在真实机器人任务上的基准测试结果,与其他测试时缩放方法的对比,以及其缩放定律在不同 VLA 架构上的普适性。若该方法被广泛采用,可能推动推理时自适应策略成为 VLA 部署的标准组件。