AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 7, 2026 · TEMPO

TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models

What Happened

TEMPO 是一种用于视觉-语言-动作(VLA)模型的语义-动作解耦、双时间尺度强化学习(RL)后训练框架。它冻结预训练的视觉-语言骨干网络,仅对语义投影层和低层动作专家进行优化,并以不同频率更新:语义投影层低频更新以保持潜在动作稳定,动作专家高频更新以快速整合在线交互反馈。实验在 CALVIN 基准和真实世界操作任务上进行了验证。

EVENT STORY

Development

  1. First ReportTEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action ModelsarXiv cs.RO
  2. Current AssessmentTEMPO 反映了 VLA 模型后训练中从统一微调向组件化、解耦优化的趋势。这种精细化控制可能提高机器人操作任务的样本效率和最终性能,对具身智能领域有潜在影响。可验证的下一信号是:是否有更多研究采用类似解耦策略,或 TEMPO 是否被集成到主流机器人学习框架中。Agent Pulse · analysis
What Changed

TEMPO 提出了一种针对视觉-语言-动作(VLA)模型的新型强化学习后训练框架。现有方法如监督微调(SFT)容易产生分布不匹配,而在线 RL 方法通常对所有组件采用统一更新策略,忽略了它们不同的功能角色。TEMPO 通过冻结预训练的视觉-语言骨干网络来保留通用语义表示,仅对语义投影层和低层动作专家进行优化,并采用双时间尺度更新:语义投影层低频更新以保持潜在动作稳定,动作专家高频更新以快速整合在线交互反馈。这种解耦策略防止了快速策略更新破坏高层语义表示,同时允许动作专家高效学习。实验在 CALVIN 基准和真实世界操作任务上展示了其有效性。

How the Capability Boundary Shifted

TEMPO 的核心创新在于将 VLA 模型的 RL 后训练分解为两个独立的时间尺度,分别对应语义投影层和动作专家。这种设计基于对模型组件功能角色的区分:语义投影层负责将视觉-语言表示映射到动作空间,需要稳定性;动作专家负责生成具体动作,需要快速适应。通过冻结骨干网络,TEMPO 避免了灾难性遗忘,同时通过低频更新语义投影层和高频更新动作专家,实现了稳定性和适应性的平衡。可验证的下一信号是:在更多基准(如 LIBERO)或更长任务上的表现,以及不同骨干网络(如不同规模的 VLM)下的泛化能力。

Why It Matters

TEMPO 反映了 VLA 模型后训练中从统一微调向组件化、解耦优化的趋势。这种精细化控制可能提高机器人操作任务的样本效率和最终性能,对具身智能领域有潜在影响。可验证的下一信号是:是否有更多研究采用类似解耦策略,或 TEMPO 是否被集成到主流机器人学习框架中。

Who It Affects

TEMPO 可能降低 VLA 模型在机器人任务中的部署成本,通过更高效的 RL 后训练减少对大量真实交互数据的需求,从而加速机器人产品化。可验证的下一信号是:是否有机器人公司采用 TEMPO 或其衍生方法,以及是否在商业场景中展示性能提升。

What to Watch Next

TEMPO 可能推动 VLA 模型后训练向更精细的组件级优化发展,未来可能出现针对不同组件(如感知、规划、控制)的专用 RL 策略。可验证的下一信号是:TEMPO 在更大规模真实世界任务上的部署,以及与其他后训练方法(如 SFT 或统一 RL)的对比结果。