AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月6日 · In-Context VLA

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

发生了什么

论文《In-Context VLA》提出,自由形式的文本思维链会降低视觉-语言-动作(VLA)模型的低层控制性能,因为推理与动作令牌优化目标冲突。该框架通过上下文后训练(仅监督动作)和代理工具使用接口(查询开放词汇检测器、单目深度和视觉语言模型)赋予 VLA 语言能力。

EVENT STORY

发展脉络

  1. 首次出现In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool UsearXiv cs.RO
  2. 当前判断该研究可能推动机器人操作模型从端到端生成转向模块化工具使用,影响相关产品设计。但需注意,论文尚未提供完整实验数据,实际效果有待验证。Agent Pulse · 分析
改变了什么

该论文指出,VLA 模型通常通过行为克隆训练,但自由形式的文本思维链会降低低层控制性能,因为推理与动作令牌优化目标冲突。作者提出 In-Context VLA 框架,通过上下文后训练(注入感知证据作为结构化上下文,仅监督动作)和代理工具使用接口(查询开放词汇检测器、单目深度和视觉语言模型)赋予 VLA 语言能力。

能力边界怎么变了

该工作表明,VLA 模型不应生成语言,而应消费接地语言。通过上下文后训练和工具使用,模型可以主动获取感知信息,同时避免推理与动作的优化冲突。这提示架构设计上,将语言能力外置为工具调用可能比端到端生成更有效。

为什么重要

该研究可能推动机器人操作模型从端到端生成转向模块化工具使用,影响相关产品设计。但需注意,论文尚未提供完整实验数据,实际效果有待验证。

对谁有影响

对于机器人公司,该框架可能降低 VLA 模型的训练成本并提升控制性能,但商业化落地仍需验证。

接下来观察

后续可关注该框架在真实机器人上的部署效果,以及是否出现类似方法的开源实现或商业产品。