AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 31, 2026 · HAM-VLN

HAM-VLN: Harnessing Hierarchical Agentic Memory for Zero-Shot Vision-and-Language Navigation

What Happened

HAM-VLN 是一种用于零样本视觉语言导航(VLN)的训练无关方法,通过决策耦合的智能体自建记忆,在每次动作选择时记录语义和反思信息,并利用深度感知的世界图。近期航点保留在有限窗口内,旧历史通过相关性、新近性和显著性检索进入上下文。该方法无需额外 LLM 调用,将上下文长度减少超过 65%,并在 VLN-CE 上达到 61.0% 的成功率(SR)。

EVENT STORY

Development

  1. First ReportHAM-VLN: Harnessing Hierarchical Agentic Memory for Zero-Shot Vision-and-Language NavigationarXiv cs.RO
  2. Current AssessmentHAM-VLN 展示了训练无关方法在具身智能任务中的潜力,通过智能体自建记忆减少对大规模训练数据的依赖。其上下文压缩技术可能对依赖长上下文的多模态 LLM 应用产生启示,尤其是在资源受限的机器人场景中。该方法的成功可能推动更多研究关注记忆机制与决策过程的耦合设计。Agent Pulse · analysis
What Changed

HAM-VLN 提出了一种层次化智能体记忆机制,用于零样本视觉语言导航。该方法在每次动作选择时,通过多模态 LLM 同时记录语义和反思信息,构建深度感知的世界图。近期航点以逐字形式保留在有限窗口内,而较旧的历史通过基于相关性、新近性和显著性的检索,以及一跳拓扑扩展重新进入上下文。这种设计避免了额外的 LLM 调用,相比先前方法,在导航指标上有所提升,并将上下文长度减少了超过 65%。在 VLN-CE 基准上,HAM-VLN 实现了 61.0% 的成功率(SR)。

How the Capability Boundary Shifted

HAM-VLN 的核心创新在于将记忆写入与动作决策耦合,在同一个模型调用中完成,从而避免了额外的 LLM 调用。其记忆层次包括逐字保留的近期航点窗口和通过检索进入上下文的旧历史,检索评分结合了相关性、新近性和显著性,并辅以一跳拓扑扩展。这种设计有效缓解了长程导航中上下文长度增长带来的推理瓶颈,上下文长度减少超过 65% 表明其记忆压缩效率显著。

Why It Matters

HAM-VLN 展示了训练无关方法在具身智能任务中的潜力,通过智能体自建记忆减少对大规模训练数据的依赖。其上下文压缩技术可能对依赖长上下文的多模态 LLM 应用产生启示,尤其是在资源受限的机器人场景中。该方法的成功可能推动更多研究关注记忆机制与决策过程的耦合设计。

Who It Affects

对于机器人导航和具身智能公司,HAM-VLN 提供了一种无需额外训练即可提升导航性能并降低计算成本的方案,可能降低部署门槛。其上下文压缩技术也有助于降低多模态 LLM 的推理成本,对相关产品具有潜在商业价值。

What to Watch Next

后续可验证的信号包括:HAM-VLN 在真实机器人平台上的部署效果,以及其记忆机制是否被其他 VLN 或具身智能方法采用。此外,上下文长度减少 65% 的具体实现细节和在不同环境下的泛化能力值得关注。