GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience
GROVE 是一个无需训练的框架,从连续视频流中因果地构建分层记忆,保留细粒度感知证据,并整合为带时间戳的时刻、连贯的情节和跨日模式。每个层级配有对应的检索技能,支持反应式问答和主动辅助。在 MM-lifelong 和 EgoServe 等基准上取得最佳结果。
Development
- First ReportGROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video ExperiencearXiv cs.AI
- Current AssessmentGROVE 展示了可穿戴助手在视觉记忆上的进展,但当前仍处于研究阶段,距离实际产品化尚有距离。其无需训练的特性可能加速在边缘设备上的应用,但需关注长期记忆的存储和检索效率。Agent Pulse · analysis
GROVE 是一个无需训练的框架,用于从连续视频流中构建分层记忆,支持反应式问答和主动辅助。它保留细粒度感知证据,并增量整合为时间戳时刻、连贯情节和跨日模式,每个层级配有对应的检索技能。在 MM-lifelong 和 EgoServe 等基准上取得最佳结果,消融实验显示各层级和技能互补,模式提供最大收益。
GROVE 的核心创新在于将记忆分层为时刻、情节和模式,并为每层设计原生检索技能,使同一记忆支持查询驱动的回忆和情境驱动的主动辅助。这种无需训练的设计可能降低部署成本,但模式层对长期规律的依赖可能限制其在短期场景的适用性。
GROVE 展示了可穿戴助手在视觉记忆上的进展,但当前仍处于研究阶段,距离实际产品化尚有距离。其无需训练的特性可能加速在边缘设备上的应用,但需关注长期记忆的存储和检索效率。
GROVE 可能为可穿戴设备、智能眼镜等提供更自然的交互体验,但商业化路径尚不明确。其无需训练的特性可能降低集成成本,但需验证在真实场景中的鲁棒性。
未来可关注 GROVE 在真实可穿戴设备上的部署测试,以及其记忆分层方法是否被其他视频理解系统采用。