Entity-Faithful Repair of Synthetic Supervision for Zero-Shot Image Captioning
ReCap 是一个即插即用框架,通过检测图像支持的实体来指导标题重写,以修复合成图像-文本对中的实体级错位,并采用自适应动态加权学习策略降低不可靠合成对的权重。
发展脉络
- 首次出现Entity-Faithful Repair of Synthetic Supervision for Zero-Shot Image CaptioningarXiv cs.CL
- 当前判断该工作表明合成数据质量问题的解决正从全局指标转向细粒度实体级对齐,可能推动零样本图像字幕生成领域对数据精炼方法的重新关注。Agent Pulse · 分析
零样本图像字幕生成旨在无需标注图像-文本对即可生成图像描述。近期方法利用文本到图像模型从纯文本语料合成训练数据,但大多关注整体数据质量。ReCap 观察到合成图像-文本错位往往是结构化和细粒度的:配对可能全局合理但包含缺失实体或属性误置,从而降低监督保真度。基于全局相似度的图像重匹配或重生成方法可能提升表面合理性,但无法系统修复实体级错位。为此,ReCap 将合成数据精炼从隐式全局匹配转向显式细粒度重对齐,通过检测图像支持的实体指导标题重写,生成更忠实的合成监督,并引入自适应动态加权学习策略降低不可靠合成对的权重。作为通用框架,ReCap 可集成到现有方法中。
ReCap 的核心在于将合成数据精炼从全局相似度匹配转向显式实体级重对齐,通过检测图像支持的实体来指导标题重写,从而修复缺失实体和属性误置。这种细粒度监督可能比全局重匹配更有效,但依赖实体检测器的准确性。
该工作表明合成数据质量问题的解决正从全局指标转向细粒度实体级对齐,可能推动零样本图像字幕生成领域对数据精炼方法的重新关注。
ReCap 可能降低零样本图像字幕生成对人工标注的依赖,提升合成数据利用效率,对需要大规模图像描述生成的应用(如内容审核、无障碍辅助)具有潜在价值。
后续可验证信号包括 ReCap 在更多基准上的公开评测结果,以及其与不同基础模型的集成效果。