Domain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal Case
arXiv 论文《Domain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal Case》研究商用视觉语言模型在阴影去除任务中的表现,发现直接使用可产生干净结果,但会幻觉物体或误读阴影,提出基于物理的候选选择流程。
Development
- First ReportDomain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal CasearXiv cs.AI
- Current Assessment商用视觉语言模型在特定任务上可能接近专用系统,但存在物理错误风险。将领域知识融入 agentic 流程可能成为提升可靠性的通用模式,影响视觉编辑工具的设计。Agent Pulse · analysis
该论文探讨商用视觉语言模型是否减少对经典物理信息低层视觉的需求,以阴影去除为例。研究发现直接使用商用生成编辑器可产生保留纹理的干净编辑,但存在幻觉物体、误读阴影等失败模式。作者提出 agentic 候选选择流程:生成器生成引导探针,评估器筛选失败,重试并采样多个候选,最终平衡阴影去除与场景保留。将流程基于阴影形成物理可提高可靠性。
论文表明,将领域物理知识(如阴影形成)注入 agentic 流程的提示中,可提升生成与评估的可靠性,减少幻觉。这提示领域知识可作为约束条件,引导生成式编辑器的候选选择,而非仅依赖模型先验。
商用视觉语言模型在特定任务上可能接近专用系统,但存在物理错误风险。将领域知识融入 agentic 流程可能成为提升可靠性的通用模式,影响视觉编辑工具的设计。
对视觉编辑工具厂商,该流程可减少人工修正成本,提升自动化编辑的可靠性,可能成为产品差异化点。
后续可验证信号:该候选选择流程是否在更多低层视觉任务(如去反射、去雾)中推广,以及物理提示对生成质量的量化提升。