Hearsay: Vision-Language Medical Diagnoses Without an Image
arXiv 论文 2607.26886v1 报告,在未附加图像的情况下,前沿视觉语言模型(Claude Opus-4.7、GPT-5.4、Gemini-3.1-Pro)不会拒绝回答,而是会编造诊断。改变人口统计学描述会系统性改变返回的诊断。Claude 对 65 岁白人男性的皮肤痣几乎总是返回黑色素瘤,对 32 岁黑人女性的胸片返回结节病,推理为“基于人口统计学和经典模式”。GPT-5.4 在所有测试的人口统计学单元中均产生虚构。存在一种“对冲”模式,文本承认缺少图像,但结构化诊断字段仍命名疾病。
发展脉络
- 首次出现Hearsay: Vision-Language Medical Diagnoses Without an ImagearXiv cs.CL
- 当前判断该研究对医疗 AI 行业构成警示:在真实临床部署中,模型可能因输入缺失或错误而生成看似合理的诊断,且这种错误可能带有系统性人口统计学偏见。这要求医疗 AI 产品必须设计严格的输入验证和缺失数据检测机制,并建立针对无图像输入的拒绝策略。监管机构可能需将此类测试纳入模型评估标准。Agent Pulse · 分析
arXiv 论文 2607.26886v1 报告,在未附加图像的情况下,前沿视觉语言模型(Claude Opus-4.7、GPT-5.4、Gemini-3.1-Pro)不会拒绝回答,而是会编造诊断。改变人口统计学描述会系统性改变返回的诊断。Claude 对 65 岁白人男性的皮肤痣几乎总是返回黑色素瘤,对 32 岁黑人女性的胸片返回结节病,推理为“基于人口统计学和经典模式”。GPT-5.4 在所有测试的人口统计学单元中均产生虚构。存在一种“对冲”模式,文本承认缺少图像,但结构化诊断字段仍命名疾病。
该研究揭示,视觉语言模型在缺少图像输入时,其输出并非随机,而是由人口统计学描述强烈引导,表明模型内部存在基于文本先验的疾病关联。Claude 的集中效应和 GPT-5.4 的广泛虚构表明不同模型对人口统计学线索的敏感度不同。对冲模式表明,模型可以在文本层面承认不确定性,但在结构化输出中仍做出确定性诊断,这提示评估模型可靠性时需同时检查自由文本和结构化字段。
该研究对医疗 AI 行业构成警示:在真实临床部署中,模型可能因输入缺失或错误而生成看似合理的诊断,且这种错误可能带有系统性人口统计学偏见。这要求医疗 AI 产品必须设计严格的输入验证和缺失数据检测机制,并建立针对无图像输入的拒绝策略。监管机构可能需将此类测试纳入模型评估标准。
对于医疗 AI 公司,该研究凸显了产品安全性和公平性的风险,可能影响监管审批和临床采用。投资方应关注模型供应商如何解决此类问题,以及产品是否具备防御性设计。合规团队需评估模型输出是否符合医疗准确性标准。
后续可验证的信号包括:模型供应商是否发布针对缺失输入的对齐更新,或引入显式的“图像缺失”检测机制;医疗 AI 产品是否增加输入完整性检查;以及是否有更多研究量化此类虚构在真实临床工作流中的发生率。