Large language models improve physician accuracy but lead to false reliance
研究团队开发了 agentic retrieval-augmented LLM 系统 CORA,在 46 名医生的研究中,医生使用 CORA 后准确率从 70.8% 提升至 82.6%。支持性引用与正确答案相关(87.7% vs 65.5%),但引用也导致医生对错误答案的抵制率从 92% 降至 34.8%。
Development
- First ReportLarge language models improve physician accuracy but lead to false reliancearXiv cs.AI
- Current Assessment该研究揭示 LLM 辅助决策的双刃剑效应:引用能提升正确建议采纳,但也削弱对错误建议的防御。这对医疗 AI 等高风险领域的产品设计提出挑战,需在界面中显式标注不确定性或提供对抗性验证,而非仅依赖引用增强信任。Agent Pulse · analysis
该研究开发了 CORA,一个 agentic retrieval-augmented LLM,用于提供带来源链接的临床支持。在 46 名医生的研究中,CORA 将诊断准确率从 70.8% 提升至 82.6%,且在训练数据截止后的病例上增益更大。支持性引用与正确性相关(87.7% vs 65.5%),但引用也造成不对称影响:正确建议的采纳率从 34% 升至 76.9%,而错误答案在引用支持下,医生抵制率从 92% 降至 34.8%。这表明来源链接的 LLM 辅助能提升准确性,但引入依赖引用的安全风险。
CORA 作为 agentic retrieval-augmented 系统,在保持基准性能的同时,对训练数据截止后的病例增益更大,表明检索增强能泛化到新知识。引用与正确性相关,但引用也显著降低医生对错误答案的抵制,说明模型输出的表面可信度(如引用)可能掩盖底层错误,需要设计机制区分引用质量与答案正确性。
该研究揭示 LLM 辅助决策的双刃剑效应:引用能提升正确建议采纳,但也削弱对错误建议的防御。这对医疗 AI 等高风险领域的产品设计提出挑战,需在界面中显式标注不确定性或提供对抗性验证,而非仅依赖引用增强信任。
对医疗 AI 产品,该研究强调引用机制需谨慎设计,避免过度信任。企业应投资于引用验证和错误检测功能,以降低安全风险并提升临床采纳率,同时为监管合规做准备。
未来可验证的信号包括:CORA 是否在更大规模临床研究中复现类似准确率提升;是否出现针对引用质量评估的标准化方法;以及监管机构是否要求对 LLM 辅助决策的引用可靠性进行审计。