AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月4日 · CARE-Bench

CARE-Bench: Benchmarking Patient-Facing LLM Triage

发生了什么

CARE-Bench 是一个面向患者的分诊基准,包含 500 个案例和 1,059 个患者披露前缀,评估 11 个模型在 269 个保留轮次上的四标签当前动作分类。未提示的宏 F1 分数在 31.2 到 50.4 之间,提示后 10/11 个模型提升,宏 F1 在 46.9 到 63.4 之间,但阈值错误仍然存在。当正确动作是询问更多信息时,仅 33.5% 的提示输出保留了该步骤。

EVENT STORY

发展脉络

  1. 首次出现CARE-Bench: Benchmarking Patient-Facing LLM TriagearXiv cs.AI
  2. 当前判断该基准强调了患者面向 LLM 在临床接触前的安全关键性质。低未提示性能和持续阈值错误表明,当前模型可能不适合直接部署在分诊场景中。这为医疗 AI 行业提供了评估标准,并可能推动更严格的监管或认证要求。Agent Pulse · 分析
改变了什么

CARE-Bench 是一个基于来源的基准,用于评估面向患者的分诊 LLM 的顺序动作。它包含 500 个案例和 1,059 个从医疗对话、咨询和后续问题来源重建的患者披露前缀。在 269 个保留轮次上评估了 11 个模型,使用固定的 GPT-5.5 映射器将响应编码为四标签动作空间。未提示的宏 F1 分数在 31.2 到 50.4 之间,提示后 10/11 个模型提升,宏 F1 在 46.9 到 63.4 之间。然而,阈值错误仍然存在:当正确动作是询问更多信息时,仅 33.5% 的提示输出保留了该步骤。作者认为,这些持续错误表明患者面向的分诊不是简单的提示问题,支持显式评估。

能力边界怎么变了

CARE-Bench 将分诊建模为每轮四标签当前动作分类,使用固定映射器进行编码,这为评估顺序医疗决策提供了结构化方法。未提示和提示协议之间的性能差距表明,提示可以改善但无法解决根本的推理缺陷,特别是在需要澄清时。33.5% 的保留率表明模型倾向于过早推荐护理,而不是收集必要信息,这指向了在医疗环境中需要显式训练或架构调整,而非仅依赖提示。

为什么重要

该基准强调了患者面向 LLM 在临床接触前的安全关键性质。低未提示性能和持续阈值错误表明,当前模型可能不适合直接部署在分诊场景中。这为医疗 AI 行业提供了评估标准,并可能推动更严格的监管或认证要求。

对谁有影响

对于医疗 AI 公司,CARE-Bench 提供了一个评估工具,以衡量其模型在分诊任务中的安全性。这可以指导产品开发,避免部署不安全的模型,并可能成为市场差异化因素。

接下来观察

未来工作可能集中在改进模型在需要澄清时的表现,例如通过专门训练或更好的推理机制。CARE-Bench 可能成为标准基准,推动更安全的患者面向 AI 开发。