TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs
TreeProbe 是首个围绕藏医原生 Tree of Medicine 框架构建的文化偏见基准,包含 4,719 个专家裁决条目,覆盖 467 种疾病和 10 个子任务。对代表性 LLM 的实验显示,当前模型在藏医语境下能力有限,并表现出系统性外部本体漂移。
发展脉络
- 首次出现TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMsarXiv cs.CL
- 当前判断该基准凸显了 LLM 在低资源医疗知识上的不足,可能推动更多针对传统医学的评估和微调工作。对医疗 AI 行业而言,文化偏见是实际部署中的风险,TreeProbe 提供了量化工具,可能影响模型选择和合规要求。Agent Pulse · 分析
TreeProbe 是首个围绕藏医原生 Tree of Medicine 框架构建的文化偏见基准,包含 4,719 个专家裁决条目,覆盖 467 种疾病和 10 个子任务。对代表性 LLM 的实验显示,当前模型在藏医语境下能力有限,并表现出系统性外部本体漂移。进一步分析表明,模型在漂移方向(生物医学或中医推理)上存在分歧,这受预训练数据影响。该基准旨在量化 LLM 在传统医学中的文化偏见,弥补现有评估工具的缺失。
TreeProbe 的构建围绕藏医的 Tree of Medicine 框架,包含 4,719 个专家裁决条目,覆盖 467 种疾病和 10 个子任务。实验发现模型存在系统性外部本体漂移,且漂移方向因模型而异,受预训练数据影响。这提示评估文化偏见需要结构化基准,并可能启发针对传统医学的领域适应方法。
该基准凸显了 LLM 在低资源医疗知识上的不足,可能推动更多针对传统医学的评估和微调工作。对医疗 AI 行业而言,文化偏见是实际部署中的风险,TreeProbe 提供了量化工具,可能影响模型选择和合规要求。
对于医疗 AI 公司,TreeProbe 可用于评估模型在传统医学场景中的适用性,降低文化偏见带来的风险。它也可能成为产品差异化的卖点,或用于满足监管对文化敏感性的要求。
未来可能看到更多基于 TreeProbe 的模型改进,以及类似基准扩展到其他传统医学体系。可验证的下一信号是:是否有模型在 TreeProbe 上显著提升,或该基准被用于模型发布时的评估。