Stress-Testing EEG Foundation Models for Clinical Decoding: Dataset Identity and Targeted Negative Controls
arXiv 论文 2607.24519v1 对六个预训练 EEG 基础模型(LaBraM、EEGMamba、CBraMod、REVE、BENDR、BIOT)在五个临床任务、四个数据集上进行了基准测试,使用冻结线性探针和多种数据划分。在韩国痴呆症任务(CAUEEG,三分类)上,冻结 REVE 的 AUROC 为 0.568,而经典特征为 0.769;在患者不相交的保留集上顺序一致(0.565 对 0.768)。数据集身份可从冻结嵌入中轻易解码(PCA-50 下 AUROC 1.000;频带限制和逐 epoch z-score 后为 0.9998),而同一 PCA-50 流程解码韩国诊断的 AUROC 为 0.528。随机初始化的编码器在此任务上优于预训练 REVE(0.659 对 0.570)。在阿尔茨海默病上,高斯随机投影和 PCA 表现相似。
发展脉络
- 首次出现Stress-Testing EEG Foundation Models for Clinical Decoding: Dataset Identity and Targeted Negative ControlsarXiv cs.AI
- 当前判断EEG 基础模型的临床转化面临重大障碍:当前预训练表示可能无法泛化到新人群,且评估方法容易高估模型能力。这可能导致基于这些模型的临床决策支持系统在真实世界中表现不佳。行业需要建立标准化的评估基准,包括跨数据集验证和负对照测试,以确保模型真正学习到临床相关特征。Agent Pulse · 分析
这篇论文对六个预训练 EEG 基础模型在临床解码任务上的迁移能力和鲁棒性进行了压力测试。作者在四个数据集上评估了五个临床任务,使用冻结线性探针和严格的划分(留一受试者、受试者分组、记录级划分)。关键发现是,在韩国痴呆症任务上,经典特征(0.769 AUROC)显著优于冻结的 REVE 嵌入(0.568),且这一顺序在患者不相交的保留集上保持一致。更引人注目的是,数据集身份可以从冻结嵌入中几乎完美解码(AUROC 1.000),而诊断信息几乎无法解码(0.528),表明模型主要编码了数据集特定的伪影。随机初始化的编码器甚至优于预训练 REVE(0.659 对 0.570),质疑了预训练表示的有效性。在阿尔茨海默病任务上,随机投影与 PCA 表现相似,进一步表明嵌入中缺乏任务相关信息。这些结果对 EEG 基础模型在临床场景中的可靠性提出了严重质疑。
冻结线性探针评估显示,预训练 EEG 基础模型(如 REVE)在临床任务上的表现可能主要归因于数据集伪影而非语义特征。数据集身份可被近乎完美解码(AUROC 1.000),而诊断信息几乎不可解码(0.528),表明模型嵌入中编码了非任务相关的数据集特定模式。随机初始化编码器优于预训练模型(0.659 对 0.570)进一步支持这一观点。这提示在评估此类模型时,必须使用严格的受试者分组划分和负对照(如标签置换、随机特征)来排除伪影影响。
EEG 基础模型的临床转化面临重大障碍:当前预训练表示可能无法泛化到新人群,且评估方法容易高估模型能力。这可能导致基于这些模型的临床决策支持系统在真实世界中表现不佳。行业需要建立标准化的评估基准,包括跨数据集验证和负对照测试,以确保模型真正学习到临床相关特征。
对于开发 EEG 基础模型的公司,此研究提示其产品在临床场景中的可靠性存疑,可能影响市场信任和监管审批。企业应投资于更严格的评估和模型改进,以避免在临床应用中失败。对于医疗 AI 采购方,此研究提供了评估供应商模型的关键标准。
未来研究应关注改进预训练策略,以减少数据集特定伪影的编码,并开发更鲁棒的评估协议。可验证的下一信号包括:是否出现使用更大规模、更多样化数据训练的 EEG 基础模型,并在独立临床数据集上通过负对照测试。