跳到正文
OpenReview · EEG· Neehar Haldar; Pranavi Tadivalasa·· 5 天前精选AI 评分78

从置信度到解释:评估 EEG 基础模型在分布偏移下的可靠性

From Confidence to Explanations: Evaluating Reliability of EEG Foundation Models Across Distribution Shifts

AI 导读

基于摘要分析。本研究关注 EEG 基础模型在分布偏移下能否可靠识别自身的错误预测,而不只是保持下游预测性能。作者以 LaBraM 和 CBraMod 的五分类睡眠分期为研究对象,比较四类错误预测信号,揭示预测能力迁移与可靠性信号迁移需要分别验证。 评估以 Sleep-EDF Expanded 为源域,在 ISRUC-Sleep-II、ISRUC-Sleep-III 和 UCDDB 上开展零样本外部评估。四类信号分别为校准置信度、时间一致性、表征熟悉度和解释漂移。错误检测器在源域验证数据上训练,随后保持不变,在留出的源域测试集及外部队列上评估;这一设置直接检验源域学习到的错误识别规则能否迁移,而非在目标队列重新拟合。 作者报告,置信度对错误检测构成较强基线:在源域测试集上,LaBraM 和 CBraMod 的错误检测 AUROC 分别为 0.7411 和 0.7551,并在外部队列中仍具有信息价值。这些数值衡量错误检测能力,不是睡眠分期 Accuracy。作者报告,加入时间一致性后,两模型在源域的 AUROC 分别增加 0.0296 和 0.0299,且增益具有统计显著性,但该优势在任何外部队列上均未达到显著。表征熟悉度在分布偏移下表现不一致:在若干 ISRUC 队列评估中出现显著负贡献,而对 UCDDB 上的 CBraMod 出现显著正贡献。事后解释漂移未在上述较简单信号之外提供有统计支持的改进。 核心启示是:错误预测信号本身也依赖数据分布,源域中有效的辅助指标在外部队列上可能失去增益,甚至改变贡献方向;这不等于基础模型的睡眠分期性能必然失效。摘要未给出外部队列的具体预测成绩、信号计算方式、置信度校准方法、错误检测器结构、被试划分及统计检验细节,实验协议、消融及统计信息尚未验证。复现时应重点核对上述细节,并分别报告分期性能与错误检测 AUROC,避免把两类迁移能力混为一谈。

阅读价值

值得阅读的具体原因是该研究将睡眠分期的预测迁移与错误检测信号的迁移分开评估,作者报告源域有效的辅助信号在外部队列中未必保持增益,为核查 EEG 基础模型的可靠性评估提供了可复现的问题与对照。

来源:OpenReview · EEG · openreview.net