跳到正文
OpenReview · EEG·· 21 天前精选AI 评分80

NEAR-Bench:EEG-to-Text 解码的预测性能与 EEG 输入依赖性基准评估

NEAR-Bench: Benchmarking Predictive Performance and EEG Input Dependence in EEG-to-Text Decoding

AI 导读

基于摘要分析。NEAR-Bench 针对 EEG-to-Text 研究中数据划分、评估任务不一致,以及文本得分难以反映 EEG 实际贡献的问题,提出同时评估文本预测性能与 EEG 输入依赖性的评估和诊断基准。其主要贡献是统一比较条件,并检验正确配对的 EEG 是否实际影响模型输出。 基准建立在 ZuCo 1.0 和 2.0 上,规范数据划分、候选文本身份及报告规则,并在下游训练中同时留出被试和文本。这种设置要求评估关注对未参与下游训练的被试与文本的泛化,而非仅比较不同研究各自报告的分数;具体划分比例、上游预训练数据及其与评估数据的关系尚未验证。 对序列解码器,NEAR-Bench 固定已训练模型,仅替换 EEG 输入,在同一批观测上比较预测。摘要列出的干预包括将 EEG 数值置零,以及替换为其他真实记录,用以诊断预测对原始配对信号的依赖。基准还将候选文本识别与文本生成分开评估;其中生成任务不提供候选句或参考文本前缀,避免将不同任务条件下的表现混为一谈。 作者报告,在上述评估框架下,部分序列模型的文本预测表现优于独立语言模型参照,但当 EEG 被置零或替换为其他真实记录时,其预测得分与生成行为变化很小。这支持作者关于“更好的文本预测未必伴随更强 EEG 输入依赖”的结论,但摘要未提供具体模型、指标数值、效应大小或统计不确定性,不能据此推广为所有 EEG-to-Text 模型均不利用 EEG。 复现时需核对被试与文本的留出规则、候选集合构造、独立语言模型参照的条件,以及真实 EEG 替换的配对与采样方式。输入干预衡量的是输出对信号变化的敏感性,仍需结合任务指标解释,不能单独证明或否定语义解码能力。实验协议、消融及统计信息尚未验证,代码和基准发布细节也未获确认。

阅读价值

NEAR-Bench 将文本预测表现与正确配对 EEG 的输入贡献分开评估,值得用于核对 EEG-to-Text 模型的性能提升是否伴随更强的信号依赖,但诊断结果不应直接等同于语义解码能力。

来源:OpenReview · EEG · openreview.net