参与者多样性有限是否阻碍了基于 EEG 的机器学习?
Is Limited Participant Diversity Impeding EEG-based Machine Learning?
基于摘要分析。该研究关注 EEG 机器学习中训练样本数量与参与者多样性对泛化和鲁棒性的不同影响,将 EEG 记录切分为短片段的常见流程概念化为多层数据生成过程,并通过大规模实证研究考察模型性能随总体样本量及参与者多样性的变化。 核心思路是区分片段层面的样本增长与参与者层面的数据多样性:切分记录能够增加训练样本数,却不等同于增加独立记录或参与者。作者使用同一框架进一步研究数据增强与自监督学习应对有限数据问题的有效性。摘要未提供多层框架的数学形式、具体模型、数据增强操作或自监督训练目标,相关实现尚未验证。 作者报告,在其所研究的 EEG 机器学习设置中,参与者分布偏移可能严重限制模型性能随数据规模增长的改善。摘要未给出具体任务、数据集、参与者人数、样本规模、指标或对照结果,也未明确被试内或跨被试划分,因此不能量化这种限制,或判断数据增强与自监督学习分别带来何种收益。 该工作的阅读价值在于为 EEG 数据采集与模型评估提供一个可核对的视角:应分别考察增加同一参与者的片段和增加不同参与者的数据,而不只依据总片段数判断数据是否充足。复现时需核对各层级数据的采样方式、训练与测试的参与者关系、参与者分布偏移的定义,以及不同策略比较时的数据预算是否一致。实验协议、消融及统计信息尚未验证;摘要所述 EEG 结论也不能直接视为某项 BCI 任务中的已验证效果。
值得阅读的具体原因是其将 EEG 分段产生的样本数量与参与者多样性分开研究,有助于核对增加片段是否真正改善泛化,而非仅扩大名义训练规模。
来源:OpenReview · EEG · openreview.net