用于持续 EEG 预训练的选择性粗层离散蒸馏
Selective Coarse-Layer Discrete Distillation for Continual EEG Pretraining
基于摘要分析。本文研究离散 tokenizer 型 EEG 预训练模型在异质域数据持续到来时,如何同时应对灾难性遗忘与下游模型所依赖的 token 分配漂移。作者提出 CAP-CL(Coarse Assignment Preservation for Continual Learning),利用残差向量量化的层级结构,仅约束粗层分配,同时允许细层表征适应新数据。 机制上,CAP-CL 在当前数据与回放数据上,以前一阶段 tokenizer 为教师,蒸馏粗层 L0 的离散分配;回放容量按域分别设置上限,细层不受该蒸馏损失约束。该设计将粗粒度索引保持与细粒度表征更新分开,而非要求所有量化层持续保持不变。具体损失形式、量化器配置及各域回放预算尚未验证。 作者报告,在由 21 个 EEG 数据集构成的数据流上,配合使用回放、以硬 token 索引训练的自回归读出模型,CAP-CL 的最终平均 Balanced Accuracy 为 0.421。摘要称,该方法在五个配对随机种子、三个固定阶段顺序及匹配粗层损失权重的比较条件下,均优于所测试的回放与蒸馏对照;各项对照的具体设置与分项结果仍需全文核对。 作者还报告,将教师固定为初始 tokenizer,而非使用前一阶段 tokenizer,会使累计粗层分配翻转指标从 0.876 降至 0.568,但最终准确率降至 0.402。摘要将后一指标称为 accuracy,其是否与前述 Balanced Accuracy 完全一致尚未验证,不宜直接混同。该对照支持作者的解释:更强的长期索引保持本身不足以解释下游性能,逐阶段保持与固定初始锚定具有不同作用。 结论适用范围应限定于摘要所述的持续 EEG 预训练、离散 tokenizer 与可适应的自回归读出设置。数据集名称、任务组成、被试内或跨被试划分、预训练与下游数据隔离方式、翻转指标定义、消融及统计信息尚未验证;复现需进一步核对阶段顺序、教师更新规则、按域回放上限及读出训练协议。
值得核对其粗层 token 分配保持与下游性能之间的对照:作者报告固定初始教师虽减少累计分配翻转,却降低最终性能,提示长期索引稳定性不能单独解释持续 EEG 预训练的效果。
来源:OpenReview · EEG · openreview.net