DLink:从 EEG 基础模型中蒸馏逐层与主导知识
基于摘要分析。该研究针对 EEG 基础模型(EFMs)推理开销较大、固定教师表征蒸馏可能未充分利用中间层任务信息的问题,提出 DLink(Distilling Layer-wise and Dominant Knowledge),通过输入条件化层路由与频谱引导蒸馏,将教师知识迁移到紧凑学生模型。 核心机制:路由器针对每个输入聚合教师模型不同层的表征,而非仅采用固定层作为蒸馏目标;随后对齐表征的幅度谱与相位谱,以缓解压缩引起的频谱失真。学生采用 project-then-compress 设计来吸收聚合后的教师知识。教师与路由器仅在训练阶段使用,因此无需作为学生推理时的组件。具体投影与压缩结构、频谱计算方式、对齐损失及其权重尚未验证。 作者报告,经验分析显示轻量模型虽具有竞争力,但表现高度依赖任务;具有任务判别力的信息分布在 EFM 的中间层,而非集中于最终层。这构成了动态层聚合的动机,但其适用范围仍需结合正文中的教师模型、任务与分析方法核对。 作者报告,在六个 EEG 基准上的实验中,DLink 改善了紧凑学生模型的表现,并保持轻量推理;进一步分析支持学习式层聚合与频谱蒸馏。摘要未提供基准名称、任务、被试数量、被试内或跨被试等评估协议、具体指标、对照基线及计算成本,无法据此量化收益或比较不同协议的结果。实验协议、消融及统计信息尚未验证。 复现时需核对教师与学生配置、路由器训练方式、project-then-compress 的实现、频谱对齐所在的表征空间,以及固定层蒸馏和其他压缩方法的对照设置。轻量推理不等于低训练成本,实际部署价值还需由学生参数量、计算量、延迟和性能共同验证;代码与权重可用性尚未验证。
阅读价值:值得核对其输入条件化教师层聚合与幅度、相位频谱蒸馏能否稳定提升紧凑 EEG 模型,尤其是相对固定层蒸馏的收益及训练成本;摘要尚不足以验证具体效果。