跳到正文
OpenReview · Representation learning· Nikos Giakoumoglou; Tania Stathaki·· 2026-08-18精选AI 评分76

判别性与一致性表征蒸馏

Discriminative and Consistent Representation Distillation

AI 导读

基于摘要分析。本文研究如何将大型教师模型的表征知识高效迁移到较小的学生模型,提出 Discriminative and Consistent Representation Distillation(DCD),针对对比蒸馏依赖外部负样本记忆库、固定温度难以适应训练阶段及教师—学生组合的问题,将对比实例判别与跨模型相似度矩阵的一致性正则化结合。 机制上,对比项对齐学生表征与对应的教师表征;一致性项惩罚跨模型相似度矩阵按行归一化和按列归一化视图之间的不对称性,约束仅靠实例判别未充分限定的非对角结构。作者称,该正则项恰在该矩阵对称时为零。DCD 同时采用批内采样以取消外部记忆库,并引入可学习的尺度与偏置,随训练调整蒸馏信号的锐度和偏移;具体损失表达式、采样细节及参数化方式尚未验证。 作者报告,在 CIFAR-100、ImageNet、MS-COCO 上开展分类与目标检测实验,并评估向 STL-10 和 Tiny ImageNet 的 Cross-dataset 迁移,取得有竞争力的表现。作者还报告,该方法仅增加 66K 参数,训练速度与标准 KD 相当,且相较已有对比蒸馏方法显著降低内存消耗和训练时间。摘要未提供具体性能数值、教师—学生架构、硬件及计时条件;实验协议、消融及统计信息尚未验证,不能据此判定各任务上的优势幅度。 平台推测(待验证):其表征对齐机制可用于探索 EEG 大型教师向轻量学生的蒸馏,但依赖成对的教师—学生输入及足够可靠的批内相似度结构。可复用对齐与一致性目标,需改造 EEG 编码器、表征接口和批次构造;低信噪比、跨被试差异、通道不一致及小数据可能使实例间关系不稳定。一个可检验的小实验是在固定 Cross-subject 划分、教师与学生及训练预算下,对比标准 KD、仅对比项和完整 DCD,同时记录相同任务指标、显存与训练时间,检验一致性项是否带来可重复增益。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 DCD 对跨模型相似度矩阵非对角结构的约束及其批内采样机制,作者报告的效率优势为表征蒸馏提供了具体复现切入点,但 EEG/BCI 适用性尚未验证。

来源:OpenReview · Representation learning · openreview.net