跳到正文

算法、任务与模态

Knowledge Distillation 最新动态

Knowledge Distillation 研究索引;按可核对的标签归档,不以热度评价质量。

23 条精选近 30 天 22 条共收录 29 条

更新

精选归档 · 第 2 页

9月14日周一第 21–23 条
  1. OpenReview · EEG73

    EvoBrain:面向异构 BCI 任务的 EEG 基础模型持续学习

    基于摘要分析。本文研究 EEG 基础模型如何持续适配异构 BCI 任务,而非为每个任务分别微调,提出动态任务感知的后训练框架 EvoBrain,目标是在统一模型中促进跨任务知识迁移并缓解灾难性遗忘。 核心机制包含两个互补组件:Neuro-Spectral Task Normalization(NSN)通过对齐任务统计量并重新校准频谱响应,适应任务间的分布变化与神经频谱变化;Response-Affinity Distillation(RAD)结合随时间变化的回放机制,保留历史任务知识,并促进频谱兼容任务之间的选择性迁移。摘要未给出统计量定义、频谱校准实现、蒸馏目标或回放调度细节,这些机制的具体实现尚未验证。 相较于任务隔离的微调,本文的研究重点是持续学习中的可塑性—稳定性权衡:模型既要学习新任务,又要维持旧任务表现。作者指出,分别微调的计算与存储成本随下游任务数量线性增长,但摘要没有提供 EvoBrain 的资源开销测量,因此尚不能确认其实际成本收益。 作者报告,在六个不同 BCI 任务及多种基础模型骨干上,EvoBrain 持续优于所比较的当前最先进方法,并有效平衡可塑性与稳定性。摘要未列出任务名称、数据集、被试数量、任务顺序、被试内或跨被试等评估协议、指标及具体数值,故无法量化性能提升或遗忘程度。 复现与判断有效性时,应核对预训练骨干及其数据覆盖、任务序列与数据划分、历史数据回放的访问权限和存储预算,以及各组件消融、旧任务保持与新任务学习的独立指标。实验协议、消融及统计信息尚未验证;代码与模型权重的可获得性也尚未验证。

    阅读价值:值得阅读的具体原因是将 EEG 基础模型的下游适配改写为跨任务持续学习,并以任务统计与频谱适配、蒸馏和回放联合处理新任务学习与历史知识保留;其优势仍需核对任务序列、对照协议及遗忘指标。

9月10日周四
  1. OpenReview · Representation learning74

    VINO:利用 Volume Transformers 重新审视 3D 表征学习

    基于摘要分析。该研究针对 3D 场景自监督表征学习尚未取得与 2D 相当成效的问题,提出 VINO:以 Volume Transformer 替换常用的分层 PTv3 骨干,并重新设计跨视图匹配、掩码内容预测及 2D-to-3D 知识蒸馏,以无标签方式学习 3D 场景语义表征。 机制上,Volume Transformer 被描述为面向 3D 场景的 ViT-like 架构。跨视图匹配采用教师—学生角色分工:教师提供干净、一致的目标,学生学习对更强扰动的不变性。掩码预测则限制学生只能利用可见上下文推断缺失表征,不允许其访问被掩码的几何信息。2D-to-3D 蒸馏不再直接回归依赖视角的图像特征,而改用视角更一致的监督;摘要未说明该监督的具体构造,也未给出损失形式、掩码策略或训练规模。 作者报告,VINO 在室内与室外基准上的稠密线性探测表现显著改善,并能较好迁移到域外设置。摘要未提供数据集名称、划分、对照基线及具体指标,故无法量化提升或比较不同评估协议;实验协议、消融及统计信息尚未验证。 平台推测(待验证):其教师提供稳定目标、学生承受更强扰动,以及仅从可见上下文预测掩码表征的思路,可能用于 EEG 自监督学习中检验噪声鲁棒性与上下文利用能力。但原方法依赖 3D 几何及跨视图对应,不能直接视为 EEG 方法:可考虑复用目标分工与掩码访问约束,骨干、位置编码及扰动需适配 EEG 时间—通道结构,2D-to-3D 蒸馏也缺少直接对应。低信噪比、跨被试差异、通道缺失及小数据可能使教师目标不稳定,过强扰动还可能破坏任务相关信号。一个可证伪的小实验是在固定 EEG 数据划分和训练预算下,仅比较常规教师—学生训练与上述目标分工,并在相同 Cross-subject 协议下评估;已有相关 EEG 工作尚未检索确认。

    阅读价值:值得核对其教师—学生目标分工、掩码几何隔离与跨模态监督设计能否分别改善表征学习;摘要未提供定量结果,各项改动的独立贡献尚未验证。

8月30日周日
  1. OpenReview · EEG75

    DLink:从 EEG 基础模型中蒸馏逐层与主导知识

    基于摘要分析。该研究针对 EEG 基础模型(EFMs)推理开销较大、固定教师表征蒸馏可能未充分利用中间层任务信息的问题,提出 DLink(Distilling Layer-wise and Dominant Knowledge),通过输入条件化层路由与频谱引导蒸馏,将教师知识迁移到紧凑学生模型。 核心机制:路由器针对每个输入聚合教师模型不同层的表征,而非仅采用固定层作为蒸馏目标;随后对齐表征的幅度谱与相位谱,以缓解压缩引起的频谱失真。学生采用 project-then-compress 设计来吸收聚合后的教师知识。教师与路由器仅在训练阶段使用,因此无需作为学生推理时的组件。具体投影与压缩结构、频谱计算方式、对齐损失及其权重尚未验证。 作者报告,经验分析显示轻量模型虽具有竞争力,但表现高度依赖任务;具有任务判别力的信息分布在 EFM 的中间层,而非集中于最终层。这构成了动态层聚合的动机,但其适用范围仍需结合正文中的教师模型、任务与分析方法核对。 作者报告,在六个 EEG 基准上的实验中,DLink 改善了紧凑学生模型的表现,并保持轻量推理;进一步分析支持学习式层聚合与频谱蒸馏。摘要未提供基准名称、任务、被试数量、被试内或跨被试等评估协议、具体指标、对照基线及计算成本,无法据此量化收益或比较不同协议的结果。实验协议、消融及统计信息尚未验证。 复现时需核对教师与学生配置、路由器训练方式、project-then-compress 的实现、频谱对齐所在的表征空间,以及固定层蒸馏和其他压缩方法的对照设置。轻量推理不等于低训练成本,实际部署价值还需由学生参数量、计算量、延迟和性能共同验证;代码与权重可用性尚未验证。

    阅读价值:值得核对其输入条件化教师层聚合与幅度、相位频谱蒸馏能否稳定提升紧凑 EEG 模型,尤其是相对固定层蒸馏的收益及训练成本;摘要尚不足以验证具体效果。