遗忘的几何:持续学习中的表征通量
Geometry of Forgetting: Representation Flux in Continual Learning
基于摘要分析。本文研究持续学习中灾难性遗忘对应的潜在表征变化,提出 representation flux(表征通量)来衡量训练过程中样本级表征的位移,并据此设计表征空间正则化方法 FlowLess-R,以稳定旧样本表征,同时允许模型继续学习新任务。 核心机制:作者报告,representation flux 在多个持续学习基准上与灾难性遗忘高度相关;时间分析提供了较高通量可能先于后续性能退化的证据。较大表征位移还与更明显的置信度下降相关,表征转变的其他几何性质能够补充样本级遗忘信息。这些结果支持将通量作为遗忘的几何标志,但不能仅凭摘要将其解释为遗忘的因果机制或已验证的预警器。 FlowLess-R 将回放样本当前表征约束到已存储的参考表征,在既有回放训练目标中加入表征匹配项。其依赖旧样本回放与参考表征存储,而非只约束模型参数。作者称该方法不依赖特定架构;具体表征层、位移定义、损失形式、参考表征更新方式及额外存储开销尚未验证。 作者报告,在 SplitMNIST、SplitFashionMNIST、SplitCIFAR10 和 SplitTinyImageNet 上,将 FlowLess-R 与 ER、DER++、ER-ACE 结合,可提高最终平均 Accuracy 并减少灾难性遗忘。摘要未提供数值、任务划分、回放预算或统计结果,不能判断增益规模;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若将跨会话 EEG 学习组织为顺序任务,其旧样本表征漂移可能对应既有解码能力退化,可尝试复用通量监测与表征匹配项,并改造 EEG 编码器、回放策略和参考表征更新机制。该假设依赖可保存旧样本及其参考表征;低信噪比、被试与通道变化可能使位移主要反映噪声或合理的域适应,过强约束则可能抑制新会话学习,小数据下关联估计也可能不稳定。一个可检验的小实验是在固定跨会话顺序、回放预算和编码器下,对比 ER 与 ER 加 FlowLess-R,分别检查旧会话 Accuracy、新会话学习效果,以及通量能否先于旧会话性能下降。已有 EEG 相关工作尚未检索确认。
值得核对 representation flux 对遗忘的预警价值及 FlowLess-R 相对既有回放方法的增益,但摘要中的关联证据尚不能确立因果关系或 EEG 持续学习效果。
来源:OpenReview · Representation learning · openreview.net