通过表征依赖解读训练动态
READING TRAINING DYNAMICS THROUGH REPRESENTATION DEPENDENCE
基于摘要分析。本文研究神经网络训练过程中不同输入之间的表征关系如何变化,提出 representation dependence(RD,表征依赖),通过聚合不同输入隐层表征之间的依赖关系,为预测和解释训练行为提供损失与梯度范数之外的信息。 机制与对照:RD 的关注对象是跨样本表征关系,而非仅观察单个样本的预测误差或整体梯度大小。作者分析 RD 相对于损失和梯度范数所捕获的信息,以及训练数据变化如何影响其演化。摘要未给出依赖度量的数学定义、表征层选择、样本聚合方式或计算开销;也不能据此认定 RD 被用作优化损失。 结果:作者报告,在 NanoGPT 中,将 RD 特征加入结合损失、梯度范数和表征统计量的基线后,对未来 250 次更新时验证性能恶化的预测,平均绝对误差降低 13.6%。该数字是这一预测任务下的相对误差降低,并非模型任务准确率提升。作者还报告,RD 能追踪 ViT 在损失匹配的标签污染条件下的表征变化,区分 Pythia 指令微调中的故障时间窗口;在 grokking 中,训练样本已被拟合之后出现的延迟泛化伴随 RD 变化。这些观察不等同于 RD 对泛化具有因果作用。 平台推测(待验证):假设 EEG 模型的跨样本表征关系能反映学习状态,RD 可作为训练监测特征,辅助识别损失变化不明显时的表征漂移。可复用的是依赖聚合与时序监测思路,需改造的是 EEG 表征层选择、样本窗口及被试与通道分组;低信噪比、被试差异和小样本可能使 RD 主要响应伪迹或身份特征。一个可检验的小实验是在固定 Cross-subject 划分的 EEG 分类任务中,对照仅用损失、梯度范数和表征统计量的预测器,检验加入 RD 是否改善未来验证性能恶化的预测,且不将验证信息输入训练诊断特征。已有 EEG 相关工作尚未检索确认。 实验协议、消融及统计信息尚未验证;复现还需核对 RD 定义、数据划分、预测目标、故障窗口标注及实现条件。
值得核对 RD 是否提供独立于损失和梯度范数的训练诊断信息:作者报告其改善 NanoGPT 验证性能恶化预测,并在多种训练情境中反映表征变化,但计算成本与跨任务稳健性尚未验证。
来源:OpenReview · Representation learning · openreview.net