表征何时对齐:表征学习动力学中的普适性
When Representations Align: Universality in Representation Learning Dynamics
基于摘要分析。本文研究不同深度神经网络为何会学到具有显著定性相似性的表征,并提出表征学习动力学的有效理论,尝试刻画复杂、大型且足够灵活的架构中不强烈受参数化约束的共同学习行为。 核心假设是:从输入到隐藏表征的编码映射,以及从表征到输出的解码映射,均可视为任意平滑函数。该理论以这些映射为研究对象,而非将结论限定在某一种具体架构上;其适用前提是隐藏表征具有较大的可变自由度。摘要未给出具体动力学方程、损失函数及理论推导条件,尚不能判断这种抽象在何种训练设置下成立。 作者报告,在涉及不同激活函数与架构的多种深度网络实验中,该有效理论能够描述表征学习动力学的部分特征,并呈现类似“rich”和“lazy”学习机制的现象。作者同时指出,许多网络行为在定量上仍依赖架构,因此这里的普适性指模型足够灵活后某些行为的广泛保留,而非所有网络表征或性能均相同。数据集、模型规模、优化设置、表征相似性的度量、实验协议、消融及统计信息尚未验证。 平台推测(待验证):可迁移到 EEG 研究的假设是,不同 EEG 解码器之间可能存在可由统一动力学描述的表征变化,而非直接获得性能提升。可复用的是编码—表征—解码的分析视角;需针对 EEG 的通道结构、时序特征和任务监督重新定义映射与表征比较方式。低信噪比、小样本、跨被试差异及通道变化可能使表征受架构约束更强,从而偏离理论适用条件。一个可证伪的小实验是在固定 EEG 任务、同一被试内划分和训练设置下,比较不同架构训练过程中的表征变化,检验理论预期的共同定性行为是否出现;具体检验量须先依据全文确定。已有 EEG 相关工作尚未检索确认,原领域结果不构成 BCI 有效性的证据。
值得阅读其以平滑编码与解码映射刻画表征学习动力学的有效理论,重点核对模型足够灵活时哪些行为可跨架构保留,以及这些结论的适用边界。
来源:OpenReview · Representation learning · openreview.net