跳到正文
OpenReview · Representation learning· Sungyeop Lee; Junghyo Jo·· 2021-01-01精选AI 评分73

机器学习的尺度不变表征

Scale-invariant representation of machine learning

AI 导读

基于摘要分析。该研究关注机器学习内部表征的统计结构,尝试解释为何监督学习中的内部编码与无监督学习中的聚类标签,其出现频率会呈现幂律分布。核心贡献是推导这种尺度不变分布自然产生的过程,并从信息论角度解释它与学习准确率约束下数据分组不确定性的关系。 作者报告,在所考察的监督与无监督学习模型中观察到内部编码或标签频率的幂律现象。作者据此解释,机器学习会较大程度地压缩频繁出现的典型数据,同时将许多非典型数据区分为离群项;尺度不变表征则对应于在保证给定学习准确率的可行表征中,具有最大不确定性的数据分组。这里讨论的是表征频率的统计规律与理论解释,摘要未明确提出新的网络架构或训练算法。 需核对的关键问题包括:内部编码如何定义和统计、幂律拟合的范围与检验方式、理论推导所需假设,以及“给定学习准确率”如何约束可行的数据分组。具体模型、数据集、样本规模、实验协议、消融及统计信息尚未验证,不能据摘要判断该规律在不同任务中的普适程度。 平台推测(待验证):可将这一统计视角用于检验 EEG 表征是否过度合并常见模式、同时将稀有有效模式与噪声混为离群项,但这不是已证实的 EEG/BCI 效果。假设其迁移成立,需先明确连续 EEG 表征的离散编码规则,并控制被试、通道和样本量对频率分布的影响;低信噪比及跨被试差异可能使幂律反映噪声或采样结构,而非任务相关表征。一个小规模检验是固定 EEG 编码器和离散化规则,在相同数据划分下比较真实任务标签与打乱标签条件的编码频率分布及分类 Accuracy,检查该统计规律是否具有任务区分力。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其对内部编码频率幂律与信息论数据分组之间关系的推导,但该解释的适用条件及其对 EEG 表征的意义尚未验证。

来源:OpenReview · Representation learning · openreview.net