跳到正文
OpenReview · Representation learning· Michael Lawson; Emerald Sy; Kehui Zhang; Raymond H. Chan; Kannie W. Y. Chan; Rosa H. M. Chan·· 2026-05-23精选AI 评分72

互信息引导的特征扰动:改善表格数据的自监督表征学习

Mutual Information-Guided Corruption for Improved Self-Supervised Representation Learning in Tabular Data

AI 导读

基于摘要分析。研究针对表格数据中特征分布异质、特征间依赖复杂,而随机特征扰动往往忽略这些统计结构的问题,提出互信息引导的自监督表征学习框架。其核心贡献是根据统计关系构建特征组,并结合条件变分自编码器生成更符合数据结构的样本,以指导预训练数据增强。 机制上,该方法将特征依赖关系用于增强策略,而不是仅随机扰动特征。摘要未交代互信息的估计方式、特征分组规则、条件生成的条件变量,以及自监督目标与损失形式;生成样本如何保留依赖结构、避免不合理组合,仍需正文核对。 作者报告,在使用 UK Biobank 数据预训练后进行的斑块预测、6 个开源医学数据集及 66 个 OpenML-CC18 基准任务中,该框架具有更好的标签效率,即达到可比性能所需的标注样本更少。摘要未提供具体指标、标注预算、数据划分、对照方法或改善幅度,实验协议、消融及统计信息尚未验证。这些结果属于表格数据任务,不能据此认定具有 BCI 有效性。 平台推测(待验证):若 EEG 已被转换为通道、频段等组成的表格特征,依赖感知的分组增强可能对应少标签条件下随机扰动破坏特征关系的瓶颈。可考虑复用特征分组与条件生成思路,但需适配 EEG 特征结构,并仅用训练数据估计依赖。低信噪比、小样本导致的互信息估计不稳定,以及跨被试或通道变化造成的依赖漂移,可能使增强失效。一个可检验的小实验是在固定跨被试划分和标注预算下,对比随机扰动与互信息引导扰动,保持编码器及训练预算一致,检验标签效率是否改善。相关 EEG 工作尚未检索确认。

阅读价值

值得核对互信息引导的特征分组与条件生成是否能比随机特征扰动更有效地保留表格数据依赖结构;作者报告了标签效率收益,但其对 EEG 特征学习的价值尚未验证。

来源:OpenReview · Representation learning · openreview.net