跳到正文
OpenReview · Representation learning· Michael Lawson; Emerald Sy; Kehui Zhang; Raymond H. Chan; Kannie W. Y. Chan; Rosa H. M. Chan·· 2026-05-26精选AI 评分73

互信息引导的扰动:改进表格数据的自监督表征学习

Mutual Information-Guided Corruption for Improved Self-Supervised Representation Learning in Tabular Data

AI 导读

基于摘要分析。本文研究异质特征分布与复杂特征依赖下的表格数据自监督表征学习,提出利用互信息发现特征关系,并据此引导预训练扰动与数据增强的框架。其主要研究对象是通用及医学表格数据,而非 EEG 或 BCI。 机制上,作者指出随机特征扰动通常忽略表格数据的统计结构,因此依据统计关系构建特征组,并引入条件变分自编码器生成更符合数据关系的样本。可核对的创新点是将特征依赖用于增强设计,而不只是随机破坏特征。互信息估计方式、分组规则、生成器条件变量、预训练目标及下游推理流程尚未验证。 作者报告,在使用 UK Biobank 数据预训练的斑块预测实验、6 个开源医学数据集及 69 个 OpenML-CC18 基准任务上,该方法具有更好的标签效率,即用更少标注样本达到可比性能。摘要未提供具体指标、标注预算、比较基线或数据划分,因而不能量化提升,也不能判断各任务收益是否一致;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 下游任务采用每试次的频带、通道或时频统计特征表,可假设互信息分组有助于减少随机扰动对关联特征结构的破坏,从而改善小样本学习。可复用的是依赖估计、特征分组和条件生成增强,需改造的是 EEG 特征表示、跨被试归一化及生成样本的生理合理性约束;该框架不能直接视为原始 EEG 时序模型。低信噪比、小数据和被试差异可能使互信息估计不稳定,通道变化也可能破坏分组,生成器还可能保留与任务无关的被试特征。 一个可检验的小实验是:在固定跨被试划分与标注预算下,仅用训练被试拟合分组和生成器,对比随机扰动与互信息引导增强,保持编码器及下游训练设置一致,检查任务指标与多次重复的稳定性。以上为迁移假设,不是本文已验证结果;已有 EEG 相关工作尚未检索确认。复现仍需全文中的数据处理、训练配置与实现说明。

阅读价值

值得阅读其以互信息驱动特征分组、结合条件变分自编码器生成预训练增强样本的机制;作者报告标签效率改善,但具体收益与迁移至 EEG 特征表的有效性尚未验证。

来源:OpenReview · Representation learning · openreview.net