自监督跨表表征学习的规模扩展实验
基于摘要分析。该研究关注深度表格表征学习的规模扩展潜力,提出面向单表与跨表学习的 Transformer 架构,并通过自监督掩码单元格恢复进行预训练,考察模型规模与预训练设置对表征质量的影响。 核心机制是使用表特定 tokenizer 处理不同表格,并共享 Transformer 主干;训练以缺失值插补为任务,通过恢复被掩码的单元格学习表征。摘要未说明 tokenizer 如何编码列类型、表结构与单元格,也未给出掩码策略或具体损失形式。 作者报告,规模实验覆盖约 10^4 至 10^7 参数的模型,预训练数据由 76 个不同数据集组成,共包含 135 M 个训练 token。评估分别考察单表与跨表预训练设置,在整理的基准数据集上使用线性探测,并与常规基线比较。摘要未列出基准名称、划分方式、基线名称或性能指标,因此尚不能判断规模收益、跨表迁移效果及其统计可靠性;实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可迁移假设是,将 EEG 的结构化试次特征视为表格,用数据集特定 tokenizer 接入共享主干,以应对不同特征布局下的表征复用问题。可复用部分是共享主干与掩码恢复目标;需改造特征编码、通道与频带对应关系,并明确跨被试、跨会话的划分。原方法依赖表格单元格结构与较大规模预训练数据,不能直接等同于原始 EEG 时序建模;低信噪比、通道差异及小数据可能使恢复目标偏向噪声或数据集特征。可检验的小实验是在固定 Cross-subject 划分及相同训练预算下,对比单数据集与跨数据集预训练后的冻结表征线性探测,且预训练排除测试被试。相关 EEG 工作尚未检索确认。
阅读价值:该研究以表特定 tokenizer 与共享 Transformer 主干探索跨表自监督预训练及规模效应,值得核对其线性探测对照和跨表泛化协议,但摘要未提供性能结果。