跳到正文

算法、任务与模态

Masked Modeling 最新动态

Masked Modeling 研究索引;按可核对的标签归档,不以热度评价质量。

22 条精选近 30 天 10 条共收录 24 条

更新

精选归档 · 第 2 页

1月16日周二第 21–22 条
  1. OpenReview · Representation learning74

    基于细粒度交互的蛋白质–配体结合表征学习

    基于摘要分析。该研究针对蛋白质–配体结合预测中监督数据有限、模型泛化受限的问题,提出以细粒度交互为核心的自监督表征学习方法。不同于分别预训练蛋白质和配体的思路,作者将预训练表述为:给定结合口袋与配体,预测最终结合复合物结构。 机制上,方法采用基于 Transformer 的交互模块,并设置原子对距离图预测与配体掩码重建两项预训练任务,分别从结构空间和特征空间建模结合交互。摘要未说明距离图的具体覆盖范围、掩码策略、损失形式及任务组合方式,这些实现细节尚未验证。 作者报告,该方法在蛋白质–配体亲和力预测、虚拟筛选和蛋白质–配体对接等任务中表现优于对照方法,但摘要未提供数据集、数据划分、基线名称、指标或数值,因而无法判断优势幅度及泛化边界。实验协议、消融及统计信息尚未验证;复现还需核对预训练数据来源、复合物结构处理、下游训练设置,以及代码和模型权重的可用性。 平台推测(待验证):可借鉴的是“显式关系预测与掩码重建联合预训练”的机制,而非直接移植分子结合模型。其原始任务依赖结合口袋、配体及原子级结构关系;EEG 中可假设用通道间关系预测辅助掩码信号重建,以应对标注有限时的表征学习问题。可复用交互建模和双任务框架,但需改造输入编码与关系目标,不能将原子距离直接等同于 EEG 功能连接。低信噪比、参考方式、跨被试差异和通道配置变化均可能使关系目标不稳定,小数据下也可能学到伪迹。一个可证伪的小实验是:在固定 Cross-subject 划分和相同预训练数据条件下,对比仅掩码重建与加入关系预测的模型,检验下游性能及通道扰动稳定性是否改善。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以原子对距离预测和配体掩码重建联合学习细粒度交互的自监督机制,但摘要中的多任务优势仍需结合完整实验协议核对,向 EEG 的迁移尚未验证。

10月28日周六
  1. OpenReview · Representation learning73

    自监督跨表表征学习的规模扩展实验

    基于摘要分析。该研究关注深度表格表征学习的规模扩展潜力,提出面向单表与跨表学习的 Transformer 架构,并通过自监督掩码单元格恢复进行预训练,考察模型规模与预训练设置对表征质量的影响。 核心机制是使用表特定 tokenizer 处理不同表格,并共享 Transformer 主干;训练以缺失值插补为任务,通过恢复被掩码的单元格学习表征。摘要未说明 tokenizer 如何编码列类型、表结构与单元格,也未给出掩码策略或具体损失形式。 作者报告,规模实验覆盖约 10^4 至 10^7 参数的模型,预训练数据由 76 个不同数据集组成,共包含 135 M 个训练 token。评估分别考察单表与跨表预训练设置,在整理的基准数据集上使用线性探测,并与常规基线比较。摘要未列出基准名称、划分方式、基线名称或性能指标,因此尚不能判断规模收益、跨表迁移效果及其统计可靠性;实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可迁移假设是,将 EEG 的结构化试次特征视为表格,用数据集特定 tokenizer 接入共享主干,以应对不同特征布局下的表征复用问题。可复用部分是共享主干与掩码恢复目标;需改造特征编码、通道与频带对应关系,并明确跨被试、跨会话的划分。原方法依赖表格单元格结构与较大规模预训练数据,不能直接等同于原始 EEG 时序建模;低信噪比、通道差异及小数据可能使恢复目标偏向噪声或数据集特征。可检验的小实验是在固定 Cross-subject 划分及相同训练预算下,对比单数据集与跨数据集预训练后的冻结表征线性探测,且预训练排除测试被试。相关 EEG 工作尚未检索确认。

    阅读价值:该研究以表特定 tokenizer 与共享 Transformer 主干探索跨表自监督预训练及规模效应,值得核对其线性探测对照和跨表泛化协议,但摘要未提供性能结果。