跳到正文

算法、任务与模态

JEPA 最新动态

JEPA 研究索引;按可核对的标签归档,不以热度评价质量。

21 条精选近 30 天 19 条共收录 21 条

更新

精选归档 · 第 2 页

9月27日周五第 21–21 条
  1. OpenReview · Representation learning75

    摆脱自监督图像表征学习中的大数据范式

    基于摘要分析。本文研究图像自监督表征学习能否摆脱对大规模数据和计算资源的依赖,提出 SCOTT(Sparse Convolutional Tokenizer for Transformers)与 MIM-JEPA,旨在使 Vision Transformers(ViTs)在小规模图像数据上从头学习可复用表征,而不依赖海量外部预训练数据。 SCOTT 是一种向 ViTs 注入卷积归纳偏置的 tokenization 架构,并保持与 Masked Image Modeling(MIM,图像掩码建模)任务兼容。MIM-JEPA 将 Joint-Embedding Predictive Architecture 引入 MIM 框架,在潜在表征空间进行预测,以学习更具语义性的特征。摘要未给出具体稀疏操作、掩码策略、预测目标、损失形式及训练细节,相关机制尚需全文核对。 作者在 Oxford Flowers-102、Oxford IIIT Pets-37 和 ImageNet-100 三个小规模、高分辨率、细粒度图像数据集上验证方法。作者报告,经 MIM-JEPA 预训练并冻结的 SCOTT 模型优于完全监督方法,且与依赖大规模预训练、复杂图像增强及更大模型的先进方法具有竞争力。摘要未提供具体指标或数值;冻结后的评估方式、数据划分、对照模型、计算预算、消融及统计信息尚未验证,因此暂不能判断收益分别来自 tokenizer、潜在空间预测还是训练配置。 平台推测(待验证):其可迁移假设是,局部卷积归纳偏置与潜在空间掩码预测可能缓解 EEG 小数据表征学习的部分困难;这不是原论文验证的结论。原方法依赖图像空间结构与自监督训练数据,迁移时可考虑复用掩码预测框架,但须改造 tokenizer、通道布局与时间片段划分。EEG 的低信噪比、跨被试差异、通道变化及有限样本可能使局部特征或预测目标偏向噪声。一个可证伪的小实验是在固定 Cross-subject 划分和相同训练预算下,对比普通 tokenization 与卷积 tokenization,并分别比较潜在表征预测与输入重建的冻结表征效果。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 SCOTT 的卷积归纳偏置与 MIM-JEPA 的潜在表征预测如何支持小数据自监督学习,但摘要中的优势仍需结合冻结表征评估协议、基线及计算预算验证,不能直接视为 EEG 有效性证据。