跳到正文

算法、任务与模态

Self-Supervised 最新动态

Self-Supervised 研究索引;按可核对的标签归档,不以热度评价质量。

40 条精选近 30 天 25 条共收录 48 条

更新

精选归档 · 第 2 页

9月19日周六第 21–40 条
  1. OpenReview · EEG73

    超越 patch 级 EEG 重建:用于 EEG 解码的对比预训练与多尺度卷积 Transformer

    基于摘要分析。研究针对低信噪比及多时间尺度采样点依赖下,原始 EEG 信号分词与掩码重建预训练是否最优的问题,提出结合对比预训练、多尺度采样点级卷积和 Transformer 编码器块的 CoCoT-EEG,并通过消融实验与机制分析考察架构及预训练目标的影响。 核心思路是将对比学习作为 EEG 自监督预训练的替代路径,同时通过多尺度卷积提取采样点级特征。与围绕 patch 进行重建的方案相比,该研究关注跨 patch 边界的特征提取及较长卷积核,以处理不同时间尺度的信号依赖。摘要未提供对比样本构造、数据增强、损失形式、卷积尺度、模型规模及训练流程,这些实现细节尚未验证。 作者报告,CoCoT 在具有异质实验配置的广泛基准解码任务上达到 state-of-the-art 表现;消融与机制分析支持对比预训练、跨 patch 的采样点级特征提取及较长卷积核带来收益。不过,摘要未列出数据集、任务名称、被试数量、被试内或跨被试等划分协议、对照基线及指标数值,因此尚不能判断提升幅度、跨场景稳定性或各设计因素的独立贡献,也不能直接比较不同实验协议下的结果。 复现与评估应优先核对:预训练和下游数据的划分关系,对比学习正负样本与增强策略的定义,以及比较预训练目标时是否控制架构、数据规模和训练预算。对于低信噪比 EEG,还需核对所学表征是否保留任务相关信息,以及跨被试、跨会话和通道配置变化下的表现。具体实验协议、消融及统计信息尚未验证;摘要中的积极结果不应扩大为对所有 EEG 解码场景均有效的结论。

    阅读价值:值得阅读其对预训练目标与架构的分离分析:作者报告对比预训练、跨 patch 的采样点级特征提取及较长卷积核有益于 EEG 解码,但具体收益与适用协议仍需全文核对。

9月18日周五
  1. OpenReview · Representation learning79

    生成驱动的表征学习:无需预设任务的自引导扩散

    该研究考察纯生成训练能否学习可用于语义任务的表征,提出从零端到端联合训练图像编码器与条件扩散模型的框架,不使用标签、对比损失或掩码,基础设置仅采用水平翻转增强。基于摘要分析,未取得论文全文。 编码器输出的潜在向量同时用于控制条件生成和下游语义任务。作者另在编码器输出空间训练扩散模型,以采样潜在表征,并与条件扩散模型串联实现无条件图像生成。摘要强调,条件模型的图像输入与潜在输入使用独立采样的噪声时间步,这是其学习动态的关键;具体噪声注入方式、损失形式与训练流程尚未验证。 作者报告,在 CIFAR-10、CIFAR-100 和 ImageNet-100 上,该系统的无条件生成表现明显优于架构匹配、计算量相同的 DDPM 基线,但摘要未提供指标与数值。作者报告,在仅使用水平翻转增强、编码器纯粹由去噪扩散损失训练的设置下,kNN 分类 Accuracy 可与 SODA 等专门的自监督方法相当。进一步采用与 SimCLR 相同的数据增强配方后,作者报告,生成目标在 CIFAR-10 和 CIFAR-100 涉及的四种探测协议中,有三种优于 SimCLR 的对比目标。数据划分、探测协议细节、消融及统计信息尚未验证,不能据此推断其他任务上的优势。 平台推测(待验证):迁移至 EEG 的假设是,条件生成的去噪监督可能促使编码器提取可复用结构,从而缓解标签稀缺问题;但图像语义表征的结果不等于 BCI 有效。可复用的是编码器与条件扩散联合训练、独立噪声时间步机制;需改造信号编码、噪声建模与增强策略,水平翻转不能直接视为 EEG 的有效增强。低信噪比、跨被试差异、通道不一致和小样本可能使表征偏向伪迹或个体特征。一个可证伪的小实验是在固定 EEG 数据划分与计算预算下,对比独立和共享噪声时间步,并以冻结编码器的跨被试分类检验机制收益;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对与复现的是:作者以生成目标学习语义表征,并设置同架构、同计算量的 DDPM 对照及同数据增强的 SimCLR 对照,可用于检验表征收益是否来自训练目标与噪声机制,而非额外预设任务。

  2. OpenReview · EEG75

    vNeuro:EEG 视觉模型的基础

    基于摘要分析。该研究探讨自然视觉数据上学到的表征能否复用于 EEG,以减少从零预训练大型 EEG 专用模型的需求。vNeuro 通过轻量可训练接口,将多通道 EEG 时频表征转换为保留电极几何关系的视觉 token,适配冻结的视频预训练 V-JEPA 2.1 编码器。 机制上,接口在无标签 EEG 上通过潜在表征预测与分布正则化进行自监督训练,视觉主干始终固定;下游训练只优化适配器和分类头。其核心区别在于复用预训练视觉主干,而非从头学习 EEG 主干。时频变换、token 映射、预测目标和正则化的具体形式,以及接口规模与训练数据量,摘要未提供,尚未验证。 作者报告:采用 ViT-B 主干时,vNeuro 在 TUAB 异常检测上的 Balanced Accuracy 为 81.40%,在 TUEV 事件分类上为 68.35%;采用 ViT-G 时,TUEV 的 Balanced Accuracy 为 68.73%。摘要未说明被试内、跨被试或其他划分协议,因此这些结果不能直接与不同协议下的分数比较。作者称其表现可与使用数万小时 EEG 预训练的基础模型竞争,但具体对照模型、预处理与训练预算的可比性尚需核对。 作者报告消融和表征分析支持 EEG 到视觉 token 的映射及带正则化的自监督适配均对性能有贡献;具体效应幅度、实验协议与统计信息尚未验证。复现重点包括电极布局与通道处理、时频输入构造、V-JEPA 2.1 权重配置、适配训练语料及下游数据划分。平台推测(待验证):固定视觉主干可能减少需要更新的参数,但不能据此认定整体训练成本更低,或已具备跨被试、跨设备泛化能力。

    阅读价值:值得核对其电极几何保持的视觉 token 映射与冻结 V-JEPA 2.1 的自监督适配机制;作者报告其在 TUAB、TUEV 上具有竞争力,但评估划分与计算成本尚需全文验证。

9月17日周四
  1. OpenReview · Representation learning76

    面向无监督域适应的联合对比—对抗表征学习

    基于摘要分析。本文研究无监督域适应如何同时利用有标签源域与无标签目标域中的可迁移结构,提出 Joint Contrastive-Adversarial Representation Learning(JCAR),通过两阶段训练将共同表征学习与下游监督预测分离,并分析其非渐近超额风险。 机制上,第一阶段合并源域与目标域样本,在不使用标签的表征学习中结合对比学习和对抗式域对齐;第二阶段冻结表征,仅以源域标签拟合预测器。摘要未说明对比样本构造、具体损失、网络架构或训练调度,这些实现细节尚未验证。 理论上,作者给出的风险界耦合表征与域判别器的估计误差,同时将下游预测误差分离,并显式纳入神经网络逼近误差。在论文所述假设、共同 Hölder 平滑度 β≥1 且无标签样本足够多的条件下,作者报告下游收敛率为 Õ(m^{-β/(2β+d)}),其中 m 为有标签源域样本数,d 为潜在维度,省略对数因子;环境维度 p 则进入预训练成本。该结论是条件性理论结果,不能直接等同于任意域偏移下的泛化保证。 实验方面,作者报告在 Office-31、Office-Home 和 DomainNet 上获得迁移收益,尤其是在从零学习表征时表现较强。具体迁移方向、数据划分、对照基线、指标数值、消融及统计信息尚未验证,尚不能量化收益或比较不同协议。 平台推测(待验证):其潜在 EEG 迁移路径是假设跨被试或跨会话数据存在共同低维任务结构,以目标域无标签 EEG 辅助学习表征,再冻结表征训练源域预测器。两阶段流程与域判别器思路可能复用,但 EEG 编码器、对比增强及正负样本构造需适配时序和通道结构。低信噪比、通道差异、小数据及任务相关的被试差异可能导致错误对齐。可在固定 Cross-subject 划分下,比较源域监督、仅对比学习与联合对比—对抗学习,确保目标测试标签不参与训练,并观察收益是否随目标域无标签样本量变化。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的具体原因是 JCAR 将联合无标签表征学习与源域监督预测分开,并给出关联表征及域判别器估计误差的风险界,可用于核对无标签数据规模与潜在维度如何影响域适应的样本效率。

9月10日周四
  1. OpenReview · Representation learning74

    VINO:利用 Volume Transformers 重新审视 3D 表征学习

    基于摘要分析。该研究针对 3D 场景自监督表征学习尚未取得与 2D 相当成效的问题,提出 VINO:以 Volume Transformer 替换常用的分层 PTv3 骨干,并重新设计跨视图匹配、掩码内容预测及 2D-to-3D 知识蒸馏,以无标签方式学习 3D 场景语义表征。 机制上,Volume Transformer 被描述为面向 3D 场景的 ViT-like 架构。跨视图匹配采用教师—学生角色分工:教师提供干净、一致的目标,学生学习对更强扰动的不变性。掩码预测则限制学生只能利用可见上下文推断缺失表征,不允许其访问被掩码的几何信息。2D-to-3D 蒸馏不再直接回归依赖视角的图像特征,而改用视角更一致的监督;摘要未说明该监督的具体构造,也未给出损失形式、掩码策略或训练规模。 作者报告,VINO 在室内与室外基准上的稠密线性探测表现显著改善,并能较好迁移到域外设置。摘要未提供数据集名称、划分、对照基线及具体指标,故无法量化提升或比较不同评估协议;实验协议、消融及统计信息尚未验证。 平台推测(待验证):其教师提供稳定目标、学生承受更强扰动,以及仅从可见上下文预测掩码表征的思路,可能用于 EEG 自监督学习中检验噪声鲁棒性与上下文利用能力。但原方法依赖 3D 几何及跨视图对应,不能直接视为 EEG 方法:可考虑复用目标分工与掩码访问约束,骨干、位置编码及扰动需适配 EEG 时间—通道结构,2D-to-3D 蒸馏也缺少直接对应。低信噪比、跨被试差异、通道缺失及小数据可能使教师目标不稳定,过强扰动还可能破坏任务相关信号。一个可证伪的小实验是在固定 EEG 数据划分和训练预算下,仅比较常规教师—学生训练与上述目标分工,并在相同 Cross-subject 协议下评估;已有相关 EEG 工作尚未检索确认。

    阅读价值:值得核对其教师—学生目标分工、掩码几何隔离与跨模态监督设计能否分别改善表征学习;摘要未提供定量结果,各项改动的独立贡献尚未验证。

9月23日周二
  1. OpenReview · Representation learning75

    关系表征学习

    基于摘要分析。该研究提出 Relational Representation Learning(RRL),将表征学习统一描述为关系图估计问题:不再孤立地处理样本,而是通过样本间的成对关系定义学习目标,并由编码器产生的嵌入估计关系图、最小化其与指定目标图的差异。 核心贡献是把自监督、半监督与监督学习目标纳入同一数学框架。作者据此分析自监督学习中的收敛缓慢、性能差异,以及 projector 与 backbone 的准确率差距,并讨论辅助投影头的作用。摘要未给出关系图的具体构造、差异度量、损失形式或训练流程,这些实现细节尚未验证。 作者报告,在其所用实验设置中,提高图内关系的丰富度能够加快收敛并改善下游表现。摘要未提供数据集、划分、对照基线、指标数值或关系丰富度的操作定义,因此目前无法判断改善幅度与适用边界;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 样本之间能够定义可靠的任务相关关系,RRL 或可用于研究跨被试表征中任务信息与个体差异的分离。其迁移依赖可用的成对关系或监督信息,以及足够稳定的图估计;可复用的是目标图与嵌入关系匹配的思路,需改造 EEG 编码器、关系构造及通道对齐方式。低信噪比可能使图主要反映伪迹,被试与通道差异可能主导样本关系,小数据则可能导致关系估计不稳定。一个可证伪的小实验是,在固定 EEG 数据划分、编码器与训练预算下,比较原有预训练目标和 RRL 目标,并逐步改变关系丰富度,观察收敛速度与同一跨被试协议下的下游指标是否同步改善。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其将多类预训练目标统一为关系图估计的形式化框架,并核对关系丰富度如何影响收敛与下游表现;这些结论在 EEG 场景中的适用性尚未验证。

  2. OpenReview · EEG72

    EEG 基础模型:当前进展与未来方向的批判性综述

    基于摘要分析。本文关注自监督 EEG 基础模型(EEG-FMs)能否支持稳健、可扩展的 EEG 特征提取,以及现有证据是否足以判断其真实应用准备程度。作者对十个早期第一代 EEG-FMs 进行批判性综述,围绕原始输入数据表示、自监督表征学习和评估策略三个维度,综合方法趋势、实证发现与待解决问题。 在方法层面,作者指出,现有 EEG-FMs 的模型架构与自监督方式大量借鉴语言和视觉领域。摘要未列出纳入综述的模型名称,也未展开各模型的输入组织、学习目标、训练数据规模或适用任务,因此不能据此判断具体技术路线的优劣。 在评估层面,作者报告,现有 EEG-FMs 的评估具有异质性且总体受限,难以据此判断模型开箱即用的实际价值。这是综述作者对所纳入工作的综合判断,不等于所有 EEG-FMs 均缺乏实用性,也不能替代在具体任务和数据划分下的验证。摘要未提供性能数值、对照基线或被试内、跨被试、跨会话及跨数据集协议,具体评估结论与证据覆盖范围尚未验证。 作者建议未来采用标准化且贴近真实使用条件的评估,展示实质性的规模扩展效应,并在 EEG-FM 全流程中作出有原则、可信赖的方法选择;同时与领域专家合作发展基准、软件工具、技术方法及临床和科学应用。这些是研究方向建议,而非已证实的性能或临床收益。 阅读全文时宜核对十个模型的纳入标准、文献覆盖范围、不同评估协议的可比性,以及规模扩展效应和可信赖性所对应的具体证据。实验协议、消融及统计信息尚未验证。本文提供的是综述性分析框架,而不是新模型发布或临床验证。

    阅读价值:该综述从输入表示、自监督学习与评估策略三个环节审视早期 EEG 基础模型,值得用于核对现有模型的开箱即用证据与评估可比性,但具体比较结论仍需全文验证。

9月19日周五
  1. OpenReview · Representation learning72

    采用空间性保持表征的 EEG 信号自监督学习

    基于摘要分析。该研究针对 EEG 自监督学习中输入电极与表征之间的一一对应关系未被充分保留、可能导致空间信息丢失的问题,提出 Spatiality Preserving Representation(SPR)Learning。其核心贡献是通过 coherence 伪标签预测任务学习空间关系,将 EEG 空间组织信息纳入自监督表征学习。 机制方面,作者将 SPR 与依赖重建或采用独立编码器进行时间预测的方法作对照,主张 coherence 伪标签能够引导模型理解脑信号的拓扑组织。摘要未说明 coherence 的计算方式、伪标签构造、预测对象、损失函数,以及电极—表征对应关系的具体保证机制;这些是判断方法能否真正保留空间信息、而非仅学习相关性模式的关键核对点。 结果方面,作者报告在不同数据集上的微调提升分别为 4.7%、9.7%、1.6% 和 15.6%,并称优于现有先进方法。但摘要未提供数据集名称、下游任务、指标、对照方法或被试内/跨被试等划分协议,也未说明这些百分数是相对提升还是百分点差值,因此不能据此比较不同数据集上的效果。实验协议、消融及统计信息尚未验证。 作者认为所学表征能够捕捉 EEG 的时空动态,并为功能连接分析与自监督表征学习建立联系;摘要尚不足以确认其脑区关系解释能力。复现时需取得全文中的电极布局与预处理要求、伪标签生成流程、预训练和微调设置,并核对空间信息保留的直接证据及对通道配置变化的适用范围;代码与数据可用性尚未验证。

    阅读价值:值得核对其 coherence 伪标签预测如何保持电极与表征的一一对应关系,以及微调收益是否来自空间信息保留;摘要提供了明确的机制方向,但具体实现与评估协议尚未验证。

  2. OpenReview · EEG71

    stLaBraM:采用因子化时空片段嵌入进行自监督学习的可解释 EEG 基础模型

    基于摘要分析。该研究针对 EEG 基础模型在自监督掩码建模中难以兼顾性能与可解释性的问题,提出 stLaBraM,在 patch embedding 模块中引入可解释的空间与时间滤波,以改善 EEG 表征学习,并分析与掩码建模相关的神经源特征。 机制与创新:标题将方法概括为因子化时空片段嵌入,摘要明确的改动集中在空间、时间滤波及其可解释性,而非仅报告下游分类性能。作者将原始 LaBraM 作为对照,讨论自监督预训练的重建损失及 masked language model(MLM)表现。因子化的具体实现、滤波器约束、掩码策略、重建目标和损失形式尚未验证。 结果:作者报告,相较 LaBraM,该方法在自监督预训练中显著降低重建损失,并在标准 EEG 分类基准上取得更好的表现;摘要未提供数据集名称、评价指标、数值、数据划分或被试内、跨被试等协议,因此目前不能判断增益幅度及其适用范围。作者还报告,模型能够提供与自监督掩码建模相关的神经源二阶动力学性质和皮层位置的解释,但这些解释的计算方式、定位依据与验证程序尚未明确。 验证与复现:阅读全文时应重点核对时空滤波如何分解、如何从滤波器得到神经源解释,以及预训练数据、模型规模和下游评估条件是否与 LaBraM 对齐。还需核对重建损失改善与分类增益之间的关系,以及解释结果对被试差异、通道配置和噪声的稳定性。实验协议、消融及统计信息尚未验证,代码、权重和复现条件亦未由所给材料确认;摘要中的临床应用动机不能视为已完成临床验证。

    阅读价值:值得阅读的具体原因是其将可解释的空间与时间滤波引入 EEG 基础模型的 patch embedding,并以 LaBraM 为对照讨论重建与分类表现;性能增益及神经源解释的可靠性仍需全文验证。

1月1日周三
  1. OpenReview · EEG72

    EEGDM:基于生成式扩散模型的 EEG 表征学习

    基于摘要分析。该研究针对 EEG 标注有限、信号变异性高导致的表征学习困难,提出生成式扩散表征学习框架 EEGDM,并将预训练得到的潜在 EEG 表征用于下游分类,探索区别于现有 EEG 基础模型的技术路径。 核心机制是用于扩散预训练的结构化状态空间模型 SSMDP:作者以其捕获 EEG 的时间动态,并在 Denoising Diffusion Probabilistic Model(DDPM)框架下训练。随后,作者提出 latent fusion transformer(LFT),利用所得潜在表征完成分类。摘要未说明扩散噪声设定、具体训练目标、潜在表征提取位置及 LFT 的融合方式,这些实现细节尚未验证。 评估采用涉及发作间期癫痫样放电的 TUEV 与涉及癫痫发作检测的 CHB-MIT,并与现有方法及 EEG 基础模型比较。作者报告 EEGDM 优于所比较的方法,但摘要未提供具体指标、数值、基线名单及被试内或跨被试等划分信息,因而尚不能判断优势幅度、统计可靠性或跨协议泛化能力。这些任务属于 EEG 临床事件识别,不能直接视为已验证的 BCI 控制效果。 作者将大型 EEG 基础模型的训练与推理成本、模型增大时收益有限作为研究动机,但摘要并未给出 EEGDM 的参数量、训练开销或推理效率,不能据此确认其计算成本优势。复现时需核对数据预处理、预训练与下游数据的划分关系、分类协议、基线配置以及 SSMDP 和 LFT 的独立贡献;实验协议、消融及统计信息尚未验证。摘要提供了源码与 checkpoint 链接,但其内容、可运行性和复现实验条件尚未核验。

    阅读价值:值得核对其以结构化状态空间模型进行扩散预训练、再融合潜在 EEG 表征的机制,以及相对 EEG 基础模型的分类收益与计算成本;摘要中的性能优势尚需结合完整实验协议验证。

10月11日周五
  1. OpenReview · Representation learning76

    通过低维建模理解基于扩散模型的表征学习

    基于摘要分析。研究探讨扩散模型为何、以及在何种条件下能够在以生成任务为设计目标的同时,学到高质量的自监督表征。作者提出,关键在于扩散模型通过受噪声水平控制的去噪目标,学习图像数据集的低维分布,并据此分析噪声尺度变化下的表征学习行为。 机制与贡献:作者报告,实证结果支持上述假设,不同噪声水平下的表征学习性能变化,与相应后验估计的质量密切相关。在这一观察基础上,作者提供了关于表征随噪声尺度变化呈单峰动态的理论解释,说明去噪过程如何学习有意义的表征。摘要还将扩散模型相对传统去噪自编码器的表征优势归因于其内在的参数共享机制,但具体共享方式、理论假设与对照设置尚未验证。 证据边界:摘要未给出数据集、模型规模、表征评估任务、数据划分或具体指标,因此不能量化优势,也不能判断结论适用的噪声范围与数据条件。实验协议、消融及统计信息尚未验证;复现前需核对低维分布的建模假设、后验估计质量的度量、表征提取位置,以及参数共享对照是否控制了其他因素。 平台推测(待验证):若 EEG 信号在选定任务和预处理条件下具有可利用的低维结构,这一机制可能为选择自监督去噪的噪声尺度提供依据,但图像领域结果不等于 BCI 有效。可复用的是噪声尺度扫描与去噪表征评估思路,需改造输入表示、噪声模型及通道处理;低信噪比、跨被试差异和小数据可能使去噪目标偏向背景活动而非任务信息。一个可检验的小实验是在固定 EEG 数据划分、模型容量和训练预算下扫描噪声水平,分别评估去噪质量与冻结表征的任务分类表现,检验两者关系及表征性能是否呈单峰变化。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其关于噪声尺度、后验估计质量与表征性能之间关系的理论解释,并核对参数共享相对传统去噪自编码器的贡献;其对 EEG 自监督学习的适用性尚未验证。

9月26日周四
  1. OpenReview · EEG76

    以大型时空 Transformer 为基础模型学习鲁棒 EEG 表征

    基于摘要分析。研究针对 EEG 基础模型难以适应不同记录配置、BCI 控制范式及有限标注数据的问题,提出时空 EEG Transformer(ST-EEGFormer),通过自监督预训练与下游微调学习可迁移的 EEG 表征。其主要贡献是将不同通道配置和信号时长的建模,与跨 MI、P300、SSVEP 范式的适应性评估结合起来。 方法将原始 EEG 切分为片段(patches),投影到嵌入空间,并加入空间与时间嵌入。作者以掩码自编码器(MAE)任务进行自监督预训练,预训练数据由六个公开运动想象(MI)数据集、一个公开 P300 数据集和一个公开稳态视觉诱发电位(SSVEP)数据集组成。摘要未提供片段长度、空间位置编码方式、掩码策略、重建目标细节或模型规模,尚不能确认其处理不同通道配置的具体实现条件。 评估包括预训练所涉及八个数据集上的下游分类微调,以及两个未参与预训练的公开数据集:癫痫发作分类数据集和在线 MI BCI 数据集。对照模型包括简单线性模型、EEGNet、监督学习模型 EEG Conformer,以及基础模型 BIOT 和 Large Brain Model(LaBraM)。作者报告,预训练后的 ST-EEGFormer 在八个预训练数据集的下游分类中均取得高于所比较模型的 Accuracy,并在新数据集、有限训练数据条件下表现出较强泛化能力;摘要未给出具体数值或有限数据的规模。 这些结果支持进一步核查统一时空表征与 MAE 预训练的适应性,但不能直接解释为已验证的跨被试、跨会话或无需微调的泛化。数据集名称、被试数、训练与测试划分、预训练与评估样本的关系、各基线微调预算、消融及统计信息尚未验证。作者还提供模型及支撑结果的特征可视化,其解释性结论需结合正文审阅;代码、权重与完整复现条件尚未验证。

    阅读价值:值得阅读其跨 MI、P300 与 SSVEP 范式的统一预训练设计,以及在未参与预训练的数据集上检验有限训练数据条件下泛化能力的实验;作者报告的优势仍需结合具体划分、微调预算与统计结果核对。

9月23日周一
  1. OpenReview · Representation learning76

    通过低维建模理解基于扩散模型的表征学习

    基于摘要分析。研究探讨以生成为目标的 diffusion models 为什么、以及在何种条件下能够通过自监督学习获得高质量表征,提出其能力源于噪声控制的去噪目标对图像数据低维分布的学习,并从后验估计和参数共享两个角度解释这一机制。 作者报告,表征学习性能随噪声水平变化的情况,与相应后验估计的质量密切相关。基于这一观察,论文提供理论分析,解释表征表现随噪声尺度变化的单峰动态,以及去噪过程如何形成有意义的表征。摘要还指出,扩散模型内在的参数共享机制能够解释其相对传统 denoising auto-encoders 的表征学习优势;具体共享方式、理论假设及对照条件尚未验证。 摘要未提供数据集、数据划分、具体指标或结果数值,因此目前只能确认作者提出的机制解释与定性结论,不能判断优势幅度或适用范围。实验协议、消融及统计信息尚未验证;阅读全文时需重点核对低维分布假设、后验估计质量的测量方式,以及噪声尺度和参数共享各自的贡献。 平台推测(待验证):若 EEG 中存在可稳定恢复的低维任务相关结构,这一机制可能为自监督去噪中噪声强度的选择提供分析视角,但图像领域结果不等于 EEG/BCI 有效。可复用去噪目标与跨噪声尺度参数共享的思路,输入表示和噪声模型则需适配 EEG 的时序、通道结构及生理噪声。低信噪比、跨被试差异、通道变化与小数据可能使低维结构估计不稳定,或使表征偏向非任务相关成分。一个可检验的假设是:在固定被试内划分、相同训练数据与模型容量下,扫描噪声尺度并比较共享参数模型与分别训练的去噪模型,观察去噪质量和下游 MI 表征表现是否呈现一致变化。相关 EEG 工作尚未检索确认。

    阅读价值:该研究以低维分布建模和后验估计解释扩散模型的表征学习能力,值得核对噪声尺度与表征质量之间的理论联系,以及参数共享相对去噪自编码器的作用证据。

2月8日周四
  1. OpenReview · Representation learning76

    通过最优 canonical metric 进行自监督李代数表征学习

    基于摘要分析。该研究针对有限训练样本下的视觉分类,提出自监督李代数表征学习框架 SLA-Net,核心是将表征距离的优化置于李代数的向量空间中,并联合自监督学习与监督分类。 作者指出,在其讨论的理论设定下,直接使用李群上的 canonical metric 并不正确,并声称证明了有效的优化度量应采用李代数上的 canonical metric。SLA-Net 最小化目标与预测李代数表征之间的 canonical metric 距离,以避免在流形上计算非平凡测地距离;自监督任务与监督分类同时优化同一组共享参数。摘要未说明目标表征的构造方式、自监督任务、度量的具体形式,以及原标题中“Optimal”所对应的优化条件,这些均需核对正文。 作者报告,在八个公共数据集上的有限样本视觉分类评估支持 SLA-Net 的有效性,并将泛化改善归因于联合优化。摘要未提供数据集名称、样本规模、数据划分、对照基线或具体指标,因而无法判断收益幅度及适用范围;实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设 EEG 特征具有可合理映射至李群或李代数的几何结构,该方法的向量空间距离优化与共享表征学习可能有助于小样本 EEG 分类。可复用的是李代数表征距离与联合优化思路;需改造的是 EEG 编码器、几何映射及自监督目标,不能直接将一般 EEG 特征或协方差结构等同于论文所需的李群结构。低信噪比、跨被试分布差异、通道配置变化及小数据下不稳定的几何估计都可能使收益失效。可检验的小实验是在固定跨被试划分与相同标注预算下,比较同一编码器的监督基线、加入普通向量距离的自监督版本及加入论文李代数度量的版本,核对分类指标及多次重复的波动。相关 EEG 工作尚未检索确认。

    阅读价值:值得核对其 canonical metric 的理论适用条件及自监督与监督分类共享参数的实现;这为有限样本表征学习提供了具体研究路径,但在 EEG 上的有效性尚未验证。

1月16日周二
  1. OpenReview · Representation learning74

    基于细粒度交互的蛋白质–配体结合表征学习

    基于摘要分析。该研究针对蛋白质–配体结合预测中监督数据有限、模型泛化受限的问题,提出以细粒度交互为核心的自监督表征学习方法。不同于分别预训练蛋白质和配体的思路,作者将预训练表述为:给定结合口袋与配体,预测最终结合复合物结构。 机制上,方法采用基于 Transformer 的交互模块,并设置原子对距离图预测与配体掩码重建两项预训练任务,分别从结构空间和特征空间建模结合交互。摘要未说明距离图的具体覆盖范围、掩码策略、损失形式及任务组合方式,这些实现细节尚未验证。 作者报告,该方法在蛋白质–配体亲和力预测、虚拟筛选和蛋白质–配体对接等任务中表现优于对照方法,但摘要未提供数据集、数据划分、基线名称、指标或数值,因而无法判断优势幅度及泛化边界。实验协议、消融及统计信息尚未验证;复现还需核对预训练数据来源、复合物结构处理、下游训练设置,以及代码和模型权重的可用性。 平台推测(待验证):可借鉴的是“显式关系预测与掩码重建联合预训练”的机制,而非直接移植分子结合模型。其原始任务依赖结合口袋、配体及原子级结构关系;EEG 中可假设用通道间关系预测辅助掩码信号重建,以应对标注有限时的表征学习问题。可复用交互建模和双任务框架,但需改造输入编码与关系目标,不能将原子距离直接等同于 EEG 功能连接。低信噪比、参考方式、跨被试差异和通道配置变化均可能使关系目标不稳定,小数据下也可能学到伪迹。一个可证伪的小实验是:在固定 Cross-subject 划分和相同预训练数据条件下,对比仅掩码重建与加入关系预测的模型,检验下游性能及通道扰动稳定性是否改善。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以原子对距离预测和配体掩码重建联合学习细粒度交互的自监督机制,但摘要中的多任务优势仍需结合完整实验协议核对,向 EEG 的迁移尚未验证。

  2. OpenReview · Representation learning76

    基于随机数据投影器的自监督表征学习

    基于摘要分析。该研究针对自监督表征学习(SSRL)对人工设计的数据增强及变换不变性假设的依赖,提出通过重构随机数据投影来学习表征的方法,不依赖数据增强或掩码。作者认为,这一路径可减少不同模态及应用特定增强约束带来的适配困难。 核心机制是以随机数据投影的重构作为学习任务,而非借助增强视图或掩码建模获得监督信号。摘要未说明投影的构造与分布、重构目标的具体定义、损失形式,以及编码器和重构模块的配置,因此尚不能判断哪些随机投影能够保留任务相关信息,也不能将其等同于某种已知的对比学习或降维方法。 作者报告,在覆盖多种模态与实际应用的表征学习任务中,该方法优于多个先进 SSRL 基线;但摘要未提供任务名称、数据集、数据划分、指标或具体数值。“适用于任意数据模态和网络架构”是作者提出的广泛适用性主张,其实际边界仍需结合全文核对。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若随机投影重构能保留 EEG 中的任务相关时空结构,它可能为难以设计可靠增强的小数据表征学习提供替代路径。可考虑复用重构学习思路,但需适配多通道时序输入、通道布局和尺度归一化。低信噪比可能使重构任务偏向噪声或伪迹,跨被试差异与通道变化也可能削弱表征稳定性。一个可检验的小实验是在固定 Cross-subject 划分、仅用训练被试进行自监督训练的前提下,以相同编码器和下游评估流程比较随机投影重构与增强式 SSRL,并检查投影设置变化对结果的影响。以上属于迁移假设,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对随机数据投影重构如何在不依赖数据增强或掩码的条件下学习表征,以及其跨模态优势的评估边界;对 EEG 的适用性尚未验证。

1月1日周一
  1. OpenReview · EEG79

    EEGPT:通过自回归预训练释放 EEG 通用基础模型的潜力

    EEGPT 针对 EEG 数据格式多样、预训练范式与迁移方法受限的问题,结合电极级建模、自回归预训练和多任务迁移,旨在构建可适配不同采集设备、被试与任务的通用 EEG 基础模型。基于摘要分析,未取得论文全文。 核心机制:作者将每个电极作为基本建模单元,以整合不同电极配置的 EEG 数据;摘要称预训练数据涉及最多 138 个电极,共计 37.5M 个预训练样本,但样本单位、切片方式及数据组成尚未验证。预训练采用 next signal prediction,而非传统 masked autoencoder,目标是捕捉 EEG 的序列与时间依赖;具体预测粒度、序列组织、损失函数与推理流程尚未验证。作者还探索了参数规模最高为 1.1B 的模型的 scaling laws,但摘要未提供规模与性能之间的定量关系。 迁移机制:作者提出跨任务共享的可学习电极图网络,用于多任务迁移学习,并报告任务间具有兼容性与协同作用。摘要称模型支持最多 138 个电极及其任意组合输入;电极身份编码、不同设备的输入对齐方式、缺失电极处理和任务特定模块仍需核对正文。 结果与证据边界:作者报告在覆盖 5 个不同任务的 12 个 benchmarks 上进行评估,并在全部下游任务中优于现有专用模型,同时称广泛消融支持其有效性。摘要未列出任务与数据集名称、被试数、被试内或跨被试等划分协议、基线、指标及数值,因此不能据此量化优势,也不能确认跨设备、跨被试适配的具体评估前提。实验协议、消融及统计信息尚未验证。 复现重点是核对异构数据整合规则、自回归目标与电极图迁移各自的贡献,以及预训练数据和下游评估的关系。摘要中的“首次”及“最大”等表述属于作者主张,尚未独立核实。作者表示将发布代码和模型,当前材料不能确认其已公开。

    阅读价值:值得核对其电极级建模、自回归预训练与共享电极图的多任务迁移如何协同处理异构 EEG,并复现作者报告的跨任务优势;具体划分、对照与统计证据尚未验证。

11月29日周三
  1. OpenReview · Representation learning74

    用于自监督表征学习的随机场数据增强

    基于摘要分析。该研究针对图像自监督表征学习中数据增强决定表征不变性、而增强方式仍有待探索的问题,提出基于高斯随机场的局部变换族,将传统仿射与颜色变换扩展为参数可随像素位置变化的增强。 核心机制是将变换参数视为空间坐标的连续函数,并用相互独立的高斯随机场建模。与平移、旋转、color jitter 等传统增强相比,该方法扩大了局部变换的可能范围;具体随机场构造、参数化方式、自监督目标及训练流程尚未验证。 作者报告,在 ImageNet 下游分类中,相对基线的 top-1 Accuracy 提升为原文所述的 1.7%;在分布外 iNaturalist 下游分类中,提升为原文所述的 3.6%。摘要未明确这些数值是相对百分比还是百分点,也未明确后一指标、基线方法、数据划分和评估协议,不能据此进行跨协议比较。作者同时报告,温和变换有助于表征学习,但较强变换可能破坏图像结构,且表征对超参数敏感。实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可迁移假设是以平滑随机参数场生成局部变化,帮助 EEG 自监督学习覆盖有限的时空扰动。原方法依赖图像空间坐标;迁移时需将参数场改造为时间轴或电极空间上的函数,并确认增强仍保留任务相关信号,而非直接照搬图像仿射与颜色变换。低信噪比、小数据、跨被试差异及不规则通道布局可能放大增强误差,破坏 ERP 时序或频谱线索。一个可证伪的小实验是在固定 Cross-subject 划分、自监督目标和下游评估协议下,对比无增强、常规增强与不同强度的随机场增强,检验温和增强能否稳定获益及强增强是否退化。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其高斯随机场如何控制局部增强的平滑性与强度,以及增强多样性带来收益和破坏图像结构之间的边界;其对 EEG 自监督学习的迁移价值尚未验证。

9月23日周六
  1. OpenReview · Representation learning76

    用于鲁棒表征学习的上下文视觉 Transformer

    基于摘要分析。研究针对不同群组间潜在因素变化导致的图像分布偏移,提出 Contextual Vision Transformers(ContextViT),通过群组上下文条件化图像表征,并在推理时适应新的测试分布。 核心机制借鉴 in-context learning:将与输入图像属于同一群组的图像信息映射为额外的 context token,再将其附加到输入图像 tokens 中,使表征随群组上下文调整。作者另引入 context inference network,从某一群组的一批样本即时预测 context token。该机制依赖可用的群组归属及同组样本;摘要未说明群组的具体定义、上下文聚合方式、训练损失或测试时是否更新模型参数,因此不能将其直接等同于参数更新式测试时自适应。 作者报告,在监督微调设置下,为预训练 ViTs 加入上下文条件化机制,在 iWildCam 和 FMoW 上持续改善分布外泛化;在自监督表征学习设置下,ContextViT 在 Camelyon17 病理图像及 JUMP-CP 显微图像基准上,比对应 ViT 获得更稳定的分布偏移下图像表征。摘要未给出指标数值、数据划分或效应大小,实验协议、消融及统计信息尚未验证。复现时需核对群组构造、上下文批次采样、预训练条件与基线配置。 平台推测(待验证):迁移假设是,EEG 的被试或会话可作为群组,上下文条件化可能帮助处理跨被试或跨会话分布变化。可复用 context token 与上下文推断思路,但需将图像 token 编码改为 EEG 时序或时空编码,并明确测试群组可用样本及监督条件。低信噪比、小批次、通道配置差异,以及同组任务类别比例变化,都可能使上下文混入噪声或任务内容。一个可检验的小实验是在固定 Cross-subject 划分下,以同一 EEG 编码器比较无上下文与同组上下文条件化,并加入打乱群组的对照;严格固定测试上下文采样规则,检验增益是否来自有效群组信息。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其由同组样本推断 context token 的机制及测试时分组协议:这为利用群组上下文处理分布偏移提供了具体方法,但其对 EEG 跨被试或跨会话表征的价值尚未验证。

9月22日周五
  1. OpenReview · Representation learning70

    InfoAug:用于表征学习的互信息引导数据增强

    基于摘要分析。InfoAug 研究对比表征学习中的数据选择与增强如何减少对人工假设和工程经验的依赖,提出依据真实世界分布中的互信息选择训练样本,而不只在训练目标中采用信息最大化原则。 核心机制是:考察场景中的图像块在颜色变化、运动等自然扰动下的互信息,将表现出高互信息的图像块作为对比损失学习的正样本。其研究切入点在于正样本的选择依据,而非摘要已明确给出的新网络结构或新损失形式。摘要以 InfoNCE 为背景,但未说明互信息估计器、图像块对应方式、筛选阈值,以及样本选择与训练过程如何衔接,这些均需全文核对。 作者报告,在若干基准和多个先进表征学习框架上评估了该方法,并观察到有效性;摘要未提供基准名称、数据划分、具体对照、指标或数值,因此尚不能判断收益幅度及其适用范围。作者将改善开放环境泛化作为方法动机,其具体评估证据尚未验证。实验协议、消融及统计信息尚未验证。摘要称数据和代码将提供,不能据此认定已公开。 平台推测(待验证):若能可靠估计 EEG 片段在合理扰动下的信息保持程度,互信息引导的正样本选择可能有助于缓解自监督学习中增强破坏任务相关信号的问题。可复用的是信息驱动的样本筛选思路;需改造的是图像块对应关系、扰动定义及互信息估计,使其适配 EEG 的时间、通道结构。低信噪比和小数据可能导致估计不稳定,高互信息也可能来自稳定伪迹或被试身份,而非任务信息。一个可检验的小实验是在固定数据划分、模型与训练预算下,对比互信息筛选和随机选择增强正样本,并在独立跨被试测试中检查下游性能与伪迹敏感性。以上为迁移假设,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 InfoAug 如何估计自然扰动下的互信息并据此选择对比学习正样本,这为减少增强策略对人工假设的依赖提供了具体研究路径,但其 EEG 迁移价值尚未验证。