跳到正文

算法、任务与模态

Transformer 最新动态

Transformer 研究索引;按可核对的标签归档,不以热度评价质量。

29 条精选近 30 天 21 条共收录 40 条

更新

精选归档 · 第 2 页

9月18日周五第 21–29 条
  1. OpenReview · EEG75

    vNeuro:EEG 视觉模型的基础

    基于摘要分析。该研究探讨自然视觉数据上学到的表征能否复用于 EEG,以减少从零预训练大型 EEG 专用模型的需求。vNeuro 通过轻量可训练接口,将多通道 EEG 时频表征转换为保留电极几何关系的视觉 token,适配冻结的视频预训练 V-JEPA 2.1 编码器。 机制上,接口在无标签 EEG 上通过潜在表征预测与分布正则化进行自监督训练,视觉主干始终固定;下游训练只优化适配器和分类头。其核心区别在于复用预训练视觉主干,而非从头学习 EEG 主干。时频变换、token 映射、预测目标和正则化的具体形式,以及接口规模与训练数据量,摘要未提供,尚未验证。 作者报告:采用 ViT-B 主干时,vNeuro 在 TUAB 异常检测上的 Balanced Accuracy 为 81.40%,在 TUEV 事件分类上为 68.35%;采用 ViT-G 时,TUEV 的 Balanced Accuracy 为 68.73%。摘要未说明被试内、跨被试或其他划分协议,因此这些结果不能直接与不同协议下的分数比较。作者称其表现可与使用数万小时 EEG 预训练的基础模型竞争,但具体对照模型、预处理与训练预算的可比性尚需核对。 作者报告消融和表征分析支持 EEG 到视觉 token 的映射及带正则化的自监督适配均对性能有贡献;具体效应幅度、实验协议与统计信息尚未验证。复现重点包括电极布局与通道处理、时频输入构造、V-JEPA 2.1 权重配置、适配训练语料及下游数据划分。平台推测(待验证):固定视觉主干可能减少需要更新的参数,但不能据此认定整体训练成本更低,或已具备跨被试、跨设备泛化能力。

    阅读价值:值得核对其电极几何保持的视觉 token 映射与冻结 V-JEPA 2.1 的自监督适配机制;作者报告其在 TUAB、TUEV 上具有竞争力,但评估划分与计算成本尚需全文验证。

1月26日周一
  1. OpenReview · EEG77

    EEG 基础模型值得采用吗?在多种 BCI 任务中与传统解码器的比较评估

    基于摘要分析。该研究考察 EEG 基础模型相较于传统解码方法,尤其是经典非神经网络方法,是否具有稳定优势;核心贡献是跨数据集、解码任务和六种评估协议的比较基准,并引入 ST-EEGFormer 作为预训练基线。 方法方面,ST-EEGFormer 是基于 Vision Transformer(ViT)的时空 EEG 模型,仅使用 masked autoencoding(MAE)在超过 8M 个 EEG 片段上预训练。摘要未提供片段长度、来源构成、预训练与下游数据的关系,以及掩码策略和微调配置,这些复现条件尚未验证。研究覆盖多种 EEG 基础模型、紧凑神经网络与经典非神经网络解码器,并采用统计检验;具体模型、数据集、任务及六种协议的定义未在摘要中列出,不能据此确定其被试内、跨被试或跨会话设置。 作者报告,微调后的基础模型在数据充足、群体层面的评估中表现较好,但在数据稀缺场景下,往往不能显著优于紧凑神经网络,甚至经典非神经网络解码器。作者还报告,线性探测的表现持续偏弱,下游任务之间的性能差异较大,所比较的神经网络解码器未呈现清晰的缩放规律。摘要未给出具体指标、效应量或统计检验细节,因此这些结论不能扩展为所有 EEG 基础模型或所有 BCI 场景的普遍判断。 作者将结果解释为预训练与下游微调之间存在较大落差,复杂预训练任务的收益可能因此被削弱,并指出有未显式揭示的架构因素影响性能。阅读全文时需核对架构因素如何被隔离、预训练和微调贡献如何比较,以及各协议的数据划分、调参预算和统计方法。实验协议、消融及统计信息尚未验证;当前材料支持将其作为 EEG 基础模型收益边界的评估研究,而非认定基础模型无效。

    阅读价值:该研究通过多任务、六种评估协议及统计检验比较 EEG 基础模型与传统解码器,值得核对其数据稀缺场景下的收益边界及预训练与微调贡献的区分。

9月16日周二
  1. OpenReview · EEG78

    ELASTIQ:通过语义任务指令与查询实现 EEG–语言对齐

    ELASTIQ 针对 EEG 基础模型难以将语言指令作为表征学习先验、进而统一不同标签与任务的问题,提出结合谱–时域预训练和指令调优的 EEG–语言对齐方法。基于摘要分析,未取得论文全文,其核心贡献是将任务语义指导引入 EEG 表征,使 EEG 嵌入与文本标签嵌入对齐。 预训练阶段采用联合 Spectral–Temporal Reconstruction(STR)模块:频率掩码作为全局频谱扰动,配合两种时间目标,其中随机掩码用于捕捉上下文依赖,因果掩码用于建模序列动态。摘要未披露具体重建目标、损失组合或掩码比例。指令调优阶段采用 Instruction-conditioned Q-Former(IQF),这是基于查询的交叉注意力 Transformer,通过可学习查询将指令嵌入注入 EEG tokens,并与文本标签嵌入对齐。该机制区别于仅学习 EEG 表征的思路,但各模块的独立贡献仍需结合正文消融核对。 作者报告在涵盖运动想象、情绪识别、SSVEP、covert speech 和医疗健康任务的 20 个数据集上进行评估,其中 14 个数据集达到作者所称的最先进表现,并在全部五类任务中获得最佳平均结果。摘要未给出数据集名称、被试数、数据划分、被试内或跨被试等协议、对照方法及具体指标,因此这些结果不能直接用于判断跨被试、跨会话或跨数据集泛化能力。 作者还报告,分析支持显式任务指令作为语义先验,引导 EEG 嵌入形成连贯且具有语言语义基础的空间,并将这一观察称为首次发现;该优先性与证据强度尚未核对。值得进一步检查语义空间分析的量化依据、指令措辞敏感性,以及未见任务或标签条件下的泛化表现。实验协议、消融及统计信息尚未验证。作者表示将发布代码与预训练权重,摘要并未确认其已公开,当前复现条件仍待核实。

    阅读价值:值得核对 STR 预训练与 IQF 指令调优如何实现 EEG–语言对齐,尤其是显式任务指令相较无指令对照是否改善跨任务语义组织与解码表现;具体实验协议及消融尚未验证。

1月1日周三
  1. OpenReview · EEG74

    EEGCiD:将 EEG 凝缩到扩散模型中

    基于摘要分析。EEGCiD 针对 EEG 模型开发中大量数据带来的存储与共享隐私问题,将原始数据集的知识凝缩到扩散模型和少量潜在编码中,生成信息集中的合成样本集;其目标并非复现外观逼真的 EEG,而是保留用于解码的代表性信息。 核心机制分为模型预训练与数据凝缩两阶段。首先,使用原始 EEG 数据预训练确定性去噪扩散隐式模型 DDIM,以存储数据集知识;骨干采用包含空间与时间自注意力模块 STSA 的 transformer,替代传统 U-Net。随后,从原始数据集中随机选取部分样本,经 DDIM 前向过程得到凝缩潜在编码 z,并通过匹配合成样本与原始数据在多个 EEG 解码模型中的特征分布来优化 z。摘要将这一过程称为集成特征匹配,但具体损失形式、解码模型配置及优化细节尚未验证。 作者报告,在三个 EEG 数据集上的实验中,凝缩数据集在有限样本量条件下取得更优分类表现,并能有效抵御成员推断攻击(MIA)。摘要未提供数据集名称、被试数量、被试内或跨被试等评估协议、对照方法及具体指标,因此无法量化收益,也不能据此认定对其他隐私攻击同样有效。 复现时需核对凝缩样本预算、DDIM 训练与采样设置、特征匹配模型及下游解码模型的关系,以及原始数据、潜在编码和扩散模型权重各自的存储与发布成本。隐私结论需结合 MIA 的攻击者能力、访问权限和评估协议解释;合成信号不与原始信号视觉相似,本身不等于隐私保证。实验协议、消融及统计信息尚未验证。

    阅读价值:值得关注其将确定性 DDIM 与多解码模型特征匹配结合的 EEG 数据集凝缩机制,但分类收益与隐私保护结论仍需结合数据划分、存储核算及 MIA 威胁模型核对。

  2. OpenReview · EEG74

    EEGCiD:将 EEG 凝缩到扩散模型中

    EEGCiD 针对 EEG 模型开发所需大量数据带来的存储与共享隐私问题,提出将原始数据集知识凝缩到扩散模型及小规模潜在编码集合中的方法,以生成信息集中的合成 EEG 样本,而非以外观接近原始信号为主要目标。基于摘要分析,未取得论文全文。 核心机制分为知识建模与数据凝缩两个阶段:首先使用原始 EEG 数据预训练确定性 denoising diffusion implicit model(DDIM),以保存数据集知识;其骨干采用包含空间与时间自注意力模块(STSA)的 transformer,替代传统 U-Net。随后,从原始数据集中随机选取样本子集,经 DDIM 前向过程得到凝缩潜在编码 z,再通过匹配合成样本与原始数据在多个 EEG 解码模型中的特征分布来优化 z。该集成特征匹配策略意在将对解码任务有用的信息集中到较小的合成数据集中;具体损失形式、解码模型组合及优化细节尚未验证。 作者报告,在三个 EEG 数据集上,凝缩数据集在有限样本条件下取得较好的分类表现,并能有效防御成员推断攻击(MIA)。摘要未提供数据集名称、任务、被试数、被试内或跨被试划分、凝缩样本规模、分类指标数值及对照设置,因此无法量化分类收益,也不能比较不同协议下的效果。实验协议、消融及统计信息尚未验证。 复现与应用评估需核对 DDIM 预训练成本、潜在编码优化成本,以及生成合成数据所需模型权重是否计入总存储开销。隐私结论还需核对 MIA 的攻击者能力、访问权限和评估指标;合成样本不与原始信号外观相似,本身不能构成隐私保证。作者报告的 MIA 防护效果应限定于其实际测试设置,不能据此推断身份或健康信息的其他泄露风险均已消除。

    阅读价值:值得阅读其将确定性 DDIM 与多解码模型特征分布匹配结合的 EEG 数据凝缩机制,但分类收益与成员推断攻击防护效果仍需结合压缩规模、评估协议和攻击设置核对。

  3. OpenReview · EEG72

    EEGDM:基于生成式扩散模型的 EEG 表征学习

    基于摘要分析。该研究针对 EEG 标注有限、信号变异性高导致的表征学习困难,提出生成式扩散表征学习框架 EEGDM,并将预训练得到的潜在 EEG 表征用于下游分类,探索区别于现有 EEG 基础模型的技术路径。 核心机制是用于扩散预训练的结构化状态空间模型 SSMDP:作者以其捕获 EEG 的时间动态,并在 Denoising Diffusion Probabilistic Model(DDPM)框架下训练。随后,作者提出 latent fusion transformer(LFT),利用所得潜在表征完成分类。摘要未说明扩散噪声设定、具体训练目标、潜在表征提取位置及 LFT 的融合方式,这些实现细节尚未验证。 评估采用涉及发作间期癫痫样放电的 TUEV 与涉及癫痫发作检测的 CHB-MIT,并与现有方法及 EEG 基础模型比较。作者报告 EEGDM 优于所比较的方法,但摘要未提供具体指标、数值、基线名单及被试内或跨被试等划分信息,因而尚不能判断优势幅度、统计可靠性或跨协议泛化能力。这些任务属于 EEG 临床事件识别,不能直接视为已验证的 BCI 控制效果。 作者将大型 EEG 基础模型的训练与推理成本、模型增大时收益有限作为研究动机,但摘要并未给出 EEGDM 的参数量、训练开销或推理效率,不能据此确认其计算成本优势。复现时需核对数据预处理、预训练与下游数据的划分关系、分类协议、基线配置以及 SSMDP 和 LFT 的独立贡献;实验协议、消融及统计信息尚未验证。摘要提供了源码与 checkpoint 链接,但其内容、可运行性和复现实验条件尚未核验。

    阅读价值:值得核对其以结构化状态空间模型进行扩散预训练、再融合潜在 EEG 表征的机制,以及相对 EEG 基础模型的分类收益与计算成本;摘要中的性能优势尚需结合完整实验协议验证。

9月26日周四
  1. OpenReview · EEG76

    以大型时空 Transformer 为基础模型学习鲁棒 EEG 表征

    基于摘要分析。研究针对 EEG 基础模型难以适应不同记录配置、BCI 控制范式及有限标注数据的问题,提出时空 EEG Transformer(ST-EEGFormer),通过自监督预训练与下游微调学习可迁移的 EEG 表征。其主要贡献是将不同通道配置和信号时长的建模,与跨 MI、P300、SSVEP 范式的适应性评估结合起来。 方法将原始 EEG 切分为片段(patches),投影到嵌入空间,并加入空间与时间嵌入。作者以掩码自编码器(MAE)任务进行自监督预训练,预训练数据由六个公开运动想象(MI)数据集、一个公开 P300 数据集和一个公开稳态视觉诱发电位(SSVEP)数据集组成。摘要未提供片段长度、空间位置编码方式、掩码策略、重建目标细节或模型规模,尚不能确认其处理不同通道配置的具体实现条件。 评估包括预训练所涉及八个数据集上的下游分类微调,以及两个未参与预训练的公开数据集:癫痫发作分类数据集和在线 MI BCI 数据集。对照模型包括简单线性模型、EEGNet、监督学习模型 EEG Conformer,以及基础模型 BIOT 和 Large Brain Model(LaBraM)。作者报告,预训练后的 ST-EEGFormer 在八个预训练数据集的下游分类中均取得高于所比较模型的 Accuracy,并在新数据集、有限训练数据条件下表现出较强泛化能力;摘要未给出具体数值或有限数据的规模。 这些结果支持进一步核查统一时空表征与 MAE 预训练的适应性,但不能直接解释为已验证的跨被试、跨会话或无需微调的泛化。数据集名称、被试数、训练与测试划分、预训练与评估样本的关系、各基线微调预算、消融及统计信息尚未验证。作者还提供模型及支撑结果的特征可视化,其解释性结论需结合正文审阅;代码、权重与完整复现条件尚未验证。

    阅读价值:值得阅读其跨 MI、P300 与 SSVEP 范式的统一预训练设计,以及在未参与预训练的数据集上检验有限训练数据条件下泛化能力的实验;作者报告的优势仍需结合具体划分、微调预算与统计结果核对。

1月1日周一
  1. OpenReview · EEG77

    利用 EEGformer 降低可穿戴癫痫发作检测的误报:面向 MCU 的紧凑 Transformer 模型

    基于摘要分析。研究针对可穿戴设备长期连续监测 EEG 时的癫痫发作自动检测问题,提出紧凑 Transformer 模型 EEGformer,仅使用颞区通道,并通过面向硬件的设计探索兼顾检测延迟、误报率及低功耗 MCU 部署需求。 技术机制:摘要将 Transformer 用于无需手工特征提取的端到端时间序列处理,核心贡献在于将少通道采集条件与端侧计算约束纳入模型设计。具体网络结构、输入窗口、损失函数、训练策略及硬件优化方法尚未验证,不能据摘要判断性能收益分别来自模型设计、预处理还是检测后处理。 检测结果:作者报告,在 CHB-MIT 数据集上,相较于面向颞区采集的现有最先进模型,发作起始检测延迟降低 20%,同时达到 73% 的癫痫发作检测概率和每小时 0.15 次误报(FP/h)。摘要未给出对照模型名称、绝对延迟、被试内或跨被试协议及数据划分,因此这些结果应限定于作者所用评估条件。作者另报告,在一个新的、具有挑战性的头皮 EEG 数据集上,检测到 88% 的标注发作事件,误报率为 0.45 FP/h;该数据集名称、被试规模和评估划分尚未验证,两组结果不能直接比较。 部署结果:作者在单核 Apollo4 MCU 以及并行 GAP8、GAP9 MCU 上评估部署,报告最节能的 GAP9 实现每次推理耗时 13.7 ms、能耗 0.31 mJ。作者据此认为模型可支持少通道、具有多日续航的可穿戴检测系统;但单次推理指标不等于整机续航实测,推理频率、采集与通信功耗及电池条件仍需核对。 复现重点是确认颞区通道配置、连续记录的训练与测试划分、发作事件匹配规则、误报统计时长,以及检测阈值对检出概率、误报率和延迟的影响。实验协议、消融及统计信息尚未验证,代码与部署资源的可用性也尚未确认。该研究属于 EEG 临床监测算法与端侧部署研究,摘要中的检测结果不应直接视为临床有效性验证。

    阅读价值:值得阅读的具体原因是,作者将颞区少通道 EEG 癫痫发作检测的误报率、检测延迟与 MCU 推理能耗联合评估,为可穿戴端侧模型的设计提供了可核对的参考,但数据划分和检测协议仍需全文验证。

1月1日周六
  1. OpenReview · EEG73

    EEGformer:面向低通道数可穿戴连续监测设备的基于 Transformer 的原始 EEG 癫痫检测

    基于摘要分析。该研究针对长期连续癫痫监测对低误报、佩戴舒适性和低功耗的要求,提出紧凑的 Transformer 模型 EEGformer,直接使用四个颞区通道的原始 EEG 进行癫痫发作检测,并在微控制器(MCU)上验证实时推理的可行性。 核心思路是利用 Transformer 捕捉时间序列中的长程依赖,减少对针对特定数据设计的手工特征的依赖。摘要未提供输入窗口、具体模型结构、损失函数、训练策略或预处理细节,因此不能据此认定信号完全未经预处理。 作者报告,在所检查的八名患者的癫痫发作事件中,模型检出率为 73%;仅考虑其中六名患者时,事件检出率为 100%,不能将这一子集结果推广到全部患者。作者报告平均发作起始检测延迟为 15.2 秒,误报率为 0.8 FP/h;多数测试获得 100% 特异性,但 40 次测试中有 5 次异常表现,作者将其主要归因于 EEG 伪迹。事件检出率、特异性与每小时误报率反映不同层面的表现,不应相互替代。被试内或跨被试协议、数据划分以及各指标的统计口径尚未验证。 作者以 CHB-MIT Scalp EEG 数据集为参照,与针对目标数据集设计手工特征的先进分类器比较,报告准确性结果接近、发作起始检测延迟降低超过 20%;与两种经优化的卷积神经网络方法比较,作者报告在全部准确性指标上更优。具体基线、指标数值、消融及统计信息尚未验证。 部署方面,作者报告模型在 Ambiq Apollo4 MCU、96 MHz 工作频率下,单次推理耗时 405 毫秒、能耗 1.79 毫焦耳。这支持其嵌入式推理可行性,但不等于已验证整机长期续航或临床连续监测安全性。复现需进一步核对通道选择、窗口与报警规则、患者级划分、伪迹处理,以及推理数值精度和资源占用;代码与权重可用性尚未验证。

    阅读价值:值得阅读的具体原因是作者同时报告了四通道原始 EEG 癫痫发作检测表现与 MCU 实测时延、能耗,可用于核对低功耗连续监测中检测灵敏度、误报和部署成本的权衡,但临床适用性尚未验证。