通过 EEG 嵌入与引导扩散实现视觉解码与重建
Visual Decoding and Reconstruction via EEG Embeddings with Guided Diffusion
基于摘要分析。研究针对 EEG 视觉解码与图像重建,提出端到端零样本框架:以 Adaptive Thinking Mapper(ATM)将神经信号映射至与 CLIP 嵌入共享的子空间,再通过两阶段、多路径 EEG-to-image 生成策略重建视觉内容。其主要贡献是联合高层语义条件与低层图像线索引导预训练扩散模型,而非仅依赖单一路径的 EEG 表征。 机制上,第一阶段将 EEG 嵌入与高层 CLIP 嵌入对齐,并由先验扩散模型进一步将 EEG 嵌入细化为图像先验;同时从 EEG 解码出模糊图像,以保留低层特征。第二阶段将高层 CLIP 嵌入、模糊图像以及从 EEG 潜在表征获得的文本描述共同输入预训练扩散模型。摘要未提供 ATM 的具体结构、对齐损失、文本描述生成方式或各模块的训练与冻结策略,这些实现细节尚未验证。 作者报告,该框架在视觉分类、检索与重建任务中取得 SOTA 表现,并在 MEG 数据模态上展示了框架的适用性;作者还分析了不同时间窗和脑区对解码与重建的影响。摘要未给出数据集、被试数量、具体指标、对照基线及数据划分,因此无法确认这些结论对应被试内、跨被试或其他评估协议,也不能据此作定量比较。 复现时需重点核对零样本所指的未见类别、图像或被试范围,训练与测试刺激的划分方式,以及高层语义、模糊图像和文本条件各自的贡献;实验协议、消融及统计信息尚未验证。摘要提供了代码仓库,但代码完整性、预训练权重与数据可获取性仍需检查。作者将 EEG 的低成本和高时间分辨率视为 BCI 应用优势,但摘要中的视觉解码结果尚不能直接等同于在线 BCI 的可用性验证。
值得关注其将 EEG 的高层语义嵌入与低层图像线索共同用于扩散重建的两阶段机制,但零样本定义、数据划分及作者所称 SOTA 的比较依据尚需全文核对。
来源:OpenReview · EEG · openreview.net