D²-FOSA:基于频率导向语义对齐的双扩散引导 EEG 到图像重建
D$^2$-FOSA: Dual-Diffusion Guided EEG-to-Image Reconstruction with Frequency-Oriented Semantic Alignment
基于摘要分析。该研究针对 EEG 到图像重建中频率特异性神经动态捕获不足、EEG 与视觉内容跨模态语义对齐不充分的问题,提出 D²-FOSA,将频率感知 EEG 表征、对比学习与双扩散生成结合,用于视觉语义检索和图像重建。 方法上,Frequency-Spatio-Temporal Dynamics Encoder(FSTDE)基于 Frequency-Oriented Mamba(FOMamba),旨在显式建模 EEG 振荡模式及长程依赖;随后通过对比学习,将提取的 EEG 特征对齐到 CLIP 视觉语义空间。生成模块 Dual Diffusion Latent Generator(DDLG)采用双向 EEG–图像条件机制,以加强跨模态对齐并促进循环一致生成。摘要未说明频率信息的具体表示、对比学习样本构造、双扩散的训练与推理流程,以及循环一致性的具体实现,这些机制细节尚未验证。 作者报告,在四个数据集上的检索和重建实验中,D²-FOSA 优于现有方法;其中在 THINGS-EEG 图像重建任务上,相对 MB2C 的 FID 降低超过 17。该数值是 FID 差值,而非百分比或百分点;其余数据集名称、具体 FID、检索指标、被试数,以及被试内、跨被试等划分协议未在摘要中提供,因此不能据此判断跨被试泛化能力,也不能直接与其他协议下的结果比较。“显著优于”的统计依据尚未验证。 复现时需核对频率导向编码和双向扩散各自的消融贡献、训练测试划分、图像生成与 FID 计算设置,以及与 MB2C 的对照条件。作者称源代码位于补充材料,但代码可获取性、运行环境和预训练依赖尚未验证。当前证据支持将其视为 EEG 视觉解码与生成方法研究,不能进一步推断其实时 BCI 可用性;完整实验协议、消融及统计信息仍需查阅全文。
值得核对其频率感知 EEG 编码与双向扩散条件机制能否分别改善视觉语义对齐和重建质量,尤其是作者报告的 THINGS-EEG 上相对 MB2C 的 FID 改善,但具体评估协议及模块贡献尚未验证。
来源:OpenReview · EEG · openreview.net