CognitionCapturer:利用多模态信息从人类 EEG 信号解码视觉刺激
CognitionCapturer: Decoding Visual Stimuli from Human EEG Signal with Multimodal Information
基于摘要分析。该研究针对视觉刺激解码中主要依赖 EEG–图像配对、可能未充分利用 EEG 所含其他模态相关信息的问题,提出统一框架 CognitionCapturer,通过多模态表征学习及生成模型重建视觉刺激。其主要贡献是将模态专家编码器、EEG 到 CLIP 嵌入空间的映射与预训练生成模型连接起来,而非单独学习 EEG 与图像之间的关系。 机制上,框架为各模态训练专家编码器,从 EEG 模态中提取跨模态信息;随后引入 diffusion prior,将 EEG 嵌入映射至 CLIP 嵌入空间,再利用预训练生成模型完成视觉刺激重建。摘要未明确除图像外具体纳入哪些模态,也未说明这些模态的监督来源、专家编码器结构、损失函数及训练阶段安排,因此尚不能判断其多模态信息如何获得、如何融合,以及各模块分别贡献多少。 作者报告,重建结果具有较高的语义与结构保真度,并在定性和定量实验中优于所比较的当前先进方法;这些结论对应的具体数据集、被试数、被试内或跨被试协议、数据划分、基线及指标均未在摘要中给出,尚不能据此比较效果大小或判断泛化能力。作者还报告,该框架无需微调生成模型,并可扩展至更多模态;这不等于整个系统无需训练,模态专家编码器与 diffusion prior 的训练需求仍需核对。 复现时应重点核对模态与 EEG 的配对方式、CLIP 及生成模型配置、训练与测试划分,以及语义保真度和结构保真度的评价方法。实验协议、消融及统计信息尚未验证,尤其需要确认多模态专家相对仅使用 EEG–图像配对的增益,以及 diffusion prior 对重建的独立作用。
值得阅读其利用模态专家编码器与 diffusion prior 将 EEG 表征对齐至 CLIP 空间的重建路径,但多模态信息的实际增益及无需微调生成模型的复现条件仍需全文核对。
来源:OpenReview · EEG · openreview.net