面向视觉假体的图像到脑信号生成:CLIP 引导的多模态扩散模型
Image-to-Brain Signal Generation for Visual Prosthesis with CLIP Guided Multimodal Diffusion Models
基于摘要分析。该研究面向视觉假体中的脑编码环节,探索如何从图像生成 M/EEG,以补充从脑信号解码视觉信息的流程。其核心贡献是将 CLIP 图文语义条件、交叉注意力和可学习时空位置编码结合到扩散生成框架中;摘要未提供视觉假体刺激或视觉恢复的验证证据。 机制上,作者采用基于 denoising diffusion implicit models(DDIM)的 diffusion transformer(DiT)架构生成脑信号,通过交叉注意力对齐脑信号嵌入与 CLIP 图像嵌入。进一步使用 large language models(LLMs)生成图像描述,将对应的 CLIP 文本嵌入与图像嵌入拼接为统一条件,以引入图像的核心语义信息。可学习时空位置编码则结合脑区嵌入与时间嵌入,用于表征脑信号的空间和时间特征。具体损失、信号表示、采样配置及各模块的独立贡献尚未验证。 作者报告在 THINGS-EEG2 和 THINGS-MEG 两个多模态基准数据集上评估,并称生成信号具有生物学合理性。摘要未给出这一结论的具体指标、对照基线、被试数量或被试内、跨被试等划分协议,因此不能据此判断波形保真度、语义一致性或跨被试泛化能力;实验协议、消融及统计信息尚未验证。 复现时需核对图像与脑信号的配对和预处理方式、训练与测试图像及被试的划分、LLM 描述生成流程,以及生物学合理性的操作性定义。该工作直接涉及 EEG/MEG 生成,但从生成记录信号到可用于视觉假体的刺激编码仍有验证距离,不能将作者报告的离线生成结果等同于视觉感知恢复。
来源:OpenReview · EEG · openreview.net