基于 EEG 信号的自回归视觉解码
Autoregressive Visual Decoding from EEG Signals
基于摘要分析。该研究针对 EEG 与图像之间的模态差距、多阶段适配可能带来的误差累积,以及大型扩散模型的计算开销,提出视觉解码框架 AVDE。其核心贡献是将预训练 EEG 模型的对比学习对齐与多尺度自回归图像生成结合,用于图像检索和重建。 技术机制上,AVDE 首先通过对比学习微调 LaBraM,使 EEG 表征与图像表征对齐;随后利用预训练 VQ-VAE 将图像编码为多尺度 token 图,并训练 transformer 采用 next-scale prediction 策略,以 EEG 嵌入作为最粗尺度表征,逐步预测更细尺度的图像 token。该设计将 EEG 条件直接引入由粗到细的生成过程;具体对比学习损失、图像表征来源、条件注入方式及各模块训练或冻结策略尚未验证。 作者报告,在两个数据集上的图像检索与重建实验中,AVDE 优于此前最先进方法,且参数量仅为对照方法的 10%。摘要未提供数据集名称、被试数、被试内或跨被试划分、评价指标、具体分数及参数统计范围,因此尚不能判断性能增益的大小或其适用边界;参数量降低也不能直接等同于推理延迟或硬件开销同比下降。 作者还报告,中间输出可视化呈现了与人类视觉感知层级性相符的生成过程。这属于作者对可视化的解释,不能据此认定模型已验证对应的神经机制。复现时应重点核对数据划分、检索候选集、重建评价方式、对照方法与参数口径,以及 LaBraM、VQ-VAE 的配置和训练细节;实验协议、消融及统计信息尚未验证,代码与权重可用性亦尚未验证。
值得核对 AVDE 如何将 LaBraM 表征对齐与 next-scale prediction 结合,以及作者报告的检索、重建表现和参数效率能否在相同评估协议下复现。
来源:OpenReview · EEG · openreview.net