何处、何时及何种内容对齐:以检索为依据的 EEG–ViT 对齐图谱
Where, When, and What Aligns: A Retrieval-Grounded Atlas of EEG–ViT Alignment
基于摘要分析。本文研究 EEG 与预训练 ViT 在空间、时间及网络计算层面的对齐关系,以端到端 200-way 图像检索构建多维对齐图谱,并据此配置 EEG-to-image 解码器。其贡献是将表征对齐分析与实际检索表现联系起来,而非仅讨论抽象的表征相似性。
阅读价值 · 值得核对其以端到端检索统一比较 EEG–ViT 对齐位置、时序与表征读出方式的评估框架,尤其是粗粒度 token 池化和残差流分析能否稳定指导解码器简化。
首次公开 2026-09-19 · 最新源版本 2026-10-05 · 首次发现 2026-10-09
展开技术分析、元数据与版本记录
基于摘要分析。本文研究 EEG 与预训练 ViT 在空间、时间及网络计算层面的对齐关系,以端到端 200-way 图像检索构建多维对齐图谱,并据此配置 EEG-to-image 解码器。其贡献是将表征对齐分析与实际检索表现联系起来,而非仅讨论抽象的表征相似性。 作者分析了涵盖对比学习、有监督学习、自蒸馏和重建训练的 21 个视觉模型,在 THINGS-EEG2 全部 10 名被试上评估约 21,000 个探测单元;测试包含分别平均 N=1、4、80 次重复试次的三种条件。比较维度包括头皮位置、EEG 时间、网络深度、子层计算、token 读出和训练目标。作者称各项结论均由逐被试符号检验支持;训练与测试划分、探测器形式及多重比较处理尚未验证。 作者报告,在 10/10 名被试中,网络块 0–11 的最佳对齐时刻随深度从 177 ms 推迟至 201 ms,并与头皮后部到前部的潜伏期梯度对应。对于中层对齐峰值,作者提出机制解释:早期计算将 EEG 可见内容写入残差流,中层残差流整合这些内容,后期计算的对齐减弱,而残差流仍保留此前写入的信息。这一解释的具体测量与对照需全文核对。 作者将共享信息解释为粗空间尺度的低层视觉结构,而非细粒度语义:对齐主要由早期视觉皮层上方电极承载,在网络约三分之一至二分之一深度达到峰值;掩码自编码训练下峰值更深,像素重建目标下晚层表现不同。作者报告,2×2 至 4×4 的 token 网格池化较全局读出提高 6–22 个百分点;该差值对应的具体模型、指标定义及重复试次条件尚未验证。 作者进一步报告,将五模型融合流水线简化为八电极、单骨干配置后,表现超过已发表的最先进结果;四状态融合链达到 97.5% 的 final-epoch Accuracy,并取得超过 22% 的单试次 Accuracy。摘要未明确这些结果各自的数据划分、平均重复次数及基线匹配条件,不能跨协议直接比较。复现还需核对电极与模型选择是否独立于测试评估、融合与训练流程、统计不确定性,以及代码和权重可用性;实验协议、消融及统计信息尚未验证。
- 作者:
- 未提供/匿名
- 机构:
- 尚未验证
- 发表平台:
- ICLR 2027 Conference Submission
- 标识:
- ZnmKIkOjhD
学术质量 82 / 100 · 兴趣权重 1 · 按原研究证据理解,不推断适用范围
- openreview · 元数据快照 · 2026-10-05 · 预印本