Vision Mamba:基于双向状态空间模型的高效视觉表征学习
Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
基于摘要分析。本文研究如何在不依赖自注意力的情况下构建高效、通用的视觉骨干,提出采用双向 Mamba 模块的 Vim,以位置嵌入标记图像序列,并通过双向状态空间模型压缩视觉表征。主要研究对象是图像分类、目标检测和语义分割,而非 EEG 或 BCI。 机制上,作者针对视觉数据的位置敏感性及全局上下文需求,将位置嵌入与双向序列建模结合,探索纯 SSM 视觉骨干作为视觉 Transformer 的替代方案。摘要未给出图像序列构造方式、双向信息融合细节、损失函数和训练配置,这些实现条件尚未验证。 作者报告,在 ImageNet 分类、COCO 目标检测及 ADE20k 语义分割任务上,Vim 相比 DeiT 等视觉 Transformer 获得更高性能,但摘要未提供各任务的具体指标和对照配置。作者另报告,在分辨率为 1248×1248 的图像上进行批量推理并提取特征时,Vim 相比 DeiT 快 2.8 倍,GPU 显存使用节省 86.8%;该结果属于特定高分辨率特征提取场景,批大小、硬件及模型规格尚未验证,不能直接推广到所有训练或推理条件。实验协议、消融及统计信息尚未验证。 平台推测(待验证):双向 SSM 对长序列的建模机制可能用于离线 EEG 长时间窗表征,以探索全局时序上下文与计算成本之间的权衡,但这是迁移假设。可复用部分是双向序列建模思路;图像序列输入及位置嵌入需改造为适配时间采样和通道布局的表示,监督方式与所需训练规模仍需评估。低信噪比、跨被试分布差异、通道变化和小数据训练可能使视觉领域优势无法成立;双向上下文也不能未经改造用于严格因果的在线 BCI。可检验的小实验是在固定 EEG 数据划分和训练预算下,对比双向 SSM 与自注意力骨干,分别记录 Cross-subject 分类指标、推理延迟和峰值显存,并核对位置编码及双向建模的作用。已有 EEG 相关工作尚未检索确认。
值得阅读其位置编码与双向状态空间建模如何兼顾视觉全局上下文和高分辨率推理效率,但摘要中的优势限于视觉任务,不能直接视为 EEG/BCI 有效性的证据。
来源:OpenReview · State space models · openreview.net