Mamba-Adaptor:用于视觉识别的状态空间模型适配器
Mamba-Adaptor: State Space Model Adaptor for Visual Recognition
基于摘要分析。本文研究 Mamba 应用于视觉识别时的上下文访问、长程遗忘及空间结构建模问题,提出由 Adaptor-T 与 Adapator-S 两个功能模块组成的 Mamba-Adaptor。主要研究对象是视觉任务中的状态空间模型,而非 EEG 或 BCI。 机制上,Adaptor-T 在 SSM 隐状态计算过程中选择一组可学习位置,将相应特征状态作为记忆增强,以缓解长程遗忘;Adapator-S 使用多尺度空洞卷积核增强输出特征的空间建模,并引入图像归纳偏置。作者认为,两者通过补充原有顺序计算难以访问的特征,扩大上下文建模范围。摘要将相关计算表述为“casual computing”,其确切含义及访问范围需核对正文,不能据此断言具体的因果约束或实现形式。 作者探索三种用法:作为通用视觉骨干网络、作为提升预训练骨干性能的增强模块,以及作为迁移学习中的高效微调模块。作者报告实验支持这三种设置的有效性,并声称在 ImageNet 和 COCO 上达到领先性能;摘要未给出具体任务配置、指标、数值、对照基线或计算成本,因此无法判断性能增益与效率收益的幅度。实验协议、消融及统计信息尚未验证,代码与复现条件也尚未验证。 平台推测(待验证):记忆增强可能对应长序列 EEG 建模中的远距离信息保留瓶颈,但其依赖可学习位置选择,位置含义能否跨被试、跨会话保持稳定仍需评估。空间模块则依赖图像式局部结构,迁移到 EEG 需按电极布局改造,不能直接把通道序列视作图像网格。低信噪比可能使记忆模块保留伪迹,通道差异与小数据训练也可能削弱空间归纳偏置的收益。一个可检验的小实验是在固定的跨被试 EEG 划分下,对同一 Mamba 基线分别加入记忆模块和适配电极布局的空间模块,比较任务指标、计算成本及通道扰动下的稳定性;这只是迁移假设,已有 EEG 相关工作尚未检索确认。
值得核对其记忆增强与空间归纳偏置模块如何改善视觉 Mamba 的序列建模,以及三种使用方式各自的效果与效率证据;摘要中的领先性能主张尚需全文验证。
来源:OpenReview · State space models · openreview.net