跳到正文
OpenReview · State space models· Meng Lou; Yunxiang Fu; Yizhou Yu·· 2025-01-01精选AI 评分76

A2Mamba:用于视觉识别的注意力增强状态空间模型

A2Mamba: Attention-augmented State Space Models for Visual Recognition

AI 导读

基于摘要分析。该研究面向视觉识别,针对已有 Transformer–Mamba 混合架构主要依靠层堆叠、缺乏模块交互的问题,提出 A2Mamba,通过注意力增强状态空间模型实现局部细节与全局上下文的更深度融合。 核心 token mixer 为 Multi-scale Attention-augmented State Space Model(MASS),将多尺度注意力图融入 attention-augmented SSM(A2SSM)。其关键步骤是一种 cross-attention 变体:利用多尺度注意力图对 SSM 隐状态进行空间聚合。作者认为,这可加强二维空间依赖并改善 SSM 的动态建模能力。摘要未提供注意力图生成方式、扫描顺序、具体网络配置或训练损失,尚不能据此确定实现细节。 作者报告,A2Mamba-L 在 ImageNet-1K 上达到 86.1% top-1 Accuracy;在语义分割中,A2Mamba-B 相比 CAFormer-S36 的 mIoU 提升原文记为 2.5%,并具有更高效率,但摘要未明确该差值是相对百分比还是百分点,也未提供效率指标。在采用 Cascade Mask R-CNN 的目标检测与实例分割中,作者报告 A2Mamba-S 相比 MambaVision-B 的 AP^b/AP^m 提升原文分别记为 1.2%/0.9%,参数量减少 40%。后两类任务的数据集、训练和评估协议,以及 AP 差值口径尚未验证。作者还声称优于此前 ConvNet、Transformer 和 Mamba 架构,但这一广泛结论需结合全文比较范围核对。摘要提供了公开代码地址;代码完整性、实验协议、消融及统计信息尚未验证。 平台推测(待验证):可检验的迁移假设是,注意力聚合 SSM 隐状态或可用于 EEG 的跨通道与跨时间信息融合,但原方法依赖视觉二维空间结构,不能直接视为 BCI 方法。可复用隐状态聚合思路,需改造通道与时间 token 布局、多尺度注意力及位置表示;低信噪比、跨被试差异、通道配置变化和小数据可能使注意力捕获伪相关。一个小规模检验是在固定 EEG 数据划分与训练预算下,对比纯 SSM、注意力与 SSM 简单堆叠、注意力增强隐状态聚合,并单独评估跨被试表现。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对的是 A2Mamba 用多尺度注意力聚合 SSM 隐状态的交互机制,而非仅堆叠两类模块;其视觉任务收益由作者报告,对 EEG 的适用性尚未验证。

来源:OpenReview · State space models · openreview.net