跳到正文
OpenReview · State space models· Chaodong Xiao; Minghan Li; Zhengqiang ZHANG; Deyu Meng; Lei Zhang·· 2025-01-23精选AI 评分77

Spatial-Mamba:通过结构感知状态融合构建有效的视觉状态空间模型

Spatial-Mamba: Effective Visual State Space Models via Structure-Aware State Fusion

AI 导读

基于摘要分析。Spatial-Mamba 研究二维视觉任务中的空间结构建模问题:现有视觉状态空间模型(SSMs)通常将图像转成一维序列,并用不同扫描路径补充局部空间依赖,但可能难以充分表达复杂空间结构,同时增加扫描成本。该方法通过在状态空间中直接建立邻域连接,将序列状态计算与空间上下文融合结合起来。 核心机制分为三个阶段:通过单向扫描计算初始状态;利用结构感知状态融合获取空间上下文,其中空洞卷积用于捕获图像空间结构依赖;通过观测方程完成最终状态计算。其区别于主要依靠扫描路径组织空间信息的方法,关键在于显式融合邻域状态,而非仅依赖顺序状态转移。作者报告,理论分析将 Spatial-Mamba、原始 Mamba 与 linear attention 纳入同一矩阵乘法框架;具体等价条件与推导范围尚需正文核验。 作者报告,在图像分类、检测和分割实验中,Spatial-Mamba 即使仅使用一次扫描,也达到或超过所比较的先进 SSM 模型。摘要未提供数据集、划分、指标数值、对照配置或计算成本实测,不能据此量化优势;实验协议、消融及统计信息尚未验证。摘要提供了源码与训练模型入口,但实现细节、训练配置及权重可用性尚未核验。 平台推测(待验证):该机制可能对应 EEG 中时间依赖与通道空间关系难以同时建模的瓶颈,但原论文研究对象是二维图像,并未提供 EEG/BCI 证据。其迁移假设依赖可定义且跨记录一致的通道邻域;可考虑复用状态计算与融合思路,将图像空洞卷积改造成适配电极布局的邻域操作,而不能直接把通道排列当作规则图像网格。低信噪比可能使邻域融合传播噪声,跨被试差异、通道缺失及小数据规模也可能削弱收益。一个可证伪的小实验是在固定 EEG 数据划分、训练预算与通道布局下,比较单向 SSM、加入真实电极邻域融合及打乱邻域的版本,检验收益是否确由空间结构带来,并分别报告被试内与跨被试结果。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其在状态空间中直接建立邻域连接的机制及统一矩阵乘法分析,但摘要所述视觉任务优势与向 EEG 的迁移价值仍需分别核验。

来源:OpenReview · State space models · openreview.net