跳到正文
OpenReview · State space models· Yunxiang Fu; Meng Lou; Yizhou Yu·· 2024-01-01精选AI 评分77

SegMAN:结合状态空间模型与局部注意力的语义分割全尺度上下文建模

SegMAN: Omni-scale Context Modeling with State Space Models and Local Attention for Semantic Segmentation

AI 导读

基于摘要分析。SegMAN 面向图像语义分割,旨在同时实现高效全局上下文建模、精细局部细节编码和适应不同输入分辨率的多尺度特征提取。其贡献是组合混合特征编码器与基于状态空间模型的解码器,而非直接提出 EEG 或 BCI 方法。 机制方面,SegMAN Encoder 将滑动局部注意力与动态状态空间模型结合,分别支撑局部细节保留与全局上下文建模;解码器中的 MMSCopE 模块用于增强多尺度上下文特征提取,并随输入分辨率自适应调整。作者将整体描述为线性时间模型,但具体扫描方式、模块结构、损失函数及训练流程尚未验证。 作者报告,在 ADE20K 上,SegMAN-B 达到 52.6% mIoU,相较 SegNeXt-L 的 GFLOPs 降低超过 15%;在 Cityscapes 上达到 83.8% mIoU,GFLOPs 约为 SegFormer-B3 的一半;在 COCO-Stuff 上,相较 VWFormer-B3 获得更高 mIoU 和更低 GFLOPs。摘要未提供具体数据划分、输入分辨率、预训练设置及推理协议,因此这些比较仅应理解为作者报告的各数据集结果,不能跨协议直接比较。实验协议、消融及统计信息尚未验证。 平台推测(待验证):局部注意力与状态空间模型的组合,可能对应 EEG 中短时波形细节与长时依赖难以兼顾的瓶颈。该假设依赖将图像空间结构改为时间轴及通道结构,并重新定义局部窗口与多尺度模块;低信噪比、通道布局差异、跨被试变化和小数据训练可能削弱效果。可在固定 Cross-subject 划分和训练预算下,对比仅局部注意力、仅状态空间模型及两者组合,检验性能与计算成本是否同步改善。原摘要未提供 EEG 验证,相关工作尚未检索确认。

阅读价值

值得核对 SegMAN 如何组合局部注意力、动态状态空间模型与多尺度解码,以平衡语义分割精度和计算量;其对 EEG/BCI 的适用性尚未验证。

来源:OpenReview · State space models · openreview.net