跳到正文
OpenReview · State space models· Yunxiang Fu; Meng Lou; Yizhou Yu·· 2025-02-27精选AI 评分77

SegMAN:利用状态空间模型与局部注意力进行语义分割的全尺度上下文建模

SegMAN: Omni-scale Context Modeling with State Space Models and Local Attention for Semantic Segmentation

AI 导读

基于摘要分析。SegMAN 研究图像语义分割中全局上下文建模、局部细节编码与多尺度特征提取难以同时兼顾的问题,提出由混合特征编码器和基于状态空间模型的解码器组成的线性时间模型,面向不同输入分辨率构建上下文表征。 核心机制是:SegMAN Encoder 将滑动局部注意力与动态状态空间模型结合,分别支持细粒度局部信息保留和高效全局上下文建模;解码器中的多尺度上下文模块进一步提取不同尺度的特征,并随输入分辨率自适应调整。摘要未提供状态更新、扫描方式、模块具体结构、损失函数及训练配置,相关实现尚未验证。 作者报告在 ADE20K、Cityscapes 和 COCO-Stuff 上进行评估:SegMAN-B 在 ADE20K 上达到 52.6% mIoU,相比 SegNeXt-L 取得更高 mIoU,并减少超过 15% 的 GFLOPs;在 Cityscapes 上达到 83.8% mIoU,优于 SegFormer-B3,GFLOPs 约为其一半;在 COCO-Stuff 上也报告优于 VWFormer-B3,且 GFLOPs 更低。上述结果均属于各自数据集上的作者比较,具体划分、输入分辨率、预训练及推理设置尚未验证,不能据此进行跨数据集性能比较。实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,局部注意力与状态空间模型的组合可能对应 EEG 中短时波形细节和长时依赖的联合建模,多尺度模块可能用于不同时间跨度的特征提取。原方法依赖图像空间结构与语义分割监督,迁移时需重设时间轴、通道关系、输入表征和任务输出,不能直接沿用图像邻域。低信噪比、小样本及跨被试变化可能削弱动态状态建模的收益,通道邻接也未必等同于图像邻接。可检验的小实验是在固定 EEG 数据划分和训练预算下,对比局部注意力、状态空间模型及二者组合,分别评估被试内与跨被试表现及计算成本;这只是迁移验证建议,已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的是 SegMAN 将动态状态空间模型、滑动局部注意力与多尺度解码结合,以兼顾语义分割的全局上下文、局部细节和计算效率;其向 EEG 建模的迁移价值尚未验证。

来源:OpenReview · State space models · openreview.net