Mamba YOLO:基于状态空间模型的目标检测简单基线
Mamba YOLO: A Simple Baseline for Object Detection with State Space Model
基于摘要分析。本文研究实时图像目标检测中全局依赖建模与计算开销的矛盾,提出 Mamba YOLO,以状态空间模型(SSM)构建 ODMamba 骨干,并通过宏观结构设计和 RG Block 补偿局部图像依赖建模能力。其主要研究对象是视觉目标检测,而非 EEG 解码或 BCI。 核心机制方面,作者以线性复杂度的 SSM 替代自注意力的二次复杂度建模,并称 ODMamba 可无需预训练直接训练。面向实时需求,作者设计了骨干的阶段比例与缩放规模;RG Block 则采用多分支结构建模通道维度,以缓解 SSM 可能存在的感受野不足与图像定位能力较弱的问题。具体状态更新、分支运算、损失函数和训练配置尚未验证。 结果方面,作者报告在公开 COCO benchmark 上,相较既有方法达到最先进性能;其中 tiny 版本的 mAP 提升为原文所述“7.5%”,在单张 4090 GPU 上推理时间为 1.5 ms。摘要未明确该增益的对照模型、相对百分比或百分点口径,也未说明 mAP 定义、数据划分、输入分辨率、批大小及计时范围,因此不能据此直接比较其他检测器的精度或速度。实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,SSM 的序列建模与局部依赖补偿可能用于 EEG 长时序解码,但原方法依赖图像空间结构、目标检测监督及 COCO 训练规模,原领域有效不等于 BCI 有效。可探索复用序列建模模块,需重做 EEG 时序输入、空间通道组织和任务输出;视觉特征通道与电极通道不能直接等同。低信噪比、跨被试变化、通道缺失及小数据训练都可能削弱收益。一个可证伪的小实验是在固定跨被试划分的 EEG 任务上,以相同训练预算比较基础 SSM 与加入局部依赖模块的版本,核对解码指标及同一硬件、同一批大小下的延迟。已有 EEG 相关工作尚未检索确认。
值得核对 ODMamba 的线性复杂度建模与 RG Block 的局部依赖补偿是否兼顾检测精度和实时性,但摘要中的 mAP 增益口径及延迟测试协议尚未验证,不能据此认定其适用于 EEG/BCI。
来源:OpenReview · State space models · openreview.net