VSSD:采用非因果状态空间对偶的 Vision Mamba
VSSD: Vision Mamba with Non-Casual State Space Duality
基于摘要分析。本文研究计算机视觉中的长序列建模,针对 SSD/SSM 的因果性与非因果视觉任务之间的限制,提出 Visual State Space Duality(VSSD),以非因果形式的 SSD 支持图像分类、检测与分割。 核心机制是舍弃隐藏状态与 token 交互的绝对幅值,同时保留相对权重,以减轻 token 贡献对先前 token 的依赖;再结合多扫描策略,整合扫描结果以实现非因果建模。摘要将 SSD 描述为 Mamba2 中用于改善性能与效率的 SSM 变体,但未给出 VSSD 的具体公式、扫描方式、网络结构或训练配置,尚不能判断其归一化实现与计算复杂度细节。 作者报告,VSSD 在图像分类、检测和分割的多个基准上超过现有 SSM 类最先进模型,并改善视觉任务性能与效率。摘要未提供基准名称、数据划分、具体指标、数值及效率测量条件,因此不能量化优势,也不能据此推断其优于所有视觉模型。实验协议、消融及统计信息尚未验证。摘要声明代码与权重已公开,其可运行性和复现配置尚未核验。 平台推测(待验证):假设该相对权重机制可用于离线 EEG 长序列建模,其可能对应因果扫描带来的顺序依赖问题;可考虑复用 SSD 交互与多扫描整合模块,但需重新设计 EEG 时间与通道的 token 化及扫描顺序。原研究依赖图像 token,具体监督、数据规模与训练要求尚未验证。EEG 的低信噪比、跨被试差异和小数据条件可能使相对权重不稳定,舍弃幅值也可能损失有用信息;非因果处理还不能直接用于严格实时解码。可检验的小实验是在固定 EEG 数据划分、训练预算和分类头下,对比因果 SSD 与非因果改造版本,并消融相对权重处理和多扫描,检验任务指标及推理开销。该实验仅为迁移假设,已有 EEG 相关工作尚未检索确认。
值得核对其通过相对交互权重与多扫描整合实现非因果 SSD 的机制及效率对照;作者报告的视觉任务优势尚不能视为 EEG/BCI 有效性的证据。
来源:OpenReview · State space models · openreview.net