跳到正文
OpenReview · State space models· Jie Hui; Zhenxiang Zhang; Wenyu Mi; Jianji Wang·· 2026-01-26精选AI 评分77

使状态空间模型在视觉任务中实现真正的全局感知

Enabling True Global Perception in State Space Models for Visual Tasks

AI 导读

基于摘要分析。该研究针对视觉任务中全局上下文建模缺乏严格数学定义,以及注意力计算成本与状态空间模型(SSMs)递归建模限制之间的矛盾,提出全局图像建模的数学定义和频域理论框架,并据此设计 Global-aware SSM(GSSM)与可嵌入 CNN 的 GMamba 模块。 核心机制是基于 Discrete Fourier Transform(DFT)的调制,在 SSM 前端控制其建模行为,以频域视角处理递归机制对全局感知的限制。作者称已形式化证明 GSSM 满足所提出的全局图像建模定义,并报告其计算复杂度为线性对数级。摘要未给出定义的具体条件、调制形式、训练目标及复杂度所对应的输入规模变量,因此尚不能判断该定义与常见全局感受野或全局信息交互的关系。 作者报告,在目标检测、语义分割和实例分割任务、以及多种模型架构中,GMamba 均优于现有全局建模模块;但摘要未列出数据集、划分、对照模块、评价指标或具体增益,不能据此判断优势幅度及不同协议下的可比性。作者提供了代码链接,代码完整性、运行条件、实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 DFT 调制的全局建模机制能够适配多通道时间序列,它可能用于探索 EEG 长时程信息交互,但视觉结果不等于 BCI 有效。原方法面向图像结构,其监督方式与所需数据规模尚未明确;迁移时需改造时间与通道布局、频域调制及任务输出模块,并核对是否需要双向或完整片段输入。低信噪比、跨被试频谱差异、通道变化及小数据过拟合均可能使收益失效。可在固定 EEG 数据划分与相同训练预算下,对比基础 SSM、加入 GSSM 的版本及移除 DFT 调制的版本,检验任务指标与计算开销,并分别报告被试内和跨被试结果。相关 EEG 工作尚未检索确认。

阅读价值

值得阅读其全局建模的数学定义与 DFT 调制如何改变 SSM 的递归建模限制,但理论证明的适用条件、计算复杂度口径及视觉实验对照尚需全文核对。

来源:OpenReview · State space models · openreview.net