跳到正文
OpenReview · State space models·· 21 天前精选AI 评分78

并行循环视觉:谱卷积状态空间模型

Recurrent Vision in Parallel: Spectral Convolutional State Space Models

AI 导读

基于摘要分析。研究针对视觉循环计算难以在 GPU 上高效并行、而前馈网络表达复杂时空结构可能需要扩大模型的问题,提出 spectral convolutional state space models(sCSSMs),以可并行的状态空间模型实现卷积循环。 核心机制是将卷积循环映射到频域,使卷积的复合转化为逐点乘法;作者据此提出线性时间扩展的计算方案,并将 sCSSMs 定位为可与 Mamba、Gated Delta Networks 等 SSM 计算模块组合的组件。线性复杂度对应的变量、边界条件、离散化方式以及实际训练和推理效率尚未验证,不能直接等同于端到端加速。 作者报告:在摘要未具名的视觉推理挑战上,单层 sCSSM 的准确率可与人类表现相媲美,并复现人类在这些任务中的时间—准确率权衡;摘要同时称 transformers 在这些挑战上失败,但任务定义、对照配置与具体指标尚未验证。作者还描述了在 ImageNet-1K 上替换 self-attention,以及作为视频生成模型 LoRA adapter 的应用,并报告在 VideoPhy-2 上以更少参数优于 Standard 和 Transformer 基线。摘要未提供具体分数、参数量、数据划分或指标,不能据此比较不同任务的收益;实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,频域卷积循环可能为 EEG 的时空依赖建模提供可并行模块,但视觉领域的结果不等于 BCI 有效。可尝试复用谱域循环计算,需改造 EEG 输入映射及通道组织方式,并核对其卷积结构是否适合不规则电极布局。低信噪比、跨被试差异、通道缺失及小样本可能削弱收益。一个可检验的小实验是在固定 Cross-subject 划分、预处理与参数预算下,比较 sCSSM 与原 SSM 模块的任务指标、训练耗时及通道扰动鲁棒性。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其将卷积循环转化为频域并行计算的机制,以及视觉推理与视频生成中的参数效率证据;向 EEG 时空建模迁移的价值尚未验证。

来源:OpenReview · State space models · openreview.net