Deformba:具有自适应状态融合的视觉状态空间模型
Deformba: Vision State Space Model with Adaptive State Fusion
基于摘要分析。Deformba 针对视觉 State Space Models(SSMs)依赖人工固定扫描方式、以及难以支持不同信息流之间基于查询的交互这两个问题,提出上下文自适应方法,动态增强空间结构信息,并支持类似 cross attention 的多模态融合。作者报告,该方法保持 SSM 的线性复杂度,在多类 2D 与 3D 视觉感知任务中取得较强表现。 机制与贡献:摘要指出,固定扫描将图像块展平为序列时会引入预设几何结构;面向一维序列的 SSM 又具有因果性与自指式建模特征,限制跨信息流交互。Deformba 的贡献在于同时处理空间结构适应与信息融合,后者面向多视角 3D 融合等需求。摘要未说明自适应状态融合的具体运算、查询构造、训练目标,以及线性复杂度对应的输入规模与成立条件,这些均尚未验证;也不能据此将其等同于标准 cross attention。 评估证据:作者报告测试覆盖 image classification、object detection、instance segmentation、semantic segmentation,以及 BEV perception。摘要未提供数据集、数据划分、对照基线、评价指标或具体数值,因此目前只能确认作者声称具备跨任务适用性,不能判断性能优势的幅度。实验协议、消融及统计信息尚未验证,复现所需实现与配置也有待核对。 平台推测(待验证):假设其自适应空间机制能从图像结构推广到电极拓扑,跨信息流融合机制可能用于 EEG 的通道空间建模或 EEG 与其他模态的交互;这不等于已有 BCI 效果。可复用候选是 SSM 序列建模与融合机制,需改造输入表征、空间坐标及查询定义。其对监督形式和训练规模的依赖尚不清楚;EEG 低信噪比、跨被试差异、通道变化与小数据可能导致空间适应不稳定或过拟合。待实现细节明确后,可在同一 MI 数据集、固定 Cross-subject 划分下,对比固定空间编码与自适应融合,控制训练预算并考察通道扰动后的表现,以检验该假设。相关 EEG 工作尚未检索确认。
值得阅读其如何在保持 SSM 线性复杂度的同时引入上下文自适应空间信息与跨信息流融合,但具体实现、复杂度条件及相对基线收益尚需全文核对。
来源:OpenReview · State space models · openreview.net