MambaMixer:具有 token 与通道双重选择机制的高效选择性状态空间模型
MambaMixer: Efficient Selective State Space Models with Dual Token and Channel Selection
基于摘要分析。本文研究选择性状态空间模型在视觉建模中如何同时选择和混合 token 与特征通道信息,提出 MambaMixer 及其高效变体 QSMixer,并构建 Vision MambaMixer(ViM2)与 Vision QSMixer(ViQS)作为概念验证;主要研究对象是图像任务,而非 EEG 或 BCI。 机制上,作者指出 Transformer 注意力的时间与空间开销随输入长度呈二次增长,而选择性状态空间模型虽适合长因果序列建模,仍存在过滤无关通道和捕获通道间依赖的困难。MambaMixer 使用数据依赖权重,通过 Selective Token and Channel Mixer 在 token 与通道两个维度实施选择。为缓解通道混合可能带来的参数开销,作者提出基于 quasi-separable kernels 的非因果 S6 启发式方案及硬件友好实现;QSMixer 则沿序列和嵌入维度混合信息。视觉架构另引入 Switch of Scans(SoS),动态采用一组图像扫描路径遍历图像块,以增强空间信息建模。 作者报告,在图像分类、分割和目标检测任务中,所提方法相对成熟视觉模型具有竞争力,相对 SSM 类模型表现更优,并据此强调同时选择性混合 token 与通道的重要性。摘要未给出数据集、划分、具体基线、指标数值及计算成本,无法量化性能或效率收益;实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设时间 token 与特征通道的双重选择能用于 EEG 长序列建模,可考察其是否有助于过滤无关特征并建模跨通道依赖。但原文的嵌入通道不能直接等同于 EEG 电极,需要改造输入映射并明确电极空间关系;非因果模块适用于离线分析的可能性也不能直接外推至在线 BCI。低信噪比、跨被试差异、通道配置变化及小数据条件可能使选择权重不稳定。一个可检验的小实验是在固定 EEG 任务、相同 Cross-subject 划分和训练预算下,对比仅 token 混合与双重混合,并施加通道遮蔽,核对预先选定的任务指标与计算成本。已有 EEG 相关工作尚未检索确认。
值得核对其双重选择机制如何建模 token 与特征通道依赖,以及非因果准可分离核的效率依据;摘要中的验证限于视觉任务,EEG 迁移价值尚未验证。
来源:OpenReview · State space models · openreview.net