Audio Mamba:用于音频表征学习的双向状态空间模型
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
基于摘要分析。本文研究音频分类是否必须依赖自注意力,提出 Audio Mamba(AuM),以纯状态空间模型(SSM)进行音频表征学习与分类,探索替代 Audio Spectrogram Transformers(ASTs)的技术路线。作者报告,在六个音频基准上,AuM 的表现与成熟 AST 模型相当或更好;摘要未提供基准名称、评估指标、数据划分或具体分数。 核心动机是 AST 的自注意力具有二次扩展成本,而 Mamba 等 SSM 提供了避开该成本的候选机制。标题明确采用双向状态空间模型,摘要将 AuM 描述为不含自注意力、完全基于 SSM 的模型,并声称其为首个此类音频分类模型;这一优先性尚未独立核验。输入表示、双向信息融合方式、网络结构、损失与训练流程,以及实际计算量、显存和推理速度尚未验证。实验协议、消融及统计信息也尚未验证,不能仅凭移除自注意力认定其端到端效率更高。 平台推测(待验证):其跨领域价值在于检验 SSM 能否替代长序列分类中的自注意力,而不是已证实的 EEG 或 BCI 效果。原研究依赖音频分类数据,但摘要未说明表征方式、监督配置及训练规模。若迁移至 EEG,可考虑复用 SSM 序列编码机制,改造输入切分、通道编码与分类输出;低信噪比、跨被试差异、通道布局变化和小样本训练均可能使音频领域结果失效。双向建模还需核对对完整输入窗口的依赖,不能直接视为适用于因果在线解码。 一个可检验的假设是:在固定 EEG 数据划分、预处理和训练预算下,SSM 编码器能以较低资源成本达到与自注意力编码器相当的分类表现。可先在单一 EEG 分类任务上进行匹配对照,分别报告分类指标、显存及延迟,再评估跨被试表现;具体复现仍依赖全文与实现信息。已有 EEG 相关工作尚未检索确认。
值得阅读的具体原因是其以纯 SSM 音频分类模型检验对自注意力的依赖,并提供六个基准上的 AST 对照;性能与计算成本的具体证据仍需全文核对。
来源:OpenReview · State space models · openreview.net