SSAMBA:基于 Mamba 状态空间模型的自监督音频表征学习
SSAMBA: Self-Supervised Audio Representation Learning With Mamba State Space Model
基于摘要分析。本文研究音频表征学习中 Transformer 的计算与显存开销,提出 Self-Supervised Audio Mamba(SSAMBA),以不依赖注意力的状态空间模型进行自监督音频表征学习。其主要研究对象是音频,而非 EEG 或 BCI。 机制上,SSAMBA 使用双向 Mamba 捕获音频模式,并在大规模无标注数据上联合优化判别与生成目标。摘要未给出输入表征、目标的具体形式、训练规模及双向信息融合方式,这些实现细节尚未验证。作者将其称为首个自监督、无注意力且基于 SSM 的音频表征模型,该优先性声明尚未独立核实。 作者报告,在音频分类、keyword spotting、speaker identification 和 emotion recognition 等任务中,SSAMBA 在多数任务上优于 Self-Supervised Audio Spectrogram Transformer(SSAST),但摘要未提供各任务数据集、划分及具体指标。效率方面,作者报告在 tiny 模型规模、输入 token 数为 22k 的批量推理条件下,相比 SSAST,推理速度约快 92.7%,显存效率提高 95.4%;计量定义、硬件、批大小及两者配置尚未验证,不能将这些比例直接解释为延迟或显存占用的同幅度下降。材料提供了代码地址,但代码内容、实验协议、消融及统计信息尚未验证。 平台推测(待验证):其机制可作为长序列 EEG 自监督表征学习的候选方案,假设双向状态空间建模能缓解长输入的资源开销,联合目标能利用无标注信号。可复用部分是序列建模与联合预训练思路;需改造音频输入编码、EEG 通道组织和预训练目标。音频预训练所依赖的数据结构与规模未必适合 EEG,低信噪比、跨被试差异、通道不一致和小数据可能使收益消失;双向处理也需与在线因果推理要求区分。可在固定 EEG 数据划分、输入长度和训练预算下,对照 Mamba 与 Transformer 编码器,比较跨被试任务表现、推理耗时及峰值显存,以检验效率收益是否伴随性能损失。已有 EEG 相关工作尚未检索确认。
值得核对双向 Mamba 与判别、生成联合自监督目标的实现,以及长输入下相对 SSAST 的效率对照;其对 EEG 表征学习的价值尚未验证。
来源:OpenReview · State space models · openreview.net