SSAMBA:基于 Mamba 状态空间模型的自监督音频表征学习
SSAMBA: Self-Supervised Audio Representation Learning with Mamba State Space Model
基于摘要分析。该研究针对 Transformer 音频表征学习中随序列长度增长的计算与显存开销,提出 Self-Supervised Audio Mamba(SSAMBA),以双向 Mamba 和自监督预训练学习音频表征;主要研究对象是音频处理,而非 EEG 或 BCI。 机制方面,SSAMBA 使用不依赖注意力的状态空间模型,通过双向 Mamba 捕获音频模式,并联合优化判别与生成目标,利用大规模无标签数据预训练。作者将其描述为首个自监督、无注意力且基于状态空间模型的音频表征模型;这一优先性声明尚未独立核实。摘要未提供输入表征、目标函数形式、预训练数据规模及双向信息融合方式。 作者报告,在音频分类、关键词检测、说话人识别和情绪识别等评估任务中,SSAMBA 在多数任务上优于 Self-Supervised Audio Spectrogram Transformer(SSAST),但摘要未列出各任务的数据集、划分及具体指标。效率方面,作者报告,在 tiny 模型规格、输入 token 数为 22k 的条件下,相比 SSAST,批量推理速度约快 92.7%,显存效率约高 95.4%。这些表述不能直接换算为推理时间或显存占用下降同等百分比;硬件、批量大小、计时方式及显存测量口径尚未验证。 平台推测(待验证):假设 EEG 能被组织为保留时间与通道结构的长序列,该方法的状态空间骨干和联合自监督预训练思路可能用于探索长时程 EEG 表征的效率瓶颈。可复用的是序列建模与训练框架,需改造输入编码、通道关系建模和适合 EEG 的预训练目标。音频中的有效性不等于 BCI 有效性;低信噪比、跨被试差异、通道配置变化和小规模数据可能削弱迁移效果,双向处理也需核对是否符合在线任务的因果约束。可检验的小实验是在固定 EEG 数据划分及预训练预算下,对比 Mamba 与 Transformer 骨干的跨被试任务指标、峰值显存和推理延迟,不直接套用原论文效率比例。已有 EEG 相关工作尚未检索确认;全文实验协议、消融、统计信息及复现资源尚未验证。
值得核对 SSAMBA 的双向 Mamba 与判别、生成联合自监督预训练如何兼顾音频表征质量和长序列效率,但其效率测量协议及 EEG 迁移价值尚未验证。
来源:OpenReview · State space models · openreview.net