跳到正文
OpenReview · State space models·· 2024-04-22精选AI 评分71

Audio Mamba:用于音频表征学习的双向状态空间模型

Audio Mamba: Bidirectional State Space Model for Audio Representation Learning

AI 导读

基于摘要分析。本文研究音频分类是否必须依赖自注意力,提出 Audio Mamba(AuM),探索以纯状态空间模型(SSM)进行音频表征学习与分类,以避开 Audio Spectrogram Transformers(ASTs)中自注意力的二次复杂度开销。 核心方法是用 SSM 而非自注意力构建音频分类模型;标题明确其采用双向状态空间模型,但摘要未说明双向信息如何融合、音频输入如何表示,以及训练目标与推理实现。作者将 AuM 描述为首个不含自注意力、完全基于 SSM 的音频分类模型,此优先性主张尚未独立核实。避免二次自注意力开销是研究动机,不能据此直接认定实际运行速度或显存占用优于 AST。 作者报告,在涵盖六个不同基准的音频数据集评估中,AuM 相较成熟 AST 模型取得相当或更好的表现。摘要未给出基准名称、指标、具体分数、数据划分或对照配置,因而不能量化优势;实验协议、消融及统计信息尚未验证。复现还需核对模型配置、预训练条件、计算预算及代码可用性。 平台推测(待验证):若 SSM 能在较低计算成本下保留长序列中的分类信息,其机制可能对应 EEG 长时序建模的计算瓶颈,但音频结果不等于 BCI 有效性。可考虑复用 SSM 序列编码器,需针对 EEG 改造输入分块、通道表示与分类输出;原研究所依赖的数据规模和监督设置尚未明确。低信噪比、跨被试分布差异、通道配置变化及小数据训练均可能使迁移失效。一个可检验的小实验是在固定 EEG 数据划分与相同训练预算下,对比 SSM 与自注意力编码器的分类表现、运行时间及显存占用,分别报告被试内与跨被试结果。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其以纯 SSM 替代音频分类自注意力的机制与对照实验,但摘要仅支持作者报告的性能概述,计算效率及向 EEG 迁移的有效性尚未验证。

来源:OpenReview · State space models · openreview.net