跳到正文

算法、任务与模态

Generative Pretraining 最新动态

Generative Pretraining 研究索引;按可核对的标签归档,不以热度评价质量。

21 条精选近 30 天 12 条共收录 23 条

更新

精选归档 · 第 2 页

1月1日周一第 21–21 条
  1. OpenReview · State space models70

    SSAMBA:基于 Mamba 状态空间模型的自监督音频表征学习

    基于摘要分析。本文研究音频表征学习中 Transformer 的计算与显存开销问题,提出 Self-Supervised Audio Mamba(SSAMBA),以双向 Mamba 构建无注意力机制的状态空间模型,并结合判别与生成目标进行自监督预训练。研究对象是音频,而非 EEG 或 BCI。 核心机制是利用双向 Mamba 捕获音频模式,并从大规模无标签数据中学习表征。作者将 SSAMBA 描述为首个自监督、无注意力且基于状态空间模型的音频表征模型;该首创性表述尚未独立核验。摘要未给出输入表征、双向信息融合方式、判别与生成目标的具体损失形式,也未说明是否采用掩码建模。 作者报告,在音频分类、keyword spotting 和 speaker identification 等任务中,SSAMBA 在多数任务上优于 Self-Supervised Audio Spectrogram Transformer(SSAST),但摘要未列出各任务的数据集、划分及性能指标。效率方面,作者报告,在 tiny 模型规模、输入 token 数为 22k 的条件下,相比 SSAST,批量推理速度约快 92.7%,显存使用效率改善约 95.4%。这些数值仅对应上述模型与输入条件;硬件、批大小、计时方式及显存统计口径尚未验证,不能直接推广至其他规模或实时流式场景。实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可迁移假设是,状态空间序列建模可能缓解长时段 EEG 表征学习的计算开销,自监督双目标可能利用未标注 EEG;这不意味着音频中的收益已在 BCI 成立。可复用的是 Mamba 主干与预训练思路,需改造音频输入编码、通道组织及训练目标。EEG 的低信噪比、跨被试差异、通道变化和较小训练规模可能使收益减弱;双向建模还需核对是否满足在线因果推理要求。一个可检验的小实验是在固定 EEG 数据划分、输入长度和训练预算下,对比 Mamba 与 Transformer 主干的跨被试任务性能、推理时间及峰值显存,再检验双目标预训练的增益。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对双向 Mamba 与判别、生成双目标预训练在音频表征中的作用,尤其是相对 SSAST 的长输入推理效率;其对 EEG 的价值尚未验证。