DASS:经蒸馏的音频状态空间模型是更强且更具时长可扩展性的学习模型
DASS: Distilled Audio State Space Models are Stronger and More Duration-Scalable Learners
基于摘要分析。本文研究音频状态空间模型(SSMs)在短音频标注中落后于 Transformer、以及长音频实际性能尚未充分评估的问题。作者通过知识蒸馏训练 Knowledge Distilled Audio SSM(DASS),并提出 Audio Needle In A Haystack(Audio NIAH)测试,分别检验音频标注性能与长录音中的声音事件检索能力;主要研究对象是音频,而非 EEG 或 BCI。 机制与对照:研究利用 SSM 处理长输入的计算效率,并以知识蒸馏增强其音频建模能力。摘要将 Audio Spectrogram Transformer(AST)作为 Transformer 对照,但未说明蒸馏教师、监督信号、损失形式、输入表征及具体模型结构,这些实现细节尚未验证。 作者报告,DASS 在 AudioSet 上达到 mAP 47.6,并优于所比较的 Transformer 模型;具体数据划分、对照配置及统计信息尚未验证。作者另报告,仅用 10 秒音频片段训练的 DASS,能够在最长 2.5 小时的录音中检索声音事件,而 AST 在输入仅为 50 秒时即失败。该结果属于 Audio NIAH 测试,不能与 AudioSet 标注指标直接比较;事件插入方式、检索成功标准及长输入适配条件需查阅正文核对。 平台推测(待验证):若将短片段训练后的长序列事件检索作为 EEG 研究问题,可考察 SSM 与蒸馏是否缓解长时记录的计算负担。可复用的是序列建模与蒸馏思路;音频输入表征、教师和任务监督需改造为适合多通道 EEG 的形式。低信噪比、跨被试差异、通道变化及小数据下教师误差可能使迁移失败。一个可证伪的小实验是:固定被试划分与短片段训练条件,在带事件标注的 EEG 测试记录中逐步增加背景长度,对比蒸馏 SSM、未蒸馏 SSM 与 Transformer 的事件检索性能及计算开销。此方案不是本文已验证结果,相关 EEG 工作尚未检索确认。完整实验协议、消融及复现条件仍需正文核验。
值得阅读的是知识蒸馏增强 Audio SSM 与 Audio NIAH 长时音频检索测试的结合,可用于考察短片段训练后的时长扩展能力,但其 EEG/BCI 适用性尚未验证。
来源:OpenReview · State space models · openreview.net