跳到正文
OpenReview · State space models· Yang Xiao; Rohan Kumar Das·· 2024-12-31精选AI 评分70

XLSR-Mamba:用于语音欺骗攻击检测的双列双向状态空间模型

XLSR-Mamba: A Dual-Column Bidirectional State Space Model for Spoofing Attack Detection

AI 导读

基于摘要分析。该研究面向语音欺骗攻击检测,旨在降低 Transformer 自注意力的计算开销,并缓解 Mamba 在有限标注数据下的性能问题。作者提出 XLSR-Mamba,将双列架构的 Mamba 与预训练 wav2vec 2.0 所提供的自监督学习表征结合,用于识别伪造语音中的伪迹。 机制上,作者认为选择性状态空间模型 Mamba 适合处理长序列,从而捕捉伪造语音信号中的异常特征;预训练表征则用于缓解对任务标注数据的依赖。标题明确包含双向设计,但摘要未说明双列之间的连接、双向信息的融合方式、损失函数,以及 wav2vec 2.0 是否冻结或联合微调,这些细节尚未验证。 作者报告,在 ASVspoof 2021 LA 和 DF 数据集上,该方法取得有竞争力的结果并实现更快推理;在 In-the-Wild 数据集上,作者将其描述为最有优势的候选方法。摘要未提供指标数值、对照基线、数据划分或推理计时条件,因此不能据此量化优势,也不能将不同数据集上的结果直接比较。实验协议、消融及统计信息尚未验证。作者提供了公开代码地址,但代码内容及复现条件尚未核验。 平台推测(待验证):可检验的迁移假设是,预训练表征与长序列状态空间建模的组合可能有助于有限标注的 EEG 分类,但语音欺骗检测有效不等于 BCI 有效。可复用的是状态空间序列建模及双列双向设计思路;语音预训练前端则需替换为适合 EEG 多通道结构的表征模块,并适配采样率与时间尺度。低信噪比、跨被试差异、通道配置变化和小样本过拟合均可能削弱收益;双向处理也需核对其对在线推理延迟的影响。一个小规模可证伪实验是:在固定的跨被试 EEG 划分与相同预训练表征下,对比单列 Mamba、双列双向 Mamba 和 Transformer,控制训练预算,并同时记录分类指标与相同硬件上的推理延迟。相关 EEG 工作尚未检索确认。

阅读价值

值得核对其预训练语音表征与双列双向 Mamba 的结合方式,以及有限标注条件下的检测效果和推理效率;其向 EEG 的迁移价值尚未验证。

来源:OpenReview · State space models · openreview.net