跳到正文
OpenReview · State space models· Moran Chen; Qiquan Zhang; Mingjiang Wang; Xiangyu Zhang; Hexin Liu; Eliathamby Ambikairajah; Deying Chen·· 2025-01-01AI 评分66

用于单通道语音增强的选择性状态空间模型

Selective State Space Model for Monaural Speech Enhancement

AI 导读

基于摘要分析。本文针对单通道语音增强中的长序列建模与计算复杂度问题,提出混合卷积与 Mamba 的骨干 MambaDC,结合卷积的局部交互建模能力与 Mamba 的长程全局依赖建模能力。 核心机制是用两类模块承担不同尺度的序列建模。摘要将 Transformer、Conformer 随序列长度增长的二次计算复杂度作为动机,并指出 Mamba 具有线性复杂度的长序列处理能力;但未提供 MambaDC 的模块连接方式、输入表示、损失函数或具体训练目标,不能据此确定完整模型的实际时间、显存开销及推理延迟。 作者报告,在基础与先进语音增强框架中、针对两种常用训练目标的实验里,MambaDC 均优于 Transformer、Conformer 和标准 Mamba;作者还报告,将其用于当前先进框架后,结果优于已有 SoTA 系统。摘要未列出数据集、数据划分、评价指标、数值及骨干规模匹配条件,因此这些结论目前只能按作者的定性报告理解。实验协议、消融及统计信息尚未验证,复现所需的实现与训练配置也需核对全文。 平台推测(待验证):其“局部卷积+长程状态建模”机制可能用于 EEG 长时间窗处理,但原任务依赖语音序列与增强训练目标,不能直接证明 BCI 有效。可复用的是局部与长程建模的组合思路;需改造 EEG 通道组织、输入表示及任务监督。低信噪比、跨被试差异、通道变化和小数据可能使模型学习噪声或被试特征。一个可检验的小实验是在固定 EEG 数据划分、预处理和训练预算下,对比卷积、标准 Mamba 与混合骨干,分别报告被试内和跨被试任务指标,并测量不同序列长度下的时间与显存开销。相关 EEG 工作尚未检索确认。

来源:OpenReview · State space models · openreview.net