跳到正文
OpenReview · State space models· Jizhen Li; Weiping Tu; Yuhong Yang; Xinmeng Xu; Yiqun Zhang; Yanzhen Ren·· 2025-12-31精选AI 评分71

利用状态空间模型的跨频带与子带处理改进语音增强

Improving Speech Enhancement by Cross- and Sub-band Processing with State Space Model

AI 导读

基于摘要分析。本文研究语音增强中状态空间模型(SSM)对不同子带特征适配不足、低能量高频信息易被遗忘的问题,提出 Cross- and Sub-band Mamba(CSMamba),通过子带独立建模与跨频带频谱恢复改善增强后的语音表示。 核心机制包括两个模块:band split block 根据信息相似性,将全频带划分为四个宽度不同的子带,并为各子带配置独立权重,以适应频带间的特征差异;spectrum restoration block 从多个角度增强跨频带特征表示,旨在缓解 SSM 对低能量高频信息的遗忘。摘要未说明频带边界如何确定、独立权重的具体配置,以及恢复模块的结构、损失函数和训练流程,这些细节尚未验证。 作者报告,在 DNS Challenge 2021 数据集的语音增强实验中,CSMamba 以更少参数在三项客观评价指标上优于若干被作者称为 SOTA 的方法。摘要未提供指标名称、具体数值、参数量、对照方法及数据划分,因此尚不能判断各项改进幅度或比较条件;实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可供 EEG 方法设计参考的是“频带差异化参数配置与跨频带信息补偿”机制,而非语音增强效果本身。该机制依赖具有频带结构的时频表示,原研究的监督形式和训练规模尚未验证。迁移时可考虑复用子带独立建模思路,但需重新确定 EEG 频带划分、通道融合方式和任务目标;低信噪比下的高频恢复可能同时放大肌电等伪迹,独立子带参数也可能在小数据条件下过拟合,并受跨被试频谱差异影响。一个可检验的小实验是在固定数据划分与相近参数预算下,对比共享 SSM、子带独立 SSM,以及加入跨频带恢复模块的版本,观察任务性能与高频伪迹敏感性。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其按子带配置独立权重与跨频带频谱恢复的设计及消融:作者报告在 DNS Challenge 2021 上以更少参数改善三项客观指标,但其对 EEG 的适用性尚未验证。

来源:OpenReview · State space models · openreview.net