跳到正文
OpenReview · State space models· Xiaodong Zhu; Junqi Yang; Yuhong Yang; Weiping Tu; Zhongyuan Wang·· 2025-11-01精选AI 评分72

轻量级实时语音增强:状态空间模型与多频谱扫描技术

Lightweight real-time speech enhancement: State-space models and multi-spectral scanning techniques

AI 导读

基于摘要分析。本文研究实时通信中的语音增强,提出结合 Mamba State-Space Model(SSM)与多频谱扫描的轻量级端到端框架,旨在平衡信号质量与计算复杂度;研究对象是语音信号,并非 EEG 或 BCI。 核心机制包括三种面向频谱图的扫描方式,分别捕获全频带、子频带及跨频带的长程依赖。框架结合模拟人类听觉感知的 ERB 压缩与高频重建,以降低计算开销,并在训练中加入 Voice Activity Detection(VAD)损失,辅助恢复粗粒度时间特征。摘要未提供扫描顺序、压缩与重建细节、损失形式及权重,相关实现尚未验证。 训练使用自定义流程生成的大规模合成数据,评估采用 ICASSP SSI Challenge 数据集。作者报告,该框架在整体质量(OVRL)和语音信号清晰度(SIG)上优于所比较的先进模型,同时保持较低资源消耗;在 VoiceBank+DEMAND 上,作者报告整体语音增强表现优于竞争模型。摘要未提供具体分数、基线名称、数据划分、参数量、运行硬件或端到端延迟,因而尚不能量化优势或核实实时条件;实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设频谱扫描对长程时频依赖的建模可用于 EEG 去噪,其可能对应跨频带依赖与计算预算受限的瓶颈。可考察复用 Mamba 与扫描模块,但 ERB 压缩及 VAD 监督具有语音特异性,需要改为适合 EEG 频带和伪迹的表示与训练目标;合成训练也需要可信的干净信号与噪声配对。低信噪比、跨被试差异、通道结构和小数据可能使模型误删任务相关活动。一个可检验的小实验是在固定被试划分、匹配计算预算的 EEG 人工加噪条件下,对比不同扫描方式与不使用频谱压缩的版本,同时检查信号恢复及下游任务表现。已有 EEG 相关工作尚未检索确认,语音结果不构成 BCI 有效性的证据。

阅读价值

值得阅读其以 Mamba、时频扫描和频谱压缩兼顾语音增强质量与计算开销的设计,但实时性能及对 EEG 的迁移价值尚未验证。

来源:OpenReview · State space models · openreview.net