跳到正文
OpenReview · State space models· Yan Ru Pei; Ritik Shrivastava; Sidharth·· 2024-01-01精选AI 评分74

基于深度状态空间建模的原始信号实时语音增强

Real-time Speech Enhancement on Raw Signals with Deep State-space Modeling

AI 导读

基于摘要分析。该研究针对原始语音波形的实时增强,提出 aTENNuate:一种面向高效在线处理的深度状态空间自编码器,以端到端方式开展语音去噪,并进一步评估超分辨率和去量化任务。研究对象是语音,而非 EEG 或 BCI。 核心机制是将深度状态空间建模用于原始波形自编码与增强,避免将研究对象限定为预计算的频域表示。摘要未说明状态更新形式、网络结构、损失函数、训练监督构造及在线推理的缓存方式,这些实现细节尚未验证。 作者在 VoiceBank + DEMAND 和 Microsoft DNS1 synthetic test sets 上评估原始语音去噪,报告 aTENNuate 相比既有实时去噪模型,在 PESQ、参数量、MACs 和延迟方面表现更优,同时保持较高的干净信号保真度和较少的可听伪影。摘要未提供具体分数、对照模型、数据划分或延迟测量硬件,因此暂不能量化优势。作者还报告,当带噪输入压缩至 4000Hz、4 bits 时,模型仍保持有效表现;该结论对应低采样率、低位深语音输入,不代表已验证神经信号处理效果。实验协议、消融及统计信息尚未验证。摘要提供了代码地址,但代码内容和复现条件尚未核验。 平台推测(待验证):其在线状态空间处理机制可作为 EEG 流式去噪的候选方案,假设是状态更新能够以较低计算成本利用时间依赖。可考虑复用序列处理与在线推理框架,但需改造多通道输入、噪声建模及保真目标;语音训练的数据规模和监督条件也不能直接沿用。EEG 的低信噪比、跨被试差异、通道变化及小样本训练可能导致模型抹除弱 ERP 或产生伪信号。可检验的小实验是在固定被试内划分下,对 EEG 叠加可控噪声,与简单滤波基线比较去噪误差、ERP 波形保真度及同硬件流式延迟。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 aTENNuate 在原始语音波形在线去噪中对质量、计算量与延迟的联合评估,但其对 EEG 实时处理的适用性尚未验证。

来源:OpenReview · State space models · openreview.net