跳到正文

算法、任务与模态

Speech 最新动态

Speech 研究索引;按可核对的标签归档,不以热度评价质量。

22 条精选近 30 天 10 条共收录 34 条

更新

精选归档 · 第 2 页

1月1日周二第 21–22 条
  1. OpenReview · State space models73

    基于多通道非负矩阵分解的状态空间模型语音去混响快速收敛算法

    基于摘要分析。本文研究多通道语音去混响中状态空间模型的参数优化效率,提出一种省去 Kalman smoother 步骤的迭代算法,以降低传统期望最大化(EM)优化中的计算负担。研究对象是声学语音去混响,并非 EEG 解码或 BCI。 核心机制是在参数优化阶段固定潜在状态向量的部分充分统计量,据此构造原始状态空间模型对数似然的近似代价函数,并采用类似多通道非负矩阵分解的辅助函数方法优化参数。所需充分统计量由 Kalman filter 部分估计,算法交替执行 Kalman filter 与近似代价函数最小化,无需传统方法使用的 Kalman smoother。具体固定哪些统计量、辅助函数形式及近似成立条件尚未验证。 作者报告,在摘要所述实验中,该方法比传统方法更快地提高原始似然;在含噪环境下的语音去混响实验中能够有效降低混响。摘要未提供数据集、通道配置、噪声与混响条件、定量指标或运行时间,因此不能将似然提升更快直接等同于已证实的实时处理收益。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 研究采用具有可估计潜在状态及充分统计量的状态空间模型,该优化思路可能用于检验能否减少平滑步骤的计算开销,而不是直接复用语音去混响模型。可考虑复用滤波与辅助函数优化框架,但观测模型、噪声假设及目标函数需按 EEG 数据重建;语音多通道结构与 EEG 通道混合并不等价,低信噪比、通道相关性和小数据可能使近似优化偏离有效解。一个可检验的小实验是在固定模型、初始化与数据划分下,对比传统 EM 与该近似优化的原始似然、运行时间及状态估计误差。相关 EEG 工作尚未检索确认。

    阅读价值:值得核对其以辅助函数近似优化替代 Kalman smoother 的计算收益,以及近似目标与原始似然之间的关系;摘要支持语音去混响用途,但尚未验证 EEG/BCI 适用性。

1月1日周四
  1. OpenReview · State space models72

    用于声学回声削减与去混响的变分贝叶斯状态空间模型

    基于摘要分析。研究针对 A/D 与 D/A 转换器不同步时的语音去混响、声学回声削减和降噪问题,提出基于变分贝叶斯的联合优化方法,利用两个状态空间模型分别描述时变回声滤波器和无噪多通道语音信号。 核心机制是将转换器异步条件下的声学回声削减滤波器视为时变状态向量;第二个模型则将无噪多通道语音信号视为状态向量,使去混响滤波器能够在含噪环境中更新。作者通过变分贝叶斯框架优化这两类模型,交替执行两个基于 Kalman smoother 的参数优化阶段。具体状态转移、观测模型、概率分布与优化目标尚未验证。 作者报告,在真实远程会议室录制的数据上,即使 A/D 与 D/A 转换器异步,所提方法也比作者此前的传统方法更有效地削减声学回声、语音混响和背景噪声。摘要未提供数值指标、数据规模或划分方式,实验协议、消融及统计信息尚未验证;因此无法判断收益大小及不同噪声条件下的稳定性。 平台推测(待验证):迁移假设是,时变干扰参数与潜在干净多通道信号的联合状态估计,可能用于 EEG 非平稳伪迹抑制。原方法依赖多通道时序观测及声学回声、混响的结构假设,具体参考信号和监督需求需查正文;可复用的是双状态建模与交替平滑优化思路,需改造的是 EEG 观测模型、伪迹动力学及通道耦合关系。低信噪比、跨被试差异、通道变化和小数据可能导致状态估计不稳定,或把任务相关脑活动误当作干扰。一个可证伪的小实验是在固定被试内划分的 EEG 上注入已知时变伪迹,对比单状态与双状态估计,并同时检查伪迹残留和原始 ERP 波形保真度。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是以两个状态空间模型及交替 Kalman 平滑优化联合处理时变回声与含噪多通道信号的机制,其对 EEG 伪迹建模的可迁移性尚未验证。