跳到正文
OpenReview · State space models· Hiroshi Sato; Takafumi Moriya; Masato Mimura; Shota Horiguchi; Tsubasa Ochiai; Takanori Ashihara; Atsushi Ando; Kentaro Shinayama; Marc Delcroix·· 2024-01-01精选AI 评分72

SpeakerBeam-SS:基于轻量化 Conv-TasNet 与状态空间建模的实时目标说话人提取

SpeakerBeam-SS: Real-time Target Speaker Extraction with Lightweight Conv-TasNet and State Space Modeling

AI 导读

基于摘要分析。该研究面向实时目标说话人提取(TSE),即从多说话人混合语音中流式提取指定说话人的声音,核心贡献是在 Conv-TasNet-based TSE 中引入状态空间建模(SSM),并调整卷积前端以降低计算成本;其主要研究对象是语音分离,而非 EEG 或 BCI。 方法利用 SSM 建模长时依赖,使 Conv-TasNet 可以用更少的扩张卷积层捕获时间依赖,从而降低模型复杂度。作者还增大 TasNet 前端编码器的窗口长度和步移以进一步减少计算,并通过前端编码器的过参数化补偿性能下降。摘要未披露具体 SSM 形式、说话人条件信息的注入方式、训练目标或各模块配置,这些内容尚未验证。 作者报告,相对于常规因果 Conv-TasNet-based TSE,该方法将实时因子降低 78%,同时保持相当的提取性能。这里的 78% 是实时因子的相对降幅,不是准确率提升或百分点变化。数据集、划分、性能指标、硬件、流式缓冲和延迟设置,以及消融与统计信息尚未验证;实时因子下降也不能直接等同于端到端延迟同比下降。 平台推测(待验证):若 EEG 流式任务需要在有限计算预算下建模长时依赖,SSM 与局部卷积结合的机制可能可复用,但语音混合结构及目标说话人条件不能直接对应 EEG。前端窗口、步移、通道输入和监督目标均需改造;低信噪比、小数据及跨被试差异可能削弱收益,较大步移也可能损失短时 ERP 信息。一个可证伪的小实验是在固定 EEG 数据划分和硬件下,以相同因果输入约束比较卷积基线与加入 SSM、减少扩张卷积层的版本,分别测量任务指标、计算成本和端到端延迟,再单独检验前端步移调整的影响。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其以 SSM 替代部分扩张卷积、配合前端配置调整降低流式计算成本的机制,但语音提取性能保持及其向 EEG 的适用性仍需分别验证。

来源:OpenReview · State space models · openreview.net