跳到正文
OpenReview · EEG· Zexu Pan; Marvin Borsdorf; Siqi Cai; Tanja Schultz; Haizhou Li·· 2024-01-01精选AI 评分78

NeuroHeed:使用 EEG 信号的神经引导说话人提取

NeuroHeed: Neuro-Steered Speaker Extraction Using EEG Signals

AI 导读

基于摘要分析。NeuroHeed 研究多人语音混合中如何利用听者同步 EEG 提取其注意的说话人语音,将选择性听觉注意信息直接用于语音提取,而不仅是判断听者正在关注谁。作者提出离线与在线两种版本,在线版本面向实时推理。 核心机制是将 EEG 编码为神经吸引子(neuronal attractor),作为提取目标语音的条件。在线 NeuroHeed 进一步引入自回归说话人编码器,累积过去已提取的语音,以自注册方式将被注意说话人的信息编码为听觉吸引子(auditory attractor),用于维持时间上的注意连续性。当前窗口的语音提取由神经吸引子与听觉吸引子共同引导。摘要未提供编码器具体结构、损失函数或训练流程,这些细节尚未验证。 作者报告,在 KUL dataset 的双说话人场景中,离线版本的平均 SI-SDRi 为 14.3 dB、提取准确率为 90.8%;在线版本的 SI-SDRi 为 11.2 dB、提取准确率为 85.1%。这些结果分别对应离线与在线设置;提取准确率的具体定义、数据划分、被试内或跨被试协议及对照基线尚未验证,不能将其等同于通用 EEG 分类 Accuracy,也不能仅凭这些数字确认实时部署性能。 复现时需核对 EEG 与语音同步及预处理方式、在线窗口和实际延迟、历史语音累积规则,以及两类吸引子的独立贡献。平台推测(待验证):历史提取语音可能帮助稳定连续提取,也可能在提取错误或听者切换注意对象时延续错误的说话人信息;可在相同在线协议下比较是否使用听觉吸引子,并考察注意切换后的恢复过程。实验协议、消融及统计信息尚未验证。

阅读价值

值得阅读其以 EEG 神经吸引子引导目标说话人提取、再以历史提取语音构建听觉吸引子的在线机制;作者报告了 KUL 双说话人场景下的提取结果,但实时延迟与泛化协议尚待全文核对。

来源:OpenReview · EEG · openreview.net