跳到正文
1月1日周三
  1. OpenReview · EEG63

    利用 EEG 进行语音合成

    基于摘要分析。本文研究能否从 EEG 特征预测声学特征并合成语音,采用循环神经网络(RNN)回归模型建立 EEG 到声学特征的直接映射。作者报告了四名被试的 EEG 语音合成结果,并据此认为直接从 EEG 特征合成语音具有可行性。 方法方面,研究使用此前工作 [1] 提出的不同 EEG 特征集,而非摘要中明确提出的新特征提取机制。RNN 的预测目标是声学特征,但特征定义、时间对齐方式、损失函数、训练细节以及从声学特征生成波形的流程尚未验证,不能据此将其描述为直接输出语音波形的端到端系统。 数据包含两类记录条件:被试说话时同步记录的 EEG,以及被试听语音时同步记录的 EEG。这两种条件对应不同的神经活动与任务背景,结果应分别理解;摘要未涉及运动想象、想象语音或无声表达条件,因此不能把其可行性结论直接推广为无声语音 BCI 的有效性。 摘要没有提供定量指标或对照结果,当前只能确认作者报告了四名被试的合成结果,无法判断语音可懂度、声学重建质量或泛化能力。实验协议、数据划分、被试内或跨被试设置、消融及统计信息尚未验证。复现时需核对 [1] 中 EEG 特征的定义、同步 EEG 与语音的处理流程、训练与测试划分、语音重建方法及评价标准;说话条件下肌电等非脑源成分的处理也属于需核对事项,不能仅凭摘要断言存在混杂。

1月1日周二
  1. OpenReview · EEG64

    使用 EEG 的先进语音识别及从 EEG 解码语音频谱的探索

    基于摘要分析。本文研究如何利用 EEG 进行含噪条件下的连续英语语音识别,并进一步探索从 EEG 特征解码语音频谱。核心贡献是在不同实验条件下考察端到端自动语音识别(ASR)模型,并以基于 LSTM 的回归模型和基于 GAN 的模型探索连续声学输出。 识别部分采用不同类型的先进端到端 ASR 模型处理 EEG 信号;摘要未说明具体模型名称、EEG 输入表征、训练目标或解码策略。频谱解码部分分别使用 LSTM 回归与 GAN 建模,但频谱表示、监督配对方式、GAN 的生成目标与损失形式尚未验证。文本识别与频谱预测属于不同输出任务,不能将其结果视为同一性能指标。 作者报告,在不同实验条件下,EEG 用于连续含噪语音识别具有可行性,并给出从 EEG 特征合成语音的初步结果。摘要未提供词汇规模、数据集、被试数、噪声类型与强度、评价指标或具体数值,因此无法核实标题中“State-of-the-art”的比较依据,也不能据此判断相对基线的优势。 复现与解释结果时,需要核对 EEG 对应的是听觉感知、实际发声还是其他任务,是否使用额外声学输入,以及 EEG 与语音的时间对齐方式、预处理和伪迹控制。还需确认被试内、跨被试或跨会话划分与评价协议,才能判断模型的泛化范围。实验协议、消融及统计信息尚未验证;摘要所述初步结果不足以证明对未发声语音的解码能力或实际 BCI 应用效果。