跳到正文
OpenReview · EEG· Gautam Krishna; Yan Han; Co Tran; Mason Carnahan; Ahmed H. Tewfik·· 2019-01-01AI 评分64

使用 EEG 的先进语音识别及从 EEG 解码语音频谱的探索

State-of-the-art Speech Recognition using EEG and Towards Decoding of Speech Spectrum From EEG

AI 导读

基于摘要分析。本文研究如何利用 EEG 进行含噪条件下的连续英语语音识别,并进一步探索从 EEG 特征解码语音频谱。核心贡献是在不同实验条件下考察端到端自动语音识别(ASR)模型,并以基于 LSTM 的回归模型和基于 GAN 的模型探索连续声学输出。 识别部分采用不同类型的先进端到端 ASR 模型处理 EEG 信号;摘要未说明具体模型名称、EEG 输入表征、训练目标或解码策略。频谱解码部分分别使用 LSTM 回归与 GAN 建模,但频谱表示、监督配对方式、GAN 的生成目标与损失形式尚未验证。文本识别与频谱预测属于不同输出任务,不能将其结果视为同一性能指标。 作者报告,在不同实验条件下,EEG 用于连续含噪语音识别具有可行性,并给出从 EEG 特征合成语音的初步结果。摘要未提供词汇规模、数据集、被试数、噪声类型与强度、评价指标或具体数值,因此无法核实标题中“State-of-the-art”的比较依据,也不能据此判断相对基线的优势。 复现与解释结果时,需要核对 EEG 对应的是听觉感知、实际发声还是其他任务,是否使用额外声学输入,以及 EEG 与语音的时间对齐方式、预处理和伪迹控制。还需确认被试内、跨被试或跨会话划分与评价协议,才能判断模型的泛化范围。实验协议、消融及统计信息尚未验证;摘要所述初步结果不足以证明对未发声语音的解码能力或实际 BCI 应用效果。

来源:OpenReview · EEG · openreview.net