使用结构化状态空间模型增强用于在线语音识别的 Conformer
Augmenting conformers with structured state space models for online speech recognition
基于摘要分析。该研究针对只能访问左侧上下文的在线语音识别,将结构化状态空间序列模型 S4 引入神经编码器,以参数高效的方式利用任意长的历史上下文,并研究其与卷积的组合方式。主要研究对象是在线 ASR,而非 EEG 或 BCI。 机制与对照:作者通过系统消融比较 S4 变体,并提出两种与卷积结合的新方案。作者报告,最有效的设计是将使用实值循环权重的小型 S4 与局部卷积堆叠,使长历史建模与局部特征提取互补。摘要未提供具体堆叠位置、状态维度、训练损失及推理实现,相关细节尚未验证。 结果:在仅访问左侧上下文的在线 ASR 设置下,作者报告最佳模型在 Librispeech 测试集上的 WER 分别为 4.01% 和 8.53%,优于对卷积进行了充分调优的 Conformer。摘要未标明两个数值对应的测试子集名称,不能自行补全;训练数据划分、模型规模匹配、延迟与计算开销,以及消融细节和统计信息尚未验证。 平台推测(待验证):迁移假设是,S4 的历史状态建模与局部卷积的互补机制可能适用于需要因果处理的连续 EEG 解码,缓解有限窗口难以保留长时信息的问题。原方法依赖有序语音序列及 ASR 任务监督,摘要未明确监督形式和训练规模;迁移时可复用因果序列模块,但需改造多通道 EEG 输入映射、采样率适配和任务输出。低信噪比可能使历史状态积累噪声,跨被试分布变化、通道配置差异和小数据也可能削弱收益。 一个可检验的小实验是在同一连续 EEG 任务、相同因果输入和数据划分下,对比局部卷积编码器与加入小型 S4 的编码器,并控制参数量、历史长度和推理延迟,检验增益是否来自更长历史。该建议不是论文已验证结果;已有 EEG 相关工作尚未检索确认。
值得阅读其 S4 与局部卷积的互补设计及变体消融,以评估长历史建模对在线识别的贡献;对流式 EEG 的适用性尚未验证。
来源:OpenReview · State space models · openreview.net