跳到正文
OpenReview · State space models· Haozhe Shan; Albert Gu; Zhong Meng; Weiran Wang; Krzysztof Choromanski; Tara N. Sainath·· 2024-01-01精选AI 评分74

利用结构化状态空间序列模型增强 Conformer 以实现在线语音识别

Augmenting Conformers With Structured State-Space Sequence Models For Online Speech Recognition

AI 导读

基于摘要分析。研究面向只能访问左侧上下文的在线语音识别(ASR),将结构化状态空间序列模型 S4 引入神经编码器,以参数高效的方式利用任意长的左侧上下文,并探索其与局部卷积的互补组合。 核心机制与对照:作者比较了不同 S4 变体,并提出两种与卷积结合的方案。作者报告,最有效的设计是将使用实值递归权重的小型 S4 与局部卷积堆叠,使长程上下文建模和局部特征提取互补。摘要未给出具体堆叠位置、模型规模、损失函数、训练流程或流式推理实现,相关细节尚未验证。 结果:作者报告,最佳模型在 Librispeech 的两个测试集上取得 4.01%/8.53% 的 WER,优于对卷积进行了充分调优的 Conformer。摘要未明确这两个数值对应的测试子集名称,也未提供基线 WER、延迟或计算开销,因此不能据此量化相对改进或判断实时部署成本。作者表示开展了系统消融,但完整实验协议、消融结果及统计信息尚未验证。 平台推测(待验证):其潜在迁移路径是以因果 S4 保留较长历史信息,以局部卷积提取短时模式,对应在线 EEG 解码中长短时间尺度联合建模的需求。原任务依赖时序语音输入和 ASR 监督,不能直接视为 EEG 证据;可考虑复用因果时间建模模块,但需改造多通道输入、空间特征提取和任务输出。低信噪比可能使长程状态累积噪声,跨被试与通道配置变化可能削弱表征稳定性,小数据条件也可能限制训练。一个可证伪的小实验是在同一在线 EEG 任务与固定划分下,对比局部卷积、因果 S4 及二者堆叠,统一历史窗口和计算预算,分别核对任务指标与推理延迟。已有 EEG 相关工作尚未检索确认。

阅读价值

值得关注其在仅访问左侧上下文的在线 ASR 中组合长程状态建模与局部卷积的设计及消融;这一机制对因果 EEG 解码有可检验的迁移假设,但 BCI 有效性尚未验证。

来源:OpenReview · State space models · openreview.net