跳到正文
arXiv · 架构与算子· Sajid Fardin Dipto; Tarikul Islam Tamiti; Luke Baja-Ricketts; David Vergano; Anomadarshi Barua·· 3 天前精选AI 评分70

用于 EMG-To-Speech(ETS)合成的混沌引导状态空间建模:受 Lyapunov 启发的 LyRIC 激活函数与 GLARE 注意力

Lyapunov-Inspired LyRIC Activation and GLARE Attention in Chaos-Guided State Space Modeling for EMG-To-Speech (ETS) Synthesis

AI 导读

基于摘要分析。本文研究 EMG-To-Speech(ETS)合成中的非线性声学动态建模,提出 Lyapunov 衍生的 LyRIC 激活函数、两种混沌相关损失,以及结合 Mamba 状态空间建模和局部注意力的紧凑编码器,旨在改善声学重建并减少模型参数。 机制方面,作者将 ETS 视为具有确定性混沌特征的动力系统,并认为依赖常规重建指标的既有方法容易过度平滑自然声学动态。提出的损失分别为 Lyapunov Exponent Regularization 和 Multi-Scale Detrended Fluctuation Analysis;GLAME 编码器则结合全局 Mamba 状态空间建模与局部 GLARE 注意力。摘要未提供激活函数、损失的具体公式及其组合权重,也未说明如何估计或验证混沌特征,因此上述动力学解释目前属于作者提出的建模依据。 作者报告,在使用英语和普通话数据集的多语言、多说话人帧级声学评估中,相较摘要所称的既有基线,STOI 为 0.61 对 0.13,LSD 为 1.08 对 2.25;参数量为 14.34M 对 54.10M,减少 73.49%。其中 STOI 增大与 LSD 减小分别对应不同评价方向,不能合并为统一的性能提升。具体数据集、说话人数、训练与测试划分、基线身份及统计不确定性尚未验证,也无法判断这些结果属于说话人内还是跨说话人泛化。 复现时需核对 EMG 与语音的对齐及预处理、各混沌组件的独立消融、指标计算方式与公平对照条件。作者提出其方法适用于实时 ETS,但摘要未给出延迟、吞吐量或硬件条件,参数压缩本身不能证明实时性。本文直接研究的是 EMG,而非 EEG/BCI;其结果不能直接外推为 EEG 解码效果。实验协议、消融及统计信息尚未验证。

阅读价值

值得核对 LyRIC、混沌正则化与 GLAME 编码器能否在压缩参数量的同时改善 EMG-To-Speech 声学重建,但其独立贡献及实时性能仍需全文实验验证。

来源:arXiv · 架构与算子 · arxiv.org