跳到正文
OpenReview · Representation learning· Shikhar Vashishth; Shikhar Bharadwaj; Sriram Ganapathy; Ankur Bapna; Min Ma; Wei Han; Vera Axelrod; Partha Talukdar·· 2023-01-01精选AI 评分70

面向语言识别的标签感知语音表征学习

Label Aware Speech Representation Learning For Language Identification

AI 导读

基于摘要分析。本文研究语言识别这类非语义语音任务的表征学习,提出 Label Aware Speech Representation(LASR)学习框架,将语言标签信息融入自监督预训练,再对所得语音表征进行下游微调。 核心机制是在自监督损失之外引入基于 triplet 的目标函数,使预训练同时利用原始语音和语言标签。其主要区别在于,不仅使用分类器进行监督式嵌入提取,也不只依赖无标签数据进行自监督学习,而是在预训练阶段结合两类信号。摘要未说明 triplet 的构造、采样策略、损失权重或具体自监督任务,这些实现条件尚未验证。 作者报告,在两个公开数据集 FLEURS 和 Dhwani 的语言识别实验中,LASR 优于所比较的最先进系统;摘要未提供具体指标、数值、数据划分与基线配置,因而无法判断提升幅度及比较条件。作者还报告了对标签噪声、标签缺失的鲁棒性分析,以及在多语言语音识别任务中的应用,但相关实验协议、消融及统计信息尚未验证。 平台推测(待验证):可迁移的假设是,任务标签约束与自监督目标结合,可能帮助 EEG 表征保留与任务有关的区分信息;这并不代表语音领域结果已经适用于 BCI。可复用的是联合训练思路,需改造的是 EEG 编码器、自监督任务及 triplet 采样规则。低信噪比、小样本以及被试或通道差异可能使标签约束学习到非任务特征。一个可检验的小实验是在固定 Cross-subject 划分下,以相同编码器和微调预算比较纯自监督预训练与加入任务标签 triplet 目标的预训练,并仅在训练集内改变标签噪声或缺失比例。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 LASR 如何将语言标签引入自监督预训练,以及标签噪声与缺失条件下的鲁棒性分析;其对 EEG 表征学习的价值尚未验证。

来源:OpenReview · Representation learning · openreview.net