跳到正文
arXiv · 泛化与分布偏移· Yucheng Gong; Rui Zhou; Binbin Zeng; Qiang Ren; Hongjin Hui·· 3 天前精选AI 评分77

冻结嵌入生物声学分类中域对齐的强度单调律

A Strength-Monotonic Law for Domain Alignment in Frozen-Embedding Bioacoustic Classification

AI 导读

基于摘要分析。研究考察冻结基础模型嵌入在跨声学域蚊子物种分类中何时受益于分布对齐,并提出“强度单调律”:作者报告,编码器在目标任务上越强,其未见域泛化越依赖 MMD 分布对齐,同时越容易受到域重平衡采样的负面影响。 作者在四个编码器家族及同一 HuBERT 编码器的层级扫描(n=8)中比较这一关系。作者报告,域重平衡效应与编码器强度的排序关系为 Spearman -1.000;MMD 收益在各分析序列内呈单调关系,合并后的相关值为 -0.857。摘要未说明相关变量的具体编码与排序方向,因此不能仅凭系数符号重新解释收益方向。作者还报告,固定架构、仅改变表征强度时,域重平衡的效果可从有益转为性能崩塌。 据此,作者将训练方案简化为冻结的 Perch 2.0 嵌入、轻量探针、交叉熵、单个 MMD 项及输入增强。作者报告,在未见域评估中,简化方案与完整组合方案的 BA_unseen 分别为 0.299±0.006 和 0.307±0.014,差异处于随机种子波动范围;误差项定义及完整划分尚未验证。作者另报告,在留一域协议下,骨干微调、多模态融合和域重平衡分别损害未见域准确率,并称有单变量、多随机种子证据。编码器强度定义、MMD 计算与权重、域构成、样本量、消融及统计信息尚未验证,该规律不宜视为跨任务普遍定律。 平台推测(待验证):若冻结 EEG 编码器在不同被试或会话上形成可对齐的嵌入分布,这一机制可能对应跨被试、跨会话分布偏移瓶颈。可复用冻结嵌入、轻量探针与 MMD,但需改造输入增强并明确域标签及目标域数据是否可用。低信噪比、通道差异和小样本可能使分布估计不稳,类别组成差异也可能使对齐损害判别信息。一个可证伪的小实验是在固定留一被试划分下,对不同表征强度分别比较基线、加入 MMD、仅做域重平衡的 Balanced Accuracy,并使用多随机种子;不将原文生物声学结果当作 EEG 效果。相关 EEG 工作尚未检索确认。

阅读价值

值得核对其固定架构、仅改变表征强度的对照证据,以判断 MMD 对齐与域重平衡采样的收益是否依赖编码器能力;该规律在 EEG 上尚未验证。

来源:arXiv · 泛化与分布偏移 · arxiv.org