跳到正文
OpenReview · Representation learning· Min-Sang Baek; Gyeong-Su Kim; Donghyun Kim; Joon-Hyuk Chang·· 2026-01-26精选AI 评分77

面向通用声源定位的物理信息引导音频—几何—网格表示学习

Physics-Informed Audio-Geometry-Grid Representation Learning for Universal Sound Source Localization

AI 导读

基于摘要分析。本文研究声源定位(Sound Source Localization,SSL),针对现有深度学习方法受固定麦克风阵列几何和预定义方向网格限制的问题,提出 audio-geometry-grid representation learning(AGG-RL),在共享潜在空间中联合学习音频—几何表示与网格表示,以支持几何不变、网格灵活的声源定位。这里的 SSL 指声源定位,不是自监督学习。 框架包含两个物理信息组件:learnable non-uniform discrete Fourier transform(LNuDFT)以非均匀方式优化频率点的密集分配,强调信息量较高的相位区域;relative microphone positional encoding(rMPE)编码麦克风相对坐标,使几何表示对应通道间时间差的声学特性。其具体阅读价值在于同时处理传感器布局变化与候选方向网格变化,而非仅在固定阵列上改进定位网络。 作者报告,在合成与真实数据集上,AGG-RL 获得更优性能,尤其是在未见条件下。摘要未提供数据集名称、指标、数值、对照方法或未见条件的具体定义,因此尚不能判断泛化来自阵列变化、网格变化还是其他声学条件。训练目标、表示匹配与推理流程、实验协议、消融及统计信息尚未验证。 平台推测(待验证):可探索的 EEG 对应点是利用电极相对坐标辅助跨通道布局建模,但声学时间差与头部容积传导并不等价,不能直接复用其物理解释。共享表示与位置编码思路可能可借鉴,LNuDFT 的相位选择机制则需重新验证;低信噪比、跨被试差异及小数据可能使几何编码失效或过拟合。一个可证伪的小实验是在固定 EEG 任务与被试划分下,比较有无相对电极坐标编码的方法在训练未见通道子集上的表现。该实验仅检验位置编码思路,不代表已验证 AGG-RL 的 BCI 适用性;已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的是其将麦克风阵列几何与候选方向网格纳入共享表示、并引入声学物理约束的机制;摘要中的未见条件泛化结论仍需结合具体划分与对照核验。

来源:OpenReview · Representation learning · openreview.net