多模态饱和的几何:Riemannian VICReg
On the Geometry of Multimodal Saturation: Riemannian VICReg
基于摘要分析。研究关注自监督学习中加入第三模态反而降低性能的“多模态饱和”现象,提出 Riemannian VICReg(R-VICReg),尝试通过改变表征对齐的几何结构缓解这一问题。 核心机制是将经典 VICReg 的视图对齐推广为可学习负曲率乘积因子上的平方测地距离;作者称,当曲率趋于零时,该方法精确恢复 VICReg。摘要将饱和现象归因于对齐几何,但这一解释的因果证据、其他损失项如何处理以及曲率学习的实现细节尚未验证。 作者报告,在九个 image-text-tabular 数据集上,使用 VICReg 时,三模态模型在 55.6% 的配对运行中不及其自身最佳双模态子集;使用 SimSiam 时,这一比例为 51.1%。在同一组 45 次配对运行中,R-VICReg 将第三模态带来收益的运行比例从 VICReg 的 44.4% 提高至 64.4%,且收益主要集中在 VICReg 出现饱和的情形。这些比例并非 Accuracy,也不能解释为性能提高了相应幅度。数据集名称、任务、划分、最佳双模态子集的选择方式、实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 多模态自监督学习同样存在对齐结构不匹配,负曲率对齐可能提供可检验的替代方案。可复用的是几何对齐模块,需改造的是 EEG 编码器、同步视图构造与模态尺度处理;低信噪比、跨被试分布差异、通道变化和小样本可能使曲率学习不稳定。一个小规模实验是假设已有同步 EEG、fNIRS 与行为数据,在固定编码器、训练预算和数据划分下,对比 VICReg 与 R-VICReg,并分别训练三模态及各双模态子集,检验第三模态收益发生比例和下游任务指标。该迁移依赖可配对的多模态数据及足够训练样本,现有 EEG 相关工作尚未检索确认。
值得核对其以可学习曲率改变多模态对齐几何的机制,以及配对实验中第三模态收益是否稳定;摘要报告的是收益发生比例,而非准确率提升幅度。
来源:arXiv · 表征与预训练 · arxiv.org