跳到正文
arXiv · 表征与预训练· Benjamin Robson; Santeri Mentu; Wenshuai Zhao; Arno Solin·· 4 天前精选AI 评分75

LeAVJEPA:用于音视频自监督学习的极简架构

LeAVJEPA: A Minimalist Architecture for Audio-Visual Self-Supervised Learning

AI 导读

基于摘要分析。LeAVJEPA 研究如何以简化架构实现音视频自监督表征学习:使用单一早期融合 Vision Transformer 处理音频、视频及联合音视频输入,在 LeJEPA 的防表征坍塌目标下训练。作者将其描述为首个采用该目标训练的音视频编码器;这一优先性声明尚未独立核实。 核心机制是将缺失模态视为同一事件的另一种视图,通过模态 dropout 使跨模态对齐隐含于学习目标中。模型对齐全局嵌入与模态特定的局部嵌入,并使用 SIGReg 防止表征坍塌。摘要将该设计与依赖 EMA 目标编码器、预测头、重建解码器和对比损失的既有方法相对照,但具体目标形式、输入编码及训练配置尚未验证。作者报告,受控消融识别出模态 dropout 是音视频对齐的关键机制;消融设置与效应大小仍需核对全文。 作者报告,在冻结评估下,LeAVJEPA 在 AudioSet-20K 上达到 36.0 mAP,在 ESC-50 上达到 91.3% Accuracy;微调后在 VGGSound 上达到 61.1% Accuracy。作者还报告其嵌入支持零样本音视频检索,但摘要未提供检索指标。上述结果属于不同任务与评估前提,不能直接横向比较;数据划分、对照基线、实验协议及统计信息尚未验证,复现所需配置与实现可用性也尚未确认。 平台推测(待验证):若 EEG 与辅助模态具有可靠的事件同步关系,可检验“缺失模态作为同一事件视图”的机制是否有助于缓解多模态 BCI 的模态缺失问题。可复用的是模态 dropout 与嵌入对齐思路,需改造 EEG 输入编码、时间对齐及全局/局部视图定义。低信噪比、跨被试差异、通道变化和小数据规模可能使模态间共享信息不足,原领域效果不等于 EEG 效果。一个可证伪的小实验是在固定跨被试划分的配对 EEG—辅助模态数据上,对比有无模态 dropout,分别评估完整模态与辅助模态缺失时的解码表现。相关已有 EEG 工作尚未检索确认。

阅读价值

值得核对其受控消融如何支持“模态 dropout 是音视频对齐的关键机制”,以及单一早期融合编码器在冻结评估、微调和零样本检索中的能力边界。

来源:arXiv · 表征与预训练 · arxiv.org