MacJEPA:面向未裁剪第一视角视频的模态缺失鲁棒音频-视觉识别
MacJEPA: Missingness-Robust Audio-Visual Recognition from Untrimmed Egocentric Videos
基于摘要分析。该研究针对未裁剪、多事件第一视角视频中传感器在局部时间段失效并恢复的问题,提出 MacJEPA,以给定时间区间查询从音频-视觉上下文中识别视觉动作与声学事件。其贡献是将模态缺失从整段片段中某一模态完全缺席,扩展为时间局部的传感器中断,并在单一模型中联合处理完整输入与缺失输入。 机制上,MacJEPA 在训练中采用窗口局部模态丢弃模拟传感器中断,并将 JEPA 的掩码机制从自监督预训练任务转用于有监督的鲁棒性目标:对齐掩码上下文与完整上下文下的多模态内容 token 表征,以及任务条件查询的潜在表征。上述目标与识别目标在单阶段联合优化;摘要明确表示无需测试时自适应。具体对齐损失、窗口采样策略、网络结构及区间查询的构造方式尚未验证。 作者报告,在 Epic-Kitchens-100 与 Epic-Sounds 上,同一检查点在完整输入条件下保持有竞争力的识别表现,并在主导或辅助模态被移除时持续优于已发表的缺失模态基线。摘要未提供指标数值、划分方式或基线名称,因而不能判断收益幅度,也不能据此确认局部中断与整段缺失各自的效果。实验协议、消融及统计信息尚未验证。 平台推测(待验证):该机制可能用于存在局部传感器中断的多模态 EEG 任务,但原领域有效不等于 BCI 有效。原方法依赖同步音频-视觉上下文、时间区间查询及识别监督;可考虑复用局部丢弃与潜在表征对齐目标,而编码器、时间尺度和查询定义需适配 EEG。低信噪比、跨被试差异、小数据,以及通道缺失与整模态缺失的结构差异都可能使迁移失效。一个可证伪的小实验是在固定跨被试划分的同步 EEG 多模态数据上,比较仅识别训练、加入局部丢弃、再加入表征对齐三种设置,并分别评估完整输入、局部中断与整模态缺失;已有 EEG 相关工作尚未检索确认。
值得核对其窗口级模态丢弃与任务条件查询的潜在表征对齐是否能在保留完整输入识别能力的同时提高局部传感器中断鲁棒性,但具体实验协议与效果幅度尚未验证。
来源:arXiv · 泛化与分布偏移 · arxiv.org