跳到正文
arXiv · 表征与预训练· Qun Dai; Liangjian Wen; Jiang Duan; Yong Dai; Dongkai Wang; Maolin Wang; Mingjie Wang; Jianzhuang Liu; He Yan; Zhao Kang·· 1 天前精选AI 评分75

HRIL:通过高阶张量建模学习多模态协同信息

HRIL: Learning Multimodal Synergy via Higher-Order Tensor Modeling

AI 导读

基于摘要分析。该研究关注自监督多模态表征如何保留协同信息:这类任务相关信号仅在多个模态的联合配置中出现,无法从任一单独模态恢复。作者提出 Higher-order Representation and Information Learning(HRIL),用高阶统计依赖显式描述跨模态交互,而非仅关注模态间的共享信息。 核心机制是在模态嵌入上构造经验交叉矩张量,表征多路交互,再通过 Tucker decomposition 得到核心张量。方法同时引入协同感知正则化,以防止能量集中并保留高阶耦合容量。摘要未给出交叉矩的具体阶数、正则项公式及其与训练目标的组合方式,因此尚不能判断信息容量与实际可解码协同信号之间的关系。 作者报告,在受控协同任务和真实场景基准上,HRIL 相比已有多模态对比学习方法取得一致改善,且在由协同交互主导的任务上收益更明显。摘要未提供基准名称、数据划分、指标、数值及对照配置;实验协议、消融及统计信息尚未验证。摘要称代码已发布,但实现与复现条件尚未核对。 平台推测(待验证):若 EEG 与其他模态中的任务线索必须联合解释,HRIL 的交互张量与正则化机制可能用于检验共享表征之外的协同信息。该假设依赖配对模态、可靠的时间或样本对齐,以及足够稳定的交叉矩估计;模态编码器、对齐方式和张量规模需针对数据改造。EEG 的低信噪比、跨被试差异、通道变化及小样本可能使高阶统计估计不稳定,模型也可能捕捉与任务无关的联合变化。可在固定跨被试划分的配对数据上,对比单模态、多模态对比学习与 HRIL,并加入模态配对打乱对照,检验收益是否依赖真实联合关系。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 HRIL 的高阶交互建模与协同感知正则化是否确实保留了单模态无法恢复的任务信息,以及其相对多模态对比学习的收益是否依赖任务的协同结构。

来源:arXiv · 表征与预训练 · arxiv.org