扩展以语言为中心的全模态表征学习
Scaling Language-Centric Omnimodal Representation Learning
基于摘要分析。本文研究多模态大语言模型(MLLM)经对比学习(CL)微调后,为何能够获得较好的多模态嵌入表征,并提出 Language-Centric Omnimodal Embedding 框架 LCO-Emb。核心观点是:生成式预训练已在潜在表征中建立隐式跨模态对齐,后续 CL 主要承担轻量化精炼,而非从零构建对齐。 机制与证据:作者通过各向异性和核相似性结构分析,报告观察到 MLLM 表征中的潜在对齐;其解释是语言解码器在生成单模态输出时,学习利用共享表征空间中的多模态信号。作者还提出 Generation-Representation Scaling Law(GRSL),报告经对比精炼获得的表征能力与 MLLM 生成能力呈正向扩展关系,并给出将生成质量与表征性能上界联系起来的理论解释。摘要未提供该关系的数学形式、假设条件或规模范围,不能据此将其视为适用于任意模型与任务的普遍定律。 实验与复现:作者报告在多种骨干模型和基准上取得跨模态 SOTA 表现,并在低资源视觉文档检索任务中验证,CL 之前的持续生成式预训练可进一步提升嵌入能力。摘要未列出具体骨干、数据集、划分、指标、分数及对照配置,实验协议、消融及统计信息尚未验证。材料提供代码、模型与资源地址,但其实际可用性和复现条件尚未核查。 平台推测(待验证):假设 EEG 与语言或其他模态具有可靠配对监督,生成式预训练形成共享表征、再以 CL 精炼的路径,可能用于探索 EEG—语义对齐;原文研究对象并非 EEG 或 BCI。可借鉴的是训练顺序及表征诊断方法,需改造 EEG 编码、时间窗口与配对目标。低信噪比、跨被试差异、通道配置变化和小数据可能使模型主要利用文本先验,而非有效编码 EEG。一个可证伪的小实验是在相同配对数据、骨干和预算下,对比直接 CL 与生成式预训练后 CL,按被试隔离划分评估 EEG—文本检索,并加入 EEG 打乱对照,检验增益是否依赖真实神经信号。相关 EEG 工作尚未检索确认。
值得阅读的是其对生成式预训练隐式跨模态对齐的实证分析,以及生成能力与表征性能上界之间的理论联系;这些机制是否适用于 EEG 表征尚未验证。
来源:OpenReview · Representation learning · openreview.net