TRACE:面向通用多模态检索的任务自适应推理与表征学习
TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval
基于摘要分析。本文研究通用多模态检索中显式匹配与尚未明确的组合意图如何映射到共享嵌入空间,提出 TRACE,通过查询侧的选择性推理,将意图解析与检索表征学习结合,同时保留候选项离线索引能力。 机制上,TRACE 的首次自回归预测选择直接生成嵌入,或先生成面向检索的推理序列;两条路径都从预测同一嵌入标记的隐藏状态提取向量。联合生成训练与对比训练用于耦合意图解析和表征学习,候选项则直接编码,不依赖在线推理。该设计针对的是“所有查询都推理”可能增加延迟、甚至削弱检索效果的问题。作者构建 M-BEIR-CoT,以 518K 个直接编码样例和 575K 个经过筛选的推理样例监督两种行为;筛选方式、损失细节及路由监督方式尚未验证。 作者报告,TRACE 在 M-BEIR 上的平均分为 58.8,比使用相同骨干的 LamRA-Ret 复现结果高 2.1 分,并在 13 个分布偏移设置中的 11 个优于 LamRA-Ret。摘要未明确平均分的具体指标及各设置划分。作者还报告,在独立的 MSCOCO 与 CIRR 对照实验中,TRACE 的召回表现优于分别训练的仅直接编码策略和始终推理策略,查询吞吐量约为始终推理策略的 1.9 倍;硬件、批量大小、推理长度及具体召回指标尚未验证。作者称 CIRR 干预实验与消融进一步支持推理式推断、联合表征学习和仅查询侧生成的作用,具体实验协议、消融及统计信息尚未验证。 平台推测(待验证):其“按查询需求选择计算路径、保持候选向量可索引”的机制,可能用于带文本意图的 EEG 片段检索,而不是直接替代 EEG 解码算法。这一假设依赖可对齐的 EEG—文本或任务标签监督;可借鉴查询路由与联合训练,但需改造 EEG 编码和跨模态对齐。低信噪比、跨被试与通道差异及小样本条件可能使路由或推理失效。可在固定跨被试划分和同一 EEG 编码器下,比较直接编码、始终推理与选择性推理的检索召回和查询时延。已有 EEG 相关工作尚未检索确认,原论文结果不构成 BCI 有效性的证据。
值得核对其选择性推理如何兼顾检索效果与查询吞吐量:摘要提供了同骨干对照、分布偏移评估及直接编码与始终推理策略的比较,但具体协议与统计信息尚未验证。
来源:OpenReview · Representation learning · openreview.net