通过结构感知潜在掩码建模释放 CLIP 的细粒度感知能力
Unlocking Fine-Grained Perception in CLIP via Structurally-Aware Latent Masked Modeling
基于摘要分析。本文针对 CLIP 全局图文语义对齐较强、细粒度感知能力不足的问题,提出无监督嵌入对齐框架 SALM,通过结构感知潜在掩码建模协调局部空间结构与全局语义,并进一步提出不依赖外部模型的自蒸馏变体 SALM-Self。 核心机制包括显式与隐式两条路径:双矩阵对齐策略显式校准样本内部的空间相关性与激活强度,以引入局部几何先验;潜在掩码建模则引导 CLIP 恢复目标模型中缺失的语义细节,将细粒度结构整合到全局语义空间。摘要明确该框架不需要图文配对,但目标模型、掩码对象与采样方式、损失形式,以及训练时哪些参数更新尚未验证。 SALM-Self 建立在作者对 CLIP 浅层特征具备较强空间感知能力的经验观察之上,利用自蒸馏挖掘模型自身的细粒度信息。相较于依赖外部视觉模型提供几何先验的方案,其可核对的研究重点是内部特征能否提供有效结构监督,以及增强局部表征时能否保留原有图文语义空间。 作者报告,SALM 改善了密集预测任务表现、CLIP 的零样本准确率及 MLLMs 的细粒度理解能力;摘要未提供数据集、数据划分、对照基线或数值,不能据此判断收益幅度或不同任务间的可比性。实验协议、消融及统计信息尚未验证,复现还需核对目标模型选择、训练数据规模、计算成本和实现细节。 平台推测(待验证):若 EEG 表征包含可对齐的通道或时序局部特征,结构对齐与潜在掩码恢复可能为局部信息易被全局表征压缩的问题提供思路。可复用的是对齐与恢复机制,需改造的是空间相关性的定义、掩码单元及监督来源;不能假定 EEG 存在与 CLIP 浅层视觉特征等价的几何先验。低信噪比、跨被试差异、通道布局变化及小数据可能使结构监督主要传递噪声。一个可证伪的小实验是在固定 Cross-subject 划分和相同 EEG 编码器下,比较原始训练、仅结构对齐及加入潜在掩码恢复三种设置,并核对分类表现与局部结构稳定性。已有 EEG 相关工作尚未检索确认。
值得核对 SALM 如何在无需图文配对的条件下兼顾局部结构对齐与全局语义,以及 SALM-Self 能否以自蒸馏减少对外部视觉模型的依赖;具体收益与复现条件尚未验证。
来源:arXiv · 表征与预训练 · arxiv.org