将状态空间模型用作 VLMs 的视觉编码器:跨训练设置与接口的研究
State-Space Models as Vision Encoders for VLMs: A Study across Training Settings and Interfaces
基于摘要分析。本文研究状态空间模型(SSMs)能否替代 VLMs 中常用的 Transformer 视觉编码器,以 VMamba 为对象,比较不同预训练设置及视觉—语言接口配置。主要贡献是将视觉编码器的选择与 connector 的影响共同纳入评估,而非仅比较编码器本身。 VLMs 通常通过 connector 将图像特征映射到大语言模型。本文评估了 VMamba 的四种预训练设置:对比学习、分类、检测适配和分割适配。作者报告,在共享下游 VLM 训练方案下,这些模型在视觉问答(VQA)与指代表达基准上总体具有竞争力,其中 grounding 任务的增益最为一致。摘要未提供具体基准、数据划分、对照编码器及指标数值,因此无法判断增益幅度及其统计稳定性。 接口实验方面,作者报告,在 connector 前增加归一化层可显著改善 VLM 表现;增加 MLP connector 的深度则未带来一致收益。表征探测显示,不同 connector 深度会改变视觉 token 中局部与全局信息的平衡。这提示比较冻结视觉编码器时,需要控制接口配置,避免把接口差异直接归因于编码器能力。归一化类型、connector 结构、冻结范围、训练细节、消融及统计信息尚未验证。 平台推测(待验证):与 EEG 研究可能对应的是“冻结编码器输出如何接入下游模型”的接口问题,而非本文已经验证了 SSM 的 EEG 建模效果。假设 EEG 编码器输出的尺度及局部—全局信息分布会影响下游解码,可复用归一化与 connector 的对照思路,但需按通道和时间结构改造输入及 token 接口。低信噪比、跨被试分布差异和小数据条件可能使接口收益不稳定。一个可证伪的小实验是固定 EEG 编码器、下游模型及跨被试划分,仅比较 connector 前有无归一化,并保持训练预算一致;若收益不稳定,则不支持该接口假设。已有 EEG 相关工作尚未检索确认。
值得阅读的是在共享下游 VLM 训练方案下比较 VMamba 的不同预训练设置,并检验归一化与 connector 深度对结果的影响,有助于辨别编码器能力与接口配置的贡献,但具体实验与统计信息尚未验证。
来源:OpenReview · State space models · openreview.net