跳到正文
OpenReview · State space models· Georgios Pantazopoulos; Malvina Nikandrou; Alessandro Suglia; Oliver Lemon; Arash Eshghi·· 2024-01-01精选AI 评分74

探索 VLM 架构替换:比较用于视觉与语言建模的 Transformer 与结构化状态空间模型

Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling

AI 导读

基于摘要分析。研究考察在视觉语言模型(VLM)中以结构化状态空间模型 Mamba 替换 Transformer 的效果,主要贡献是比较两类架构在不同视觉语言任务上的表现,并分析视觉定位(visual grounding)差异可能来自何种机制。 作者报告,在受控条件下测试参数规模最高为 3B 的模型时,Mamba-based VLM 在图像描述、问答和阅读理解任务上优于 Transformer-based VLM;但在视觉定位任务中,Transformer 表现更好,且差距随模型规模增大而扩大。摘要未提供具体数据集、指标、分数或各规模对应的实验条件,因此这些结论仅能作为作者报告的定性比较,不能外推为所有 VLM 任务上的架构优劣。 作者检验了两种解释:任务无关的视觉编码对隐藏状态更新的影响,以及从上下文多模态检索角度理解视觉定位的难度。作者报告,任务感知编码对视觉定位仅带来有限收益,而 Transformer 在上下文多模态检索中显著优于 Mamba。作者据此认为,Mamba 更适合依赖图像整体概括的任务,在需要从上下文检索显式信息时仍有困难;具体编码实现、检索协议、训练配置、消融及统计信息尚未验证。 平台推测(待验证):假设这一“概括与检索”的差异也出现在 EEG 序列中,Mamba 的状态更新机制可能适用于窗口级信息汇总,但对短暂事件或特定时间片段的读取未必占优。可复用的是序列建模骨干,需改造输入编码和任务输出;EEG 的低信噪比、通道差异、跨被试变化及小数据规模均可能使原领域结论失效。一个小规模可证伪实验是在固定 EEG 数据划分、输入编码及相近参数预算下,比较两类骨干在窗口级分类与短暂事件定位上的表现,检验是否出现同样的任务差异。该实验仅为迁移假设,已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的是其受控架构比较及多模态上下文检索分析,可用于核对 Mamba 与 Transformer 在图像概括和显式信息检索任务中的能力边界,但不能据此认定其适用于 EEG 或 BCI。

来源:OpenReview · State space models · openreview.net