跳到正文

算法、任务与模态

VLM 最新动态

VLM 研究索引;按可核对的标签归档,不以热度评价质量。

41 条精选近 30 天 32 条共收录 44 条

更新

精选归档 · 第 3 页

12月31日周二第 41–41 条
  1. OpenReview · State space models73

    VL-Mamba:探索状态空间模型在多模态学习中的应用

    基于摘要分析。本文研究状态空间模型(SSMs)能否作为 Transformer 的替代方案用于视觉—语言多模态学习,提出以预训练 Mamba 语言模型为核心的 VL-Mamba,并通过 MultiModal Connector(MMC)增强视觉序列建模。主要研究对象是视觉与文本信息的整合及模态对齐,而非神经信号或 BCI。 方法上,MMC 引入 Vision Selective Scan(VSS)模块;作者探索二维视觉选择性扫描机制在多模态学习中的应用,以及不同视觉编码器与预训练 Mamba 语言模型变体的组合。摘要未给出连接器的具体结构、扫描路径、损失函数、训练阶段或参数规模,这些实现细节尚未验证。作者将该工作称为首次探索 SSMs 在多模态学习中的应用,此优先性声明尚未独立核实。 结果方面,作者报告,在多个多模态基准上,VL-Mamba 与规模相近的小型 MLLMs 表现具有竞争力,并在部分评估中超过 LLaVA-1.5 的 7B 和 13B 版本。摘要未列出基准名称、指标、具体分数、数据划分或训练资源,因而不能据此判断整体优势,也不能将局部结果推广至所有任务。实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可供 EEG 多模态建模参考的机制是利用 SSM 建模序列,并以连接器对接异构模态表征;但原方法依赖视觉编码器、二维视觉结构和预训练语言模型,不能直接视为 EEG 方法。若用于 EEG—文本配对任务,可复用 Mamba 核心与连接器思路,但需改造 EEG 编码器及通道—时间扫描方式,并核对配对监督和训练数据规模。EEG 的低信噪比、通道布局差异、跨被试分布偏移及小样本条件均可能使迁移失败。一个可检验的小实验是在固定 EEG 编码器、训练数据及跨被试划分下,对比简单投影连接器与适配通道—时间结构的扫描连接器,检验扫描机制是否带来稳定增益。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以预训练 Mamba 与视觉选择性扫描连接器实现视觉—语言建模的机制及对照,但摘要中的性能结论仍需结合完整评估协议核对,尚无 EEG/BCI 有效性证据。