基于混合状态空间模型的多模态指令微调
Multimodal Instruction Tuning with Hybrid State Space Models
基于摘要分析。本文研究多模态大语言模型(MLLMs)处理高分辨率图像与高帧率视频时,输入 token 增长带来的计算负担,提出混合 transformer-MAMBA 模型,以保留长上下文信息并提高推理效率。主要研究对象是视觉多模态理解,而非 EEG 或 BCI。 机制与对照:摘要将瓶颈归因于自注意力对序列长度的二次复杂度,并指出已有路线或采用长上下文预训练但未解决效率问题,或通过筛选图像 patch、视频帧等下采样方式缩短上下文,可能损失信息。本文以 transformer 与 MAMBA 的混合方式处理长序列,但摘要未交代两者的组合结构、视觉 token 编排、指令微调数据、损失及训练流程,不能据此确定具体实现。 结果:作者报告模型能够处理超过 100k tokens 的多模态输入,并在多个 benchmark 上优于现有模型;在高分辨率图像与高帧率视频推理场景中,相对所比较的当前模型,推理效率约提升 4 倍,且收益随图像分辨率或视频帧数增加而扩大。具体 benchmark、基线、硬件、精度设置以及“效率”对应的测量指标尚未验证。作者还声称其模型首次实现仅以低分辨率图像或低帧率视频训练,却可在高分辨率图像或高帧率视频上推理;这一优先性及对应评估协议需查正文核对。 平台推测(待验证):假设混合状态空间机制能在较低计算成本下保留长时序信息,可考虑用于长时间 EEG 与外部事件信息的联合建模。可复用的是长序列处理思路,需改造的是 EEG token 化、通道与时间编码及任务监督;视觉分辨率泛化不等于 EEG 跨采样率或跨被试泛化,低信噪比、通道差异和小数据训练均可能使迁移失败。一个可检验的小实验是在固定被试划分、训练数据和相近参数预算下,对比混合模型与 transformer 在不同 EEG 窗口长度下的任务指标、推理延迟和显存占用。已有 EEG 相关工作尚未检索确认;原论文实验协议、消融及统计信息尚未验证。
值得核对其混合 transformer-MAMBA 如何兼顾长上下文处理与推理效率,尤其是低分辨率或低帧率训练向高分辨率或高帧率推理的泛化,但效率对照与训练协议尚未验证。
来源:OpenReview · State space models · openreview.net