跳到正文
OpenReview · State space models· Jianing Zhou; Han Li; Shuai Zhang; Ning Xie; Ruijie Wang; Xiaohan Nie; Sheng Liu; Lingyun Wang·· 2024-01-01精选AI 评分73

基于混合状态空间模型的多模态指令微调

Multimodal Instruction Tuning with Hybrid State Space Models

AI 导读

基于摘要分析。本文研究多模态大语言模型(MLLMs)处理高分辨率图像和高帧率视频时的长上下文计算瓶颈,提出混合 transformer-MAMBA 模型,旨在避免仅通过减少图像块或视频帧来缩短上下文所造成的信息损失。 技术机制:图像分辨率或视频帧数增加会带来更多输入 token,而自注意力的计算复杂度随序列长度呈二次增长。作者采用 transformer 与 MAMBA 的混合架构来处理这一问题,但摘要未说明两者的组合方式、视觉 token 编码、指令微调数据、损失函数及训练流程,不能据此确定具体计算路径或整体复杂度。 结果与评估:作者报告模型能够处理超过 100k tokens 的输入,并在多个基准上优于现有模型,但未列出基准名称、任务指标或对照配置。针对高分辨率图像和高帧率视频推理,作者报告相较现有模型约有 4 倍效率提升,且收益随分辨率或帧数增加而扩大;具体硬件、精度、批量大小及效率度量尚未验证。作者还报告模型可在低分辨率图像或低帧率视频上训练,并在高分辨率图像或高帧率视频上推理;摘要未给出对应训练与测试范围。实验协议、消融及统计信息尚未验证。 平台推测(待验证):其潜在 EEG 对应点是长时序建模的计算成本,而非已经验证的 BCI 解码效果。假设混合架构能保留长程依赖,可考察状态空间序列模块与注意力模块的复用,但视觉编码与指令监督需改造成适合 EEG 通道、时间采样和任务标签的形式。低信噪比、跨被试差异、通道变化及小数据可能削弱收益。可在同一 EEG 数据集、固定跨被试划分下,对照混合模型与纯 transformer,比较不同序列长度下的任务指标、延迟和显存占用,以检验是否存在效率—性能收益;已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对混合 transformer-MAMBA 架构能否在保留视觉信息的同时降低长上下文推理开销,尤其是作者报告的低分辨率训练到高分辨率推理能力;具体效率基线与泛化协议尚未验证。

来源:OpenReview · State space models · openreview.net