跳到正文
OpenReview · State space models· Sukjun Hwang; Aakash Lahoti; Ratish Puduppully; Tri Dao; Albert Gu·· 2024-09-26精选AI 评分79

Hydra:通过广义矩阵混合器构建双向状态空间模型

Hydra: Bidirectional State Space Models Through Generalized Matrix Mixers

AI 导读

基于摘要分析。本文研究通用序列模型中的序列混合机制,提出统一的 matrix mixer(矩阵混合器)视角,并据此构造 Mamba 的双向扩展 Hydra;主要研究对象是通用序列建模及语言、图像非因果任务,而非 EEG 或 BCI。 技术机制:作者将序列混合器概念化为作用于输入序列的线性映射,用结构化矩阵类别分析效率与表达能力,覆盖 Transformer 自注意力和结构化状态空间模型(SSMs)。作者提出名为 sequence alignment 的矩阵参数化维度,认为其可提高混合器的灵活性与性能,并用于解释 Transformer 和 Mamba 的表现。该框架还用于设计若干亚二次复杂度序列模型;其中 Hydra 采用 quasiseparable matrix mixer(拟可分矩阵混合器)参数化,实现双向序列混合。摘要未给出具体矩阵构造、训练目标或复杂度推导,相关细节尚未验证。 结果:作者报告,将 Hydra 作为注意力层的替代模块时,在 GLUE benchmark 上较 BERT 提高 0.8 分,在 ImageNet 上较 ViT 提高 2% Top-1 accuracy。摘要未说明 GLUE 汇总指标、ImageNet 的 2% 是相对增幅还是百分点差值,也未交代模型规模、预训练数据及训练预算,因此不能据此判断等资源条件下的优势。实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设双向混合有助于整合完整 EEG 片段的前后文,则 Hydra 可作为离线 EEG 分类中时间序列混合模块的候选,但不能直接视为满足在线因果 BCI 要求。可复用部分是双向时间混合机制;需改造 EEG 输入编码、通道组织和任务输出头。低信噪比、跨被试差异、通道变化及小数据训练可能使原领域优势失效。一个可证伪的小实验是在固定 EEG 数据划分、输入编码与训练预算下,仅替换 Transformer、Mamba 和 Hydra 时间混合模块,分别评估被试内与跨被试表现,并比较推理成本。该建议不是论文已验证结果;已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其以矩阵结构统一分析序列混合器、并构造双向 Hydra 的机制;其对离线 EEG 序列建模的适用性仍属待验证假设。

来源:OpenReview · State space models · openreview.net