跳到正文
OpenReview · State space models· Aakash Lahoti; Sukjun Hwang; Albert Gu; Tri Dao·· 2024-09-26精选AI 评分81

Hydra:通过广义矩阵混合器构建双向状态空间模型

Hydra: Bidirectional State Space Models Through Generalized Matrix Mixers

AI 导读

基于摘要分析。本文研究通用序列模型中的序列混合机制,提出统一的 matrix mixer(矩阵混合器)视角,并据此构建 Mamba 的双向扩展 Hydra;主要研究对象是通用序列建模及语言、视觉非因果任务,而非 EEG 或 BCI。 技术机制:作者将序列混合器概念化为作用于输入序列的线性映射,以结构化矩阵类别的性质分析效率与表达能力。该框架覆盖 Transformer 的 self-attention 与结构化状态空间模型(SSMs)。作者提出名为 sequence alignment 的矩阵参数化维度,认为它能够提高矩阵混合器的灵活性与性能;摘要未给出其具体定义与实现。Hydra 被参数化为 quasiseparable matrix mixer,是这一框架下构建的双向、次二次复杂度序列模型,可作为注意力层的替换组件。具体计算过程、训练目标与复杂度适用条件尚未验证。 结果:在摘要所述非因果任务中,作者报告 Hydra 在 GLUE benchmark 上比 BERT 高 0.8 分,在 ImageNet 上比 ViT 高“2% Top-1 accuracy”。摘要未明确后者是相对提升还是百分点差异,也未披露模型规模、训练预算及完整评估协议,因此不能扩展解释或据此判断公平对照。实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设双向结构化序列混合能够利用完整 EEG 窗口中的前后文,它可能适用于离线分类或表征学习;但原领域有效不等于 BCI 有效,已有 EEG 相关工作尚未检索确认。可复用模块是序列混合器,需改造 EEG 输入编码、通道组织及任务输出。其依赖有序序列与完整窗口上下文,低信噪比、跨被试差异、通道变化和小数据可能削弱收益;双向访问也不直接适用于严格因果的在线解码。 一个可检验的小实验是在固定 EEG 数据划分、输入窗口、训练预算及近似模型规模下,仅替换序列混合器,对比 Hydra、单向 Mamba 与 self-attention,并在同一跨被试协议下报告任务指标、运行时间和显存占用,以检验双向混合是否带来稳定收益。该实验是平台建议,不是原论文结果。

阅读价值

值得阅读的是以矩阵结构统一分析序列混合器,并据此构造非因果双向 Hydra;其能否改善离线 EEG 序列建模仍需独立验证。

来源:OpenReview · State space models · openreview.net