跳到正文
OpenReview · State space models· Sukjun Hwang; Aakash Lahoti; Tri Dao; Albert Gu·· 2024-01-01精选AI 评分79

Hydra:通过广义矩阵混合器构建双向状态空间模型

Hydra: Bidirectional State Space Models Through Generalized Matrix Mixers

AI 导读

基于摘要分析。本文研究通用序列模型中的序列混合机制,提出统一的矩阵混合器视角,并据此构建 Mamba 的双向扩展 Hydra,主要面向非因果任务,而非 EEG 或 BCI 专用模型。 技术机制:作者将序列混合器概念化为作用于输入序列的线性映射,以结构化矩阵类别的性质分析效率与表达能力。该框架涵盖 Transformer 自注意力和结构化状态空间模型(SSMs),并提出称为 sequence alignment 的矩阵参数化维度,用于提高混合器的灵活性与性能。作者进一步利用这一框架设计若干次二次复杂度的序列模型,其中 Hydra 被参数化为 quasiseparable matrix mixer,提供自然的双向序列混合。具体矩阵构造、输入依赖方式、训练目标及复杂度推导尚未验证。 结果:作者报告,作为注意力层的直接替代方案,Hydra 在 GLUE benchmark 上比 BERT 高 0.8 分,在 ImageNet 上比 ViT 的 Top-1 accuracy 高 2%(原文表述,尚不能确定指相对百分比还是百分点)。摘要未提供模型规模、预训练数据、数据划分、基线配置或计算预算,因此不能据此判断不同配置下的收益与效率;实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设双向结构化序列混合能够在较低计算成本下保留长程信息,则其可能用于离线 EEG 窗口分类中的时间依赖建模。原论文的机制依赖有序序列表示,但摘要未说明监督方式与训练规模。可尝试复用序列混合模块,需改造 EEG 输入表示、通道融合及分类输出;双向访问整个窗口不宜直接等同于因果在线 BCI。低信噪比、跨被试分布差异、通道变化和小样本训练均可能削弱收益。一个可检验的小实验是在固定 EEG 数据集、相同跨被试划分与训练预算下,仅替换注意力混合器为 Hydra,比较预先指定的分类指标、峰值显存和推理延迟,以检验收益是否成立。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其用矩阵结构统一分析序列混合器、并构造非因果双向 Hydra 的方法路径;其对离线 EEG 序列建模的价值仍需独立验证。

来源:OpenReview · State space models · openreview.net