跳到正文
OpenReview · State space models· Jerome Sieber; Carmen Amo Alonso; Alexandre Didier; Melanie N. Zeilinger; Antonio Orvieto·· 2024-01-01精选AI 评分78

理解基础模型的差异:注意力、状态空间模型与循环神经网络

Understanding the differences in Foundation Models: Attention, State Space Models, and Recurrent Neural Networks

AI 导读

基于摘要分析。本文研究基础模型中 softmax attention、线性注意力、State Space Models(SSMs)与 Recurrent Neural Networks(RNNs)的共同原理及差异,提出 Dynamical Systems Framework(DSF),将这些架构置于统一表示中,以分析其性能与可扩展性相关的理论性质。 研究动机是 softmax attention 随序列长度呈二次增长的计算复杂度可能限制长上下文推理吞吐量,而替代架构虽然存在联系,却常被独立开发。DSF 的主要贡献是提供统一比较框架,而非仅提出一种替换注意力的新模型。作者报告,该框架揭示了线性注意力与选择性 SSMs 的差异及二者等价的条件,并讨论了 softmax attention 可被其他模型类别近似的理论条件;作者还报告以数学论证和经验验证支持这些分析。摘要未提供具体等价条件、近似误差界、实验任务、数据集、对照基线或定量结果,实验协议、消融及统计信息尚未验证,不能据此认定某类架构普遍优于另一类。 平台推测(待验证):其潜在 EEG 关联在于长时间序列建模中的计算开销与历史信息保留之间的权衡,而不是已验证的 BCI 效果。假设 DSF 的比较条件可用于分析 EEG 序列编码器,则可复用统一动力系统表示与架构比较思路;需根据多通道输入、采样方式和任务监督改造输入表示及输出模块,并核对理论条件对状态维度、序列结构和近似精度的依赖。低信噪比、通道差异、跨被试分布变化及小数据训练可能使原领域的效率或表达能力优势无法转化为解码收益。 一个可检验的小实验是在同一 EEG 任务与固定跨被试划分下,统一预处理、训练预算和输出头,比较线性注意力与选择性 SSMs 随输入序列长度变化的任务指标、推理吞吐量和显存占用,以检验其效率差异是否伴随解码性能变化;这属于迁移假设,不是论文已报告的实验。已有 EEG 相关工作尚未检索确认,复现原论文仍需取得全文中的理论假设、实现细节与评估协议。

阅读价值

值得阅读其以 Dynamical Systems Framework 统一比较注意力、SSMs 与 RNNs 的理论路径,尤其是线性注意力与选择性 SSMs 的等价条件,但具体条件与经验验证协议仍需核对全文。

来源:OpenReview · State space models · openreview.net