跳到正文
OpenReview · State space models· Jinhao Li; Shan Huang; Jiaming Xu; Jun Liu; Ningyi Xu; Guohao Dai·· 2025-01-01精选AI 评分74

MARCA-v2:结合互补状态空间模型稀疏性与可重构架构的 Mamba 加速器

MARCA-v2: Mamba Accelerator with Complementary State Space Model Sparsity and Reconfigurable Architecture

AI 导读

基于摘要分析。本文研究 Mamba 模型的硬件执行效率,而非 EEG/BCI 建模,提出基于 MARCA 的加速器 MARCA-v2,通过互补 SSM 稀疏性、轻量稀疏调度和可重构处理单元复用,降低访存、冗余执行及非线性单元的面积开销。 作者报告,在 MARCA 架构、序列长度为 2048 的剖析条件下,SSM 占总运行时间的 62.52%;其逐元素运算的访存开销与耗时占比分别为 97.17% 和 96.56%。针对这些瓶颈,方法采用列粒度互补静态稀疏性,以 δ-bitmap 编码压缩存储,并引入稀疏逐元素运算抽象;Meta-PU 解码稀疏元数据,动态生成控制信号以引导 PE 阵列;指数函数和 SiLU 则分解为逐元素运算,复用可重构 PE,作者称精度损失可忽略。具体稀疏判据、近似误差与硬件实现条件尚未验证。 作者报告,在不同规模 Mamba 模型的 prefill 阶段,相对 Mamba-GPU、MARCA、Spada,速度提升依次为 1.77–10.87×、1.03–1.08×、4.78–9.10×,能效提升依次为 8.29–33.47×、1.03–1.08×、4.78–9.10×;decode 阶段对应速度倍率为 0.88–7.65×、1.00–1.01×、1.19–1.64×,能效倍率为 3.11–27.01×、1.00–1.01×、1.19–1.64×。其中 decode 相对 GPU 并非所有条件都加速,相对 MARCA 的增益也较有限。模型清单、工作负载、硬件配置、能效测量口径、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 应用采用 Mamba 且瓶颈确为 SSM 访存,可复用元数据调度和 PE 复用思路;列稀疏规则则需根据 EEG 模型激活分布重新验证,不能沿用语言模型结果。该假设依赖 Mamba 运算结构与可压缩激活分布,低信噪比、跨被试或通道变化可能改变稀疏模式,小数据条件也可能使精度损失难以可靠估计。可在一个既有 EEG Mamba 模型上固定数据划分与权重,对比稠密执行和列稀疏执行的任务指标、延迟及能耗,检验收益是否成立。相关 EEG 工作尚未检索确认。

阅读价值

值得阅读其将 SSM 列粒度稀疏、元数据调度与非线性单元复用结合的软硬件协同机制,但相对 MARCA 的增益较小,且 EEG/BCI 部署收益尚未验证。

来源:OpenReview · State space models · openreview.net