MamCIMFlow:面向高效 Mamba 模型加速的 RRAM 存内计算与选择性状态空间流式处理一体化协同设计
MamCIMFlow: An Integrated Co-Design of RRAM-Based CIM and Selective State-Space Streaming for Efficient Mamba Model Acceleration
基于摘要分析。MamCIMFlow 研究 Mamba-2 的硬件执行瓶颈,通过协同设计基于 RRAM 的存内计算(CIM)与专用 State Space Streaming(SSS)单元,联合处理投影矩阵向量乘法的存储带宽瓶颈,以及输入依赖状态转移的动态执行需求。其贡献是面向 Mamba 数据流的硬件架构与映射方法,而非新的 EEG 解码模型。 摘要将投影矩阵向量乘法描述为受“存储墙”限制的操作,将动态状态转移描述为通用系统难以高效处理的操作。MamCIMFlow 的核心机制包括:一体化集成 RRAM-CIM 与流式处理单元;把 Mamba-2 方程映射为连续流水线;采用以流式处理为中心的 RRAM 组织,及时产生可供 SSS 使用的向量,以衔接存储受限与控制受限操作。 作者报告,在摘要未明确工作负载、硬件配置及精度条件的实验中,相对 GPU 的最高加速为 14.1 倍、最高功率效率提升为 319.3 倍;相对一个 CIM 基线的最高加速为 2.29 倍、最高功率效率提升为 3.43 倍;另报告 SRAM 占用减少 66%,但摘要未明确该指标的比较对象。上述最大值是否来自相同配置,以及功率效率的定义、评估采用仿真还是实测,均尚未验证。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 流式模型采用可映射的 Mamba-2 运算,其投影计算与状态更新可能复用这种协同流水线;但需适配通道输入、序列窗口、数值精度及在线延迟约束。低信噪比、小数据和跨被试分布变化可能影响模型本身的可靠性,RRAM 非理想性与量化误差也需单独评估。一个可检验的小实验是固定已训练的 EEG Mamba-2 模型与数据划分,对比软件参考执行和硬件映射执行的任务指标、端到端延迟及功耗,检验计算收益是否伴随精度损失。摘要未提供 EEG/BCI 实验,已有相关工作尚未检索确认。
值得关注其将 RRAM-CIM 与输入依赖状态更新协同流水化的硬件机制,但摘要中的加速与功率效率优势仍需结合工作负载、硬件配置和精度条件核对,不能直接视为 EEG/BCI 部署收益。
来源:OpenReview · State space models · openreview.net