跳到正文
OpenReview · State space models· Shaoqiang Lu; Xuliang Yu; Tiandong Zhao; Siyuan Miao; Xinsong Sheng; Chen Wu; Liang Zhao; Ting-Jung Lin; Lei He·· 2025-12-31精选AI 评分74

MambaOPU:面向基于状态空间对偶的 Mamba 模型的 FPGA 覆盖处理器

MambaOPU: An FPGA Overlay Processor for State-space-duality-based Mamba Models

AI 导读

基于摘要分析。本文研究 Mamba2 中基于状态空间对偶(SSD)的计算加速问题,提出 FPGA 覆盖处理器 MambaOPU,通过算子融合、结构化稀疏计算跳过及可重配置脉动阵列,降低访存开销并提高计算效率;主要贡献是硬件架构与执行优化,而非新的模型训练或神经信号解码方法。 机制方面,作者将 SSD 的效率瓶颈归因于不规则广播逐元素乘法和结构化稀疏计算。软硬件协同算子融合框架包含两项操作:operator merging 将相邻广播乘法与求和操作合并为单一描述符;operator backward shifting 将分段乘法嵌入后续操作,以缩短计算路径。针对稀疏计算,tensor-reorder-and-group 算法与 sparse-predefined data fetcher 配合,跳过零值区域计算。此外,可重配置脉动阵列用于适配 Mamba 中线性运算与 SSD 的不同计算模式,提高数据复用。 结果方面,在与 Intel Xeon Gold 6348 CPU 和 NVIDIA A100 GPU 的比较中,作者报告归一化吞吐量最高分别提升至对照的 1812 倍和 880.79 倍,能效最高分别提升至对照的 12908 倍和 24.27 倍。这些数值对应摘要所述归一化吞吐量与能效,不能直接解释为端到端推理加速。FPGA 型号、归一化定义、模型规模、序列长度、数值精度、批量大小、功耗计量边界及基线实现尚未验证,实验协议、消融及统计信息亦尚未验证。 平台推测(待验证):若 EEG 解码系统采用相同 SSD 运算结构,该架构可能用于优化部署阶段的访存与能耗,但原领域加速不等于 BCI 有效性。可复用部分是算子融合与零值区域跳过策略;需改造部分包括 EEG 模型的算子映射、输入形状及数值精度。短序列、小批量与低通道数可能使调度开销抵消收益,低信噪比及跨被试差异仍需解码模型处理。一个可检验的小实验是固定已训练 EEG Mamba2 模型,在相同输入、精度和批量条件下比较原实现与 FPGA 映射的输出一致性、端到端延迟及能耗,并核对任务指标是否保持。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其面向 SSD 广播运算与结构化稀疏计算的软硬件协同优化机制,但摘要中的大幅加速依赖归一化吞吐量和能效比较,需结合完整测试协议判断适用范围。

来源:OpenReview · State space models · openreview.net