SERESA:通过选择性递推限制加速状态空间对偶性
SERESA: Selective Recurrence Restriction for State Space Duality Acceleration
基于摘要分析。本文研究 Mamba-2 的 State Space Duality(SSD)在语言模型预填充阶段的计算效率与实际延迟不匹配问题,提出无需额外训练的 SERESA,利用不同头的时间依赖差异选择性限制递推范围,而非对所有头统一执行完整递推。 作者报告,在其分析设置下,SSD 占用不足 5% 的 FLOPs,却消耗近 20% 的预填充延迟。方法先定义有效递推分布及其期望滞后 Effective Recurrence Length(ERL),衡量各头对输出有贡献的递推跨度。作者发现,多数头的贡献集中于短时间滞后,长程贡献集中在少数头中,且各头的 ERL 排序在不同输入分布下保持较稳定。 SERESA 根据 ERL 分布确定受限头数量,并选择在指定递推长度内保留贡献最多的头,减少这些头的块内与块间计算;通过边界修正恢复跨边界贡献,其余头保留完整递推。该流程无需额外训练或依赖输入重新选择头。边界修正的具体公式、ERL 的估计数据与成本尚未验证。 作者报告,在 Mamba-2 和 Nemotron-H 上,SERESA 限制了 78–83% 的头,困惑度和下游 Accuracy 接近完整递推基线;SSD 核心加速为 1.75–2.02 倍,结合投影量化时端到端预填充加速最高为 1.29 倍。摘要未提供具体模型规模、硬件、序列长度、任务及数据划分,也未给出性能差值;核心加速与端到端加速不能直接等同。实验协议、消融及统计信息尚未验证。作者表示代码将在论文被接收后公开,当前不能据此认定已接收或代码已发布。 平台推测(待验证):若 EEG 序列模型采用相同 SSD 机制且各头依赖跨度也较稳定,可复用 ERL 分析和选择性递推框架,但需重新估计信号域的 ERL、限制长度与边界修正误差。低信噪比、跨被试变化及稀有长程事件可能使短程贡献占优的判断失效。一个可检验的小实验是在固定 EEG 任务与同一数据划分下,对比完整递推和受限递推的任务性能、延迟及各头 ERL 稳定性;语言模型中的收益不构成 EEG/BCI 有效性证据,已有 EEG 相关工作尚未检索确认。
值得核对其基于有效递推长度选择性缩短 SSD 递推的机制,以及边界修正能否在保持任务性能的同时降低实际预填充延迟;摘要中的加速结果尚需结合硬件与评估协议验证。
来源:OpenReview · State space models · openreview.net