蛇与梯:通过推测解码加速状态空间模型推理
Snakes and ladders: Accelerating state space model inference with speculative decoding
基于摘要分析。本文研究大语言模型中状态空间模型(SSM)的推测解码加速:草稿模型先预测多个 token,再由基础模型验证;难点在于草稿被拒绝后,SSM 不仅需要回退 token,还需处理其独立维护的 Markov 状态。作者提出 Joint Attainment and Advancement 与 Activation Replay,利用闲置计算资源进行多 token 推测和验证。 技术机制上,摘要将自回归 Transformer 的历史 token 状态与 SSM 的递归状态作对比,强调后者的状态回退并不直接。两种方法如何保存、恢复或重放状态,以及验证过程如何保证与基础模型生成结果一致,尚无法从摘要确认。作者以简单 n-gram 作为草稿生成器,说明其加速方案不必依赖另一个大型草稿模型;但接受规则、数值一致性与具体实现尚未验证。 作者报告,在三个未具名基准上,生成 6 个 token 的成本为生成单个 token 的 1.47 倍,平均实际运行时间加速为 1.82 倍。摘要未明确两项数字的成本口径及对应配置,不能将其直接等同。作者还报告,模型规模从 1.3B 参数增至 13B 参数时,相对开销从 1.98 倍降至 1.22 倍。硬件、序列长度、批大小、基准任务及统计信息尚未验证。作者进一步指出,该方法可用于序列批处理,并通过动态资源分配提高可变推理流量下的效率与吞吐;摘要未提供对应的量化吞吐结果。 平台推测(待验证):若 EEG 系统使用自回归 SSM 生成离散信号 token,状态回退机制可能用于降低生成延迟,但这不等于改善 BCI 解码效果。其适用性依赖 token 化方式、草稿接受率与可利用的计算余量;低信噪比、跨被试变化或短序列可能削弱收益。可先在固定模型与同一 EEG token 测试集上比较常规生成和推测生成的输出一致性及端到端延迟,再判断是否值得扩展。已有 EEG 相关工作尚未检索确认;本材料未提供 EEG/BCI 实验。
该研究针对 SSM 推测解码中的状态回退难题提出两种方法,并报告运行时间与模型规模相关的开销变化,值得核对其状态恢复机制、输出一致性及批处理吞吐表现;其 EEG/BCI 适用性尚未验证。
来源:OpenReview · State space models · openreview.net