跳到正文
OpenReview · State space models· Hung-Yueh Chiang; Chi-Chih Chang; Natalia Frumkin; Kai-Chiang Wu; Diana Marculescu·· 2024-01-01精选AI 评分78

Quamba:选择性状态空间模型的训练后量化方案

Quamba: A Post-Training Quantization Recipe for Selective State Space Models

AI 导读

基于摘要分析。本文主要研究用于大语言模型的选择性状态空间模型(SSM)如何通过训练后量化降低部署成本,提出 Quamba 静态 8-bit 逐张量量化方案,针对 selective scan 内部特征的量化敏感性及输出激活中的大量离群值进行处理。其核心贡献是将输入激活最大值抑制与输出端 Hadamard transform 结合,以支持低比特权重与激活计算。 机制上,作者指出 selective scan(线性递推)中的特征对量化误差高度敏感,而输出激活的离群值又会扩大量化范围。Quamba 抑制进入选择性 SSM 的输入激活最大值,以获得更细的量化精度;同时借助 Hadamard transform,在作者所称的无离群值空间中量化输出激活。摘要未给出最大值抑制的具体实现、变换与算子的融合方式,以及静态量化的校准数据和流程。 作者报告,对 Mamba 2.8B 进行 8-bit 权重与激活量化后,在 Nvidia Orin Nano 8G 上获得 1.72 倍生成延迟加速,zero-shot 任务平均准确率下降原文记为 0.9%。摘要未明确这一下降指相对百分比还是百分点,也未列出任务集合、对照精度、上下文长度、批量大小和延迟测量设置,因此不能直接外推到其他硬件或任务。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 序列模型采用相同或相近的选择性 SSM 模块,假设其部署瓶颈同样涉及递推特征的量化敏感性与激活离群值,则可尝试复用上述量化机制;但需重新校准 EEG 输入分布、通道布局与任务输出,不能将语言模型结果视为 BCI 有效性证据。低信噪比、跨被试幅值差异及小规模校准数据可能使抑制操作损伤有效信号,或使量化范围失配。一个可检验的小实验是在固定跨被试划分的已有 EEG SSM 模型上,对比浮点模型、常规 8-bit 量化与 Quamba 式处理,分别测量任务指标、端侧延迟及递推误差,并单独检验两项处理的作用。相关 EEG 工作尚未检索确认。

阅读价值

值得阅读的具体原因是 Quamba 针对 selective scan 的量化敏感性与输出离群值分别设计处理机制,并提供边缘硬件上的延迟与精度权衡证据;其对 EEG 模型部署的价值尚未验证。

来源:OpenReview · State space models · openreview.net