跳到正文
OpenReview · State space models· Shengkun Tang; Liqun Ma; Haonan Li; Mingjie Sun; Zhiqiang Shen·· 2024-01-01精选AI 评分74

Bi-Mamba:面向高精度的 1-bit 状态空间模型

Bi-Mamba: Towards Accurate 1-Bit State Space Models

AI 导读

基于摘要分析。该研究面向大语言模型的训练与部署成本,提出 1-bit Mamba 架构 Bi-Mamba,探索在低比特表示下保留选择性状态空间模型(SSM)的语言建模能力。其主要对象是语言模型,而非 EEG 或 BCI。 机制与训练:Mamba 使用选择性 SSM,旨在缓解 Transformer 随序列长度增长的二次计算复杂度及推理时 key-value cache 的内存开销。Bi-Mamba 进一步引入 1-bit 表示,提供 780M、1.3B 和 2.7B 三种模型规模,并使用自回归蒸馏损失从头训练;摘要称训练数据量与常规 LLM 预训练相当。具体二值化对象、保留高精度的模块、蒸馏教师及损失形式尚未验证,不能将“1-bit”理解为所有计算与状态均采用二值表示。 结果与对照:在摘要所述语言建模实验中,作者报告 Bi-Mamba 的性能可与 FP16 或 BF16 全精度对应模型相当,并优于训练后二值化(PTB)Mamba 基线;作者还报告相较原始 Mamba 显著降低内存占用与能耗。摘要未提供数据集、具体指标及收益数值,实验协议、消融及统计信息尚未验证,硬件支持与端到端效率亦需查阅正文。 平台推测(待验证):可检验的迁移假设是,将低比特训练与蒸馏用于 Mamba 类 EEG 序列模型,以缓解长时间窗建模及端侧存储压力。可复用的是低比特训练思路;输入编码、任务输出及教师监督需适配多通道连续信号,语言预训练的数据规模优势也不能直接迁移。低信噪比、跨被试差异、通道配置变化与小数据训练可能放大量化误差。一个小实验是在固定 EEG 任务和严格跨被试划分下,对照全精度、PTB 与从头低比特蒸馏训练,使用相同骨干和数据预算,同时测量任务指标、内存及同一硬件上的延迟或能耗。已有 EEG 相关工作尚未检索确认,该实验仅用于验证迁移假设。

阅读价值

值得核对 Bi-Mamba 从头训练与自回归蒸馏如何缓解 Mamba 二值化后的性能损失,但摘要中的效率收益尚需结合量化范围、硬件及测量协议验证,不能直接视为 EEG 部署收益。

来源:OpenReview · State space models · openreview.net