跳到正文
OpenReview · State space models·· 2025-02-11精选AI 评分75

Bi-Mamba:面向高精度的 1-bit 状态空间模型

Bi-Mamba: Towards Accurate 1-Bit State Space Model

AI 导读

基于摘要分析。该研究面向大语言模型训练与部署的存储及能耗问题,提出 1-bit Mamba 架构 Bi-Mamba,通过从头训练与自回归蒸馏,探索低比特表示下保持语言建模性能的路径;主要研究对象是语言模型,而非 EEG 或 BCI。 机制与训练:Mamba 的选择性状态空间模型避免了 Transformer 随序列长度增长的二次计算复杂度及推理时的 key-value cache 开销,但模型规模增长仍带来资源压力。Bi-Mamba 提供 780M、1.3B 和 2.7B 三种模型规模,摘要称其采用常规大语言模型预训练量级的数据,并使用自回归蒸馏损失从头训练。具体二值化对象、保留高精度的运算、蒸馏教师及损失形式尚未验证,不能据“1-bit”认定全部参数、激活和状态均采用一位表示。 结果与证据边界:在语言建模实验中,作者报告 Bi-Mamba 的性能接近 FP16 或 BF16 全精度对应模型,优于训练后二值化(PTB)Mamba 与二值化感知训练(BAT)Transformer 基线,并较原始 Mamba 显著降低内存占用和能耗。摘要未提供数据集、数据划分、具体指标、性能差值或资源测量环境,因此这些结论的适用范围及可比性尚需全文核对;实验协议、消融及统计信息尚未验证。作者称代码位于补充材料,并提供匿名预训练权重,但其内容与可运行性尚未验证。 平台推测(待验证):迁移假设是,低比特选择性状态空间计算可能缓解长时 EEG 建模的部署内存压力。可尝试复用状态空间骨干与蒸馏思路,但需改造 EEG 输入编码、任务输出和教师模型;其原始训练依赖大规模文本与自回归监督,不能直接等同于小数据 EEG 分类。低信噪比、通道差异和跨被试分布变化可能放大二值化误差。一个可证伪的小实验是在固定 EEG 数据划分、相同骨干规模及训练预算下,对照全精度模型与 1-bit 蒸馏模型,同时测量任务指标、峰值内存及固定硬件上的能耗,检验资源收益是否伴随不可接受的性能下降。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其从头训练与自回归蒸馏如何缓解 Mamba 的 1-bit 表示性能损失,但摘要中的语言建模表现与资源收益尚不足以证明其适用于 EEG/BCI。

来源:OpenReview · State space models · openreview.net