跳到正文

算法、任务与模态

Compression 最新动态

Compression 研究索引;按可核对的标签归档,不以热度评价质量。

24 条精选近 30 天 18 条共收录 27 条

更新

精选归档 · 第 2 页

10月20日周一第 21–24 条
  1. OpenReview · State space models75

    Bi-Mamba:迈向高精度的 1-bit 状态空间模型

    基于摘要分析。该研究面向大语言模型训练与部署的资源开销,提出 1-bit Mamba 架构 Bi-Mamba,探索在低比特表示下保留选择性状态空间模型的语言建模能力;原论文研究对象是语言模型,并非 EEG 或 BCI。 方法上,Bi-Mamba 使用自回归蒸馏损失从零训练,提供 780M、1.3B 和 2.7B 三种模型规模。摘要称训练数据量与常规大语言模型预训练相当,但未给出具体语料及规模。哪些权重、激活或状态被二值化,蒸馏教师与损失形式,以及训练和推理中的数值精度安排,尚未验证。作者将其定位为低比特表示下具有线性计算复杂度的大语言模型框架,但复杂度与实际运行收益仍需结合实现核对。 结果方面,作者报告:在语言建模实验中,Bi-Mamba 的性能接近 FP16 或 BF16 全精度对应模型,并优于训练后二值化(PTB)Mamba 与二值化感知训练(BAT)Transformer 基线;相较原始 Mamba,内存占用和计算消耗显著降低。摘要未提供评估数据集、指标数值、数据划分、硬件条件及基线配置,因此无法量化性能差距或资源收益;实验协议、消融及统计信息尚未验证。作者称代码位于补充材料,并提供匿名预训练权重,但当前未核验其完整性和可复现性。 平台推测(待验证):可迁移的假设是,低比特状态空间序列建模可能缓解长时 EEG 解码的存储与部署开销,而不是直接复用语言模型权重。可考察其二值化与蒸馏训练机制,但需改造 EEG 输入编码、任务输出及监督目标;语言模型规模下的效果不能保证在低信噪比、跨被试差异、通道变化和小数据条件下成立。一个可证伪的小实验是在固定 EEG 数据划分与同一解码任务下,对照全精度 Mamba 与相应二值化版本,同时记录任务指标、峰值内存和同一硬件上的推理延迟,检验压缩收益是否以明显性能下降为代价。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其从零训练结合自回归蒸馏的 1-bit Mamba 路线能否兼顾语言建模性能与部署成本,但摘要不足以验证实际量化范围、硬件收益及 EEG 迁移价值。

2月11日周二
  1. OpenReview · State space models75

    Bi-Mamba:面向高精度的 1-bit 状态空间模型

    基于摘要分析。该研究面向大语言模型训练与部署的存储及能耗问题,提出 1-bit Mamba 架构 Bi-Mamba,通过从头训练与自回归蒸馏,探索低比特表示下保持语言建模性能的路径;主要研究对象是语言模型,而非 EEG 或 BCI。 机制与训练:Mamba 的选择性状态空间模型避免了 Transformer 随序列长度增长的二次计算复杂度及推理时的 key-value cache 开销,但模型规模增长仍带来资源压力。Bi-Mamba 提供 780M、1.3B 和 2.7B 三种模型规模,摘要称其采用常规大语言模型预训练量级的数据,并使用自回归蒸馏损失从头训练。具体二值化对象、保留高精度的运算、蒸馏教师及损失形式尚未验证,不能据“1-bit”认定全部参数、激活和状态均采用一位表示。 结果与证据边界:在语言建模实验中,作者报告 Bi-Mamba 的性能接近 FP16 或 BF16 全精度对应模型,优于训练后二值化(PTB)Mamba 与二值化感知训练(BAT)Transformer 基线,并较原始 Mamba 显著降低内存占用和能耗。摘要未提供数据集、数据划分、具体指标、性能差值或资源测量环境,因此这些结论的适用范围及可比性尚需全文核对;实验协议、消融及统计信息尚未验证。作者称代码位于补充材料,并提供匿名预训练权重,但其内容与可运行性尚未验证。 平台推测(待验证):迁移假设是,低比特选择性状态空间计算可能缓解长时 EEG 建模的部署内存压力。可尝试复用状态空间骨干与蒸馏思路,但需改造 EEG 输入编码、任务输出和教师模型;其原始训练依赖大规模文本与自回归监督,不能直接等同于小数据 EEG 分类。低信噪比、通道差异和跨被试分布变化可能放大二值化误差。一个可证伪的小实验是在固定 EEG 数据划分、相同骨干规模及训练预算下,对照全精度模型与 1-bit 蒸馏模型,同时测量任务指标、峰值内存及固定硬件上的能耗,检验资源收益是否伴随不可接受的性能下降。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其从头训练与自回归蒸馏如何缓解 Mamba 的 1-bit 表示性能损失,但摘要中的语言建模表现与资源收益尚不足以证明其适用于 EEG/BCI。

1月1日周三
  1. OpenReview · State space models71

    SSMLoRA:利用状态空间模型增强低秩适应

    基于摘要分析。SSMLoRA 针对语言模型参数高效微调中 LoRA 表现随插入位置变化、部分插入可能造成参数冗余的问题,引入状态空间模型(SSM)连接低秩矩阵,使适配过程能够利用前一低秩空间的计算,并支持更稀疏的插入。 机制上,摘要描述了输入到低秩空间的映射,以及低秩空间之间的计算复用;其目标不仅是减少可训练参数,还包括减少不必要的适配模块插入。SSM 状态如何传递、低秩矩阵如何连接、插入位置如何选择,以及训练损失与推理开销,均需全文核对,不能仅凭摘要确定具体结构。 作者报告,在 General Language Understanding Evaluation(GLUE)benchmark 上,SSMLoRA 使用 LoRA 一半的适配参数即可取得相当表现;这一结论限于摘要所述 GLUE 对照,基础模型、各任务指标、数据划分、低秩维度及参数统计口径尚未验证。作者还认为其结构有望处理更长输入序列,但摘要未提供长序列实验结果,因此不能视为已验证优势。实验协议、消融及统计信息尚未验证。摘要提供了代码仓库链接,代码完整性与可复现性仍待检查。 平台推测(待验证):若 EEG 预训练模型采用多处 LoRA 适配,可假设低秩空间之间的状态传递有助于减少插入点。可复用的是低秩适配与状态连接思路,需改造的是 EEG 骨干接口、跨模块状态定义及通道布局适配。该假设依赖可适配的预训练骨干和足够的任务监督;低信噪比、跨被试差异、通道变化及小样本可能使共享状态传播噪声或产生过拟合。一个可证伪的小实验是在固定跨被试划分与同一 EEG 骨干上,对比常规 LoRA、稀疏 LoRA 和 SSMLoRA,同时控制可训练参数预算与训练条件,检验收益是否来自状态连接而非参数配置。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 SSM 连接低秩空间是否能降低 LoRA 对插入位置的敏感性:作者报告在 GLUE 上以一半适配参数取得相当表现,但具体参数口径、插入方案与评估协议尚未验证。

1月1日周一
  1. OpenReview · State space models72

    利用平衡截断压缩含对角状态空间层的 S4 模型

    基于摘要分析。本文研究面向长序列处理、含 Diagonal State Space(DSS)层的 Structured State Space Sequence(S4)模型如何进行压缩,以支持边缘设备部署。核心贡献是将控制理论中的 balanced truncation(平衡截断)用于预训练 S4 模型的 DSS 层,并将降阶后的参数用于后续 S4 模型主训练过程的初始化。 方法包含两个用途:压缩预训练模型中的状态空间层,以及利用压缩所得参数初始化较小模型。摘要未给出平衡截断的具体实现、降阶维度选择、降阶后如何保持或转换 DSS 参数形式,以及后续训练设置,这些机制细节尚需全文核对。 作者报告,在摘要所述数值实验中,结合平衡截断训练的模型以更少参数取得了高于常规 Skew-HiPPO 初始化模型的准确率;作者还报告,原模型准确率越高,经该方法训练的模型准确率也越高,认为该方法能够利用原模型的优势。摘要未提供任务、数据集、划分协议、参数量及准确率数值,实验协议、消融及统计信息尚未验证。上述结果不直接证明实际边缘设备上的延迟、内存或能耗收益。 平台推测(待验证):若 EEG 长序列模型采用 S4/DSS 层,该方法可能对应边缘端部署时的模型规模瓶颈。可复用部分是预训练状态空间层的降阶及参数初始化流程;需核对降阶参数与现有 DSS 实现的兼容性,并根据 EEG 任务调整输入、输出及训练配置。其依赖已训练模型和后续任务训练,但摘要未说明监督方式与数据规模。低信噪比、通道差异、小样本及跨被试变化可能使原模型优势难以保留,降阶也可能损失判别所需的时序信息。一个可证伪的小实验是在同一 EEG 数据划分和训练预算下,对比未压缩 S4、平衡截断初始化的小模型与参数量匹配的 Skew-HiPPO 初始化小模型,同时测量任务准确率及设备延迟。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其将控制理论中的 balanced truncation 用于 DSS 层压缩与训练初始化的机制,以及相对 Skew-HiPPO 初始化的参数量—准确率权衡;其在 EEG 长序列建模中的适用性尚未验证。