跳到正文
OpenReview · State space models·· 2024-10-16精选AI 评分71

SSMLoRA:利用状态空间模型增强低秩适配

SSMLoRA: Enhancing Low-Rank Adaptation with State Space Model

AI 导读

基于摘要分析。SSMLoRA 针对语言模型参数高效微调中 LoRA 对插入位置敏感、部分插入可能冗余的问题,引入状态空间模型(SSM)连接低秩矩阵,旨在通过复用先前低秩空间的计算,在更稀疏的插入配置下维持任务性能。 机制上,标准 LoRA 向预训练权重矩阵引入低秩适配参数;SSMLoRA 在输入映射至低秩空间之外,进一步利用先前低秩空间的计算。其主要研究价值是检验适配模块之间的信息传递能否降低对插入密度的依赖。摘要未说明 SSM 的具体状态更新、连接顺序、插入策略、训练损失或基础语言模型,相关实现尚未验证。 作者报告,在 GLUE 基准上,SSMLoRA 使用 LoRA 一半的参数获得可比性能;摘要未提供具体分数、任务级结果、参数统计口径及训练和评估划分,不能据此判断所有任务均保持性能。作者还认为其结构有望处理更长输入序列,但摘要未给出相应长序列实验结果。实验协议、消融及统计信息尚未验证,复现前需核对插入数量、低秩维度、SSM 开销与对照配置。 平台推测(待验证):假设 EEG 预训练模型具有多个可插入适配模块的位置,跨模块复用低秩计算可能帮助降低下游微调参数量,但语言理解结果不等于 EEG/BCI 有效。可复用的是低秩适配与 SSM 连接思路,需改造的是适配位置、输入表示及状态传递方式;摘要并未确定这种状态传递是否对应时间维度。低信噪比、跨被试分布差异、通道变化和小样本可能使共享状态传播无关信息。一个可证伪的小实验是在同一 EEG 预训练模型与固定 Cross-subject 划分下,对比标准 LoRA、稀疏 LoRA 与 SSMLoRA,在匹配适配参数预算时检验任务性能及稳定性。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其通过 SSM 连接低秩适配计算、减少 LoRA 插入位置的机制,以及作者报告的 GLUE 性能与适配参数量权衡;其长序列优势尚待具体实验验证。

来源:OpenReview · State space models · openreview.net