LongSSM:语言建模中状态空间模型的长度扩展研究
LongSSM: On the Length Extension of State-space Models in Language Modelling
基于摘要分析。本文研究语言建模中状态空间模型(SSMs)的长度扩展,即在短序列上训练、在更长序列上测试。核心贡献是将长度扩展困难解释为多项式外推问题,并提出通过改变隐藏状态初始化方案改善长度扩展。 机制与结论:作者报告,以零隐藏状态初始化训练的 SSM 难以实现长度扩展;基于其理论分析,改变初始化方案可以改善这一问题。作者进一步报告,较长训练序列有益,但并非长度扩展的必要条件,调整初始化可使长记忆模型在较短训练上下文下得到高效训练。摘要未提供初始化的具体形式、理论成立条件、模型配置、训练目标或计算开销,因此尚不能判断该方法适用于哪些 SSM,也不能量化改进幅度。语言数据集、训练与测试长度、对照基线、实验协议、消融及统计信息尚未验证。 平台推测(待验证):可检验的迁移假设是,隐藏状态初始化可能影响 EEG 时序 SSM 从短训练窗口向长测试窗口的泛化;这并不等于已证实的 EEG 长程解码能力。原研究依赖语言序列及短训练、长测试的长度差异,迁移时需重新评估连续多通道信号输入、采样率、窗口边界及状态重置方式。可复用的候选模块是初始化机制,需改造或核对 EEG 输入表示与状态传递策略;低信噪比、跨被试差异、通道配置变化及小数据可能使效果失效。取得具体方案后,可固定 EEG 数据划分、模型与训练窗口,仅比较零初始化和论文初始化,在逐步增加测试窗口长度时观察任务指标与稳定性,检验收益是否来自初始化。已有 EEG 相关工作尚未检索确认。
值得阅读其将 SSM 长度扩展与多项式外推联系起来的理论解释,并核对隐藏状态初始化是否能在较短训练上下文下改善长序列泛化;其对 EEG 的适用性尚未验证。
来源:OpenReview · State space models · openreview.net