跳到正文
OpenReview · State space models· Xingyu Shen; Yingfa Chen; Zhen Leng Thai; Xu Han; Zhiyuan Liu; Maosong Sun·· 2025-09-20AI 评分77

StateX:通过后训练状态扩展增强 RNN 的召回能力

StateX: Enhancing RNN Recall via Post-training State Expansion

AI 导读

基于摘要分析。StateX 针对 RNN 将上下文压缩到固定大小循环状态、因而难以准确召回长上下文信息的问题,提出通过后训练扩展预训练 RNN 状态的训练流程,旨在避免直接训练大状态模型的高成本。 核心机制:研究覆盖 linear attention 与 state space models 两类 RNN,分别设计后训练架构修改,在不增加或仅少量增加模型参数的情况下扩大循环状态。摘要将状态容量与模型参数量区分开来,但未说明具体扩展操作、初始化方式、损失函数及训练数据。其背景依据是既有研究发现召回能力与循环状态大小正相关;这一关系不应视为所有任务上的普遍保证。 作者报告:在参数规模最高达 1.3B 的模型上,StateX 改善了召回与上下文学习能力,且未带来高额后训练成本或损害其他能力。摘要未提供任务、数据集、划分、基线、指标数值或成本计量口径,因此无法判断提升幅度及适用边界。实验协议、消融及统计信息尚未验证;复现需核对状态扩展结构、训练预算,以及扩展前后的内存占用、推理吞吐与能力保持情况。 平台推测(待验证):假设 EEG 序列模型的长时信息保持确受循环状态容量限制,后训练扩展状态可能成为复用预训练模型的一条路径,但语言上下文召回不等同于 EEG 解码。可考虑复用状态扩展流程,需改造 EEG 输入表征与任务监督,并核对通道结构和序列长度依赖;低信噪比、跨被试差异及小数据可能使扩展状态更多保留噪声或产生过拟合。一个可证伪的小实验是在固定 EEG 数据划分、任务监督和后训练预算下,对比原状态与扩展状态模型,观察长窗口任务表现及内存开销,并检查收益是否随窗口长度变化。已有 EEG 相关工作尚未检索确认。

来源:OpenReview · State space models · openreview.net