Fixed-Point RNNs:通过少量迭代从对角递归到稠密递归
Fixed-Point RNNs: From Diagonal to Dense in a Few Iterations
基于摘要分析。该研究面向 Transformer 中的序列混合层,试图缓解线性 RNN 和 Mamba 等 SSM 采用逐通道、对角序列混合时的状态追踪表达能力限制。核心贡献是在单个层内,将稠密线性 RNN 的计算表述为可并行对角线性 RNN 的固定点,以兼顾跨通道状态交互与计算效率。 机制上,研究重点是从对角递归获得稠密递归能力,而非提出 EEG 专用模型。摘要还提到探索改善记忆和状态追踪能力的机制,但未提供固定点更新公式、收敛条件、迭代次数、训练损失或具体实现;标题中的“少量迭代”也没有可核对的数值。其相对于直接稠密递归及对角 SSM 的实际计算、存储优势尚未验证。 作者报告,在常用玩具任务 A_5、S_5、copying 和 modular arithmetics 上取得最先进结果。摘要未给出具体指标、数值、数据划分或对照基线,因此不能量化提升,也不能据此推断真实长序列任务上的效果;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 任务确实依赖持续状态更新及多通道特征交互,该固定点序列混合机制可能值得评估,但原文的玩具任务结果不是 BCI 有效性证据。可考虑复用递归混合模块,改造 EEG 输入编码与任务输出;低信噪比、通道差异及小样本可能使稠密交互放大噪声或增加过拟合风险。一个可证伪的小实验是在固定 EEG 编码器、训练预算和跨被试划分下,对比对角递归与固定点递归,考察迭代次数对任务指标、延迟和稳定性的影响。所需监督形式与数据规模尚未验证,已有 EEG 相关工作尚未检索确认。
值得关注其以可并行的对角线性 RNN 固定点迭代实现稠密线性递归的机制,但玩具任务上的作者报告尚不能证明 EEG 长时依赖建模收益,迭代成本与收敛条件需核对全文。
来源:OpenReview · State space models · openreview.net