从近因偏置与过度平滑视角理解并缓解状态空间模型的瓶颈
Understanding and Mitigating Bottlenecks of State Space Models through the Lens of Recency and Over-smoothing
基于摘要分析。本文研究 Structured State Space Models(SSMs)在长序列建模中的近因偏置,以及加深模型后出现的过度平滑问题,提出通过极化状态转移矩阵中的两个通道缓解两者之间的矛盾。主要研究对象是通用序列模型,而非 EEG 或 BCI。 作者报告,其理论分析表明 SSMs 存在较强的近因偏置,即模型更偏重近期信息;实证研究显示,这会损害远距离信息回忆能力并引入鲁棒性问题。作者报告,深度扩展实验发现更深的 SSM 结构有助于学习长上下文,但后续理论分析指出,深度增加又会导致 token 表征趋于难以区分的过度平滑,从而限制模型扩展。 方法上,作者将状态转移矩阵中的两个通道分别设为零和一,以同时应对近因偏置与过度平滑。作者报告,在长程 token 的 associative recall(关联回忆)实验中,该极化技术持续提升回忆 Accuracy,并使 SSMs 能从更深架构中进一步获益。摘要未提供具体数据集、序列长度、深度范围、对照基线及数值;矩阵参数化、训练与推理实现、理论成立条件、实验协议、消融及统计信息尚未验证,不能据此判断对所有 SSM 变体的普遍有效性。 平台推测(待验证):若 EEG 任务确实依赖远距离时间信息,近因偏置与深层表征趋同可能构成对应瓶颈,状态转移极化可作为待检验的模块级改造。原文验证依赖序列中的 token 与关联回忆目标,不能直接等同于连续、低信噪比的 EEG;需核对 EEG 输入编码、通道结构及监督目标的适配,且跨被试差异和小数据可能掩盖或抵消收益。一个可证伪的小实验是在固定 EEG 编码与数据划分下,对比同深度、同训练预算的原始 SSM 与极化版本,再改变深度,观察任务指标及表征相似度是否同步改善。已有 EEG 相关工作尚未检索确认。
值得核对其对 SSM 近因偏置与过度平滑的理论分析,并复现状态转移矩阵极化是否改善长程关联回忆及深度扩展;其对 EEG 的适用性尚未验证。
来源:OpenReview · State space models · openreview.net