跳到正文
OpenReview · State space models· Neeraj Mohan Sushma; Yudou Tian; Harshvardhan Mestha; Nicolò Colombo; David Kappel; Anand Subramoney·· 2024-09-27精选AI 评分80

状态空间模型可通过梯度下降实现上下文学习

State-space models can learn in-context by gradient descent

AI 导读

基于摘要分析。该研究关注深度状态空间模型(Deep SSMs)在自回归任务中实现上下文学习所需的架构条件与内部机制,提出以递归状态累积梯度、从而隐式更新回归模型参数的理论构造。主要研究对象是通用序列模型与简单回归任务,而非 EEG 或 BCI。 作者证明,单个结构化 SSM 层结合局部自注意力,可以复现一个使用最小二乘损失的隐式线性模型经过一步梯度下降后的输出。核心机制是将对角线性递归层用作梯度累积器,并将累积结果应用于隐式回归模型的参数。这里的“学习”指上下文中隐式模型的更新,不应直接等同于推理时更新 SSM 自身权重。摘要将局部自注意力和乘性交互视为实现这一表达能力的关键因素,具体运算形式与证明条件仍需全文核对。 作者报告,在简单线性回归任务上训练随机初始化的增强 SSM 后,优化得到的参数与理论构造解析得到的参数相符;扩展至多步线性回归及非线性回归时也获得一致结果。摘要未提供任务规模、数据划分、评价指标或对照数值,实验协议、消融及统计信息尚未验证。可扩展训练及一般任务有效性属于作者提出的潜力,不能据此视为已获广泛验证。 平台推测(待验证):若 EEG 任务能组织为带标签示例序列,该机制可能为跨被试或跨会话的上下文校准提供研究思路;其依赖是可用于形成更新信号的监督信息,以及适合隐式回归的特征表示。可复用部分是递归梯度累积与局部交互,需改造部分包括 EEG 特征编码、通道差异处理及上下文组织。低信噪比、小样本与被试分布变化可能使累积更新不稳定。一个可证伪的小实验是在固定 EEG 特征和一致的跨被试划分下,对比增强 SSM、移除局部自注意力的版本与显式一步梯度回归,检验增加少量校准示例是否带来一致收益及对应的更新行为。已有 EEG 相关工作尚未检索确认。

阅读价值

该研究以可解析的回归构造解释 SSM 如何在上下文中实现梯度更新,值得核对局部自注意力与乘性交互的作用边界,但其一般任务及 EEG/BCI 适用性尚未验证。

来源:OpenReview · State space models · openreview.net