状态空间模型可通过梯度下降实现上下文学习
State-space models can learn in-context by gradient descent
该研究探讨深度状态空间模型(Deep SSMs)如何在自回归任务中实现上下文学习,核心贡献是构造能够执行隐式梯度学习的递归架构,并以回归任务验证这一机制。基于摘要分析,未取得论文全文。 理论机制:作者证明,单个结构化 SSM 层结合局部自注意力,可以复现一个以最小二乘损失为目标的隐式线性模型执行一步梯度下降后的输出。关键在于对角线性递归层能够充当梯度累加器,再将累积量“应用”于隐式回归模型的参数。该结论针对特定构造,不能据此认定所有 SSM 都会自发实现梯度下降。作者将局部自注意力与乘性交互视为递归架构实现此类表达能力的关键组成。 验证与边界:作者报告,在简单线性回归任务上训练随机初始化的增强 SSM 后,经验优化得到的参数与理论构造的解析参数相符;扩展到多步线性回归及非线性回归也得到一致结果。摘要未提供任务规模、数据划分、误差指标、对照基线或一致性的量化标准,实验协议、消融及统计信息尚未验证。可扩展训练和一般任务有效性在摘要中属于潜力判断,而非已提供充分指标支持的结论。 平台推测(待验证):假设 EEG 任务可组织为带监督的上下文示例序列,该机制可能用于研究跨被试或跨会话的隐式回归适应。可复用的是梯度累积与局部交互结构;需要改造的是 EEG 特征表示、上下文样本组织及预测目标。低信噪比、通道不一致和少量标注可能使累积更新不稳定,原回归任务的有效性不等于 BCI 有效性。一个可证伪的小实验是:固定 EEG 特征与跨被试划分,在相同标注上下文下比较增强 SSM、普通 SSM 和显式一步最小二乘梯度更新的预测误差,检验隐式更新能否逼近显式更新。已有 EEG 相关工作尚未检索确认。
值得阅读的是其将递归状态与隐式梯度累积建立可核对的理论联系,并用回归任务检验解析构造;这一机制能否支持 EEG 上下文适应尚未验证。
来源:OpenReview · State space models · openreview.net