跳到正文
OpenReview · State space models·· 2026-09-11精选AI 评分78

选择性状态空间模型的分布式学习:架构感知收敛分析

Distributed Learning with Selective State Space Models: Architecture-Aware Convergence Analysis

AI 导读

基于摘要分析。本文研究选择性状态空间模型(SSM)在分布式、尤其是联邦学习中的优化行为,针对标准联邦学习方法通常不考虑模型架构特性的局限,推导架构感知的梯度、光滑性与收敛界,并通过合成序列和 Mamba2 语言建模实验考察这些分析的解释作用。主要研究对象是 SSM 的联邦优化,而非 EEG 或 BCI。 理论部分覆盖单层与多层选择性 SSM,给出 FedAvg 和 FedProx 的收敛界,刻画递归稳定性、输入依赖的离散化以及状态投影范数如何影响联邦优化。其具体价值在于把模型内部动力学与分布式训练行为联系起来,而不是仅使用架构无关的优化分析;界的具体形式、成立假设及紧致性尚未验证。 作者报告,在 teacher SSM 生成的序列上,使用遵循所分析递推形式的 learner,对单层理论界进行数值验证;随后依据分析提出关于本地训练和客户端异质性影响的预期,并在六个文本领域的 Mamba2 语言建模任务上比较九种联邦学习算法。摘要未给出具体算法清单、数据划分、指标或性能数值,因此不能判断算法优劣,也不能将单层递推验证直接视为实际多层 Mamba2 理论界的完整验证。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 序列建模采用选择性 SSM,并以被试或采集机构作为联邦客户端,该分析可能帮助研究本地更新步数与客户端异质性下的优化稳定性。此假设依赖模型递推满足理论条件,以及 EEG 任务的监督方式和数据规模支持稳定训练;可复用的是稳定性分析思路及 FedAvg、FedProx 对照,需改造输入编码、通道处理和任务输出。低信噪比、跨被试差异、通道不一致与小样本可能使文本实验中的规律不成立。一个可检验的小实验是在固定跨被试划分与通信预算下,改变本地更新步数,比较 FedAvg、FedProx 的训练稳定性与任务指标,并核对其是否符合理论预期。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其将选择性 SSM 的递归稳定性、离散化与状态投影参数联系到联邦优化收敛的分析,但理论界对实际 Mamba2 训练的解释力及其 EEG 迁移价值尚需验证。

来源:OpenReview · State space models · openreview.net