跳到正文
OpenReview · State space models· Guo Yue·· 2026-07-28精选AI 评分75

Adaptive State Space Experts:通过状态感知路由动态选择专家,实现高效序列建模

Adaptive State Space Experts: Dynamic Expert Selection with State-Aware Routing for Efficient Sequence Modeling

AI 导读

基于摘要分析。本文研究状态空间模型(SSM)与混合专家(MoE)的融合,针对仅依赖当前 token 的路由器未利用 SSM 历史状态的问题,提出 Adaptive State Space Experts(ASSE)。核心贡献是将专家选择、时间信息保留和自适应推理深度与状态动态相结合;原论文评估对象为语言建模与长序列任务,并非 EEG 或 BCI。 机制包括三部分:以运行状态的紧凑摘要作为专家选择条件;通过自适应状态保留,使不同专家学习不同时间跨度;从状态动态中构造基于收敛的早退信号,实现输入自适应深度。摘要未提供状态摘要的构造方式、路由与保留的具体参数化、收敛判据及训练损失,这些实现细节尚未验证。 作者报告,在 Pile 语言建模评估中,ASSE 的困惑度为 13.04,SSM+MoE 基线为 13.38,混合 Transformer-SSM 架构为 13.21;启用早退时,以困惑度增加 0.06 为代价减少 30% 计算。在 Long Range Arena 上,作者报告平均 Accuracy 为 83.01%,Mamba 为 82.14%。作者还报告专家呈现不同时间尺度的分工,路由上下文连贯性为 73%,token-only 基线为 58%。模型规模、训练预算、数据划分、任务平均方式、连贯性定义、计算成本口径及消融与统计信息尚未验证,不能据此确认等预算优势或实际延迟收益。 平台推测(待验证):若运行状态能稳定编码 EEG 的任务相关历史,状态条件路由与多时间尺度专家可能对应长时依赖和短暂事件并存的建模瓶颈。可复用的是路由与状态保留思想,输入编码、通道组织、任务监督和早退阈值需针对 EEG 改造;低信噪比、跨被试差异、通道变化及小数据可能导致路由不稳定或专家分工失效。一个可检验的小实验是,在固定 EEG 数据划分、训练预算与专家容量下,比较 token-only 和状态条件路由,再独立评估早退的 Accuracy—实际延迟权衡。原论文所依赖的训练规模与监督细节尚未验证,已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其状态条件路由、专家时间尺度分化与早退机制能否共同改善序列建模的质量—计算权衡,但摘要中的比较协议与计算成本口径尚未验证。

来源:OpenReview · State space models · openreview.net