跳到正文
OpenReview · State space models· Abhishek Patel·· 2025-12-20精选AI 评分76

MossNet:状态空间专家混合实现多头注意力

MossNet: Mixture of State-Space Experts is a Multi-Head Attention

AI 导读

基于摘要分析。本文研究语言建模中高效循环架构的表达能力问题:作者认为,现有 SSM/门控循环模型往往仅模拟单个注意力头,并提出 MossNet,通过状态空间专家混合模拟线性多头注意力(MHA)。其主要贡献是将 mixture-of-experts(MoE)同时用于通道混合 MLP 模块和时间混合 SSM 核,而不只用于前者。 机制上,时间混合 SSM 专家承担实现多个“注意力头”的作用,通道混合部分也采用 MoE。摘要未披露专家路由、状态更新、专家组合方式及其与线性 MHA 的形式对应关系,因此尚不能判断这种模拟的具体条件与表达能力边界。原任务依赖大规模文本 token 序列进行语言建模训练,但损失、训练配置与具体规模尚未验证。 作者报告,在语言建模及下游评估中,MossNet 优于模型规模和数据预算相近的 transformer 与 SSM 架构;采用万亿级 token 训练的更大变体进一步显示其可扩展性。作者还报告,在 Samsung Galaxy S24 Ultra 和 Nvidia A100 GPU 上的真实设备测量中,相较相近规模基线具有有利的运行速度与资源使用表现。摘要未提供具体数据集、评估指标、数值、基线名称或设备测试配置,实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设时间混合中的多个 SSM 专家能学习互补的时序模式,该机制可能对应 EEG 解码中多时间尺度动态建模的需求,但语言建模效果不等于 BCI 有效性。可考虑复用时间混合专家结构,改造输入表征与任务输出;低信噪比、通道变化、跨被试差异及小数据条件可能导致专家分工不稳定或过拟合。一个可证伪的小实验是在固定 EEG 数据划分和相近参数量、训练预算下,对比单一 SSM 与多专家 SSM,并分别核对被试内及跨被试性能、推理延迟与专家利用情况。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 MossNet 如何通过时间混合 SSM 专家实现线性多头注意力,以及其在相近模型规模与数据预算下的性能和真实设备效率;对 EEG/BCI 的价值尚未验证。

来源:OpenReview · State space models · openreview.net