用于长程序列处理的块偏置 Mamba
Block-Biased Mamba for Long-Range Sequence Processing
基于摘要分析。本文研究 Mamba 在长程序列任务上的能力不足,提出 B₂S₆:在 Mamba 的 S6 单元中结合分块选择性动态与通道特异性偏置,以改善长程序列处理,同时保留语言建模能力。主要研究对象是通用序列模型,而非 EEG 或 BCI。 机制与理论:Mamba 通过输入依赖的动态扩展早期状态空间模型(SSMs)。作者从表达能力、归纳偏置和训练稳定性三个角度分析其局限,并报告理论结果表明,Mamba 在这些方面相较 S4D 存在不足。作者进一步报告,B₂S₆ 的两项改动可提供更适合长程任务的归纳偏置,并改善表达能力与稳定性。分块规则、偏置的数学形式、理论成立条件以及训练和推理实现尚未验证,不能据摘要补写具体结构或损失。 实验:作者报告,B₂S₆ 在 Long-Range Arena(LRA)任务上优于 S4 和 S4D,同时保持 Mamba 在语言建模基准上的表现。摘要未提供具体任务分项、指标数值、划分、模型规模或计算预算,因而无法判断优势幅度及对照条件;实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,分块选择性动态可能有助于 EEG 长序列中局部变化与远距离依赖的共同建模。可复用候选是 B₂S₆ 序列单元;EEG 输入编码、时间分块尺度及多通道映射需要重新设计,且模型中的通道不应直接等同于电极。其有效性可能受低信噪比、跨被试差异、通道配置变化和小样本训练影响。一个可证伪的小实验是在固定 EEG 数据划分、预处理和近似模型容量下,对比 Mamba、B₂S₆ 与 S4D,并改变输入序列长度,检查增益是否确实随长程信息增加而出现。已有 EEG 相关工作尚未检索确认。
值得阅读其对 Mamba 长程序列能力的表达能力、归纳偏置与训练稳定性分析,以及 B₂S₆ 相对 S4/S4D 的验证,但其对 EEG 长程依赖建模的价值尚未验证。
来源:OpenReview · State space models · openreview.net