跳到正文

算法、任务与模态

Mamba 最新动态

Mamba 研究索引;按可核对的标签归档,不以热度评价质量。

272 条精选近 30 天 19 条共收录 373 条

更新

精选归档 · 第 14 页

1月1日周一第 261–272 条
  1. OpenReview · State space models74

    Mamba-CL:在零空间中优化选择性状态空间模型以实现持续学习

    基于摘要分析。该研究面向持续学习中的灾难性遗忘,提出 Mamba-CL,通过在历史任务特征子空间的正交方向更新参数,持续微调大规模 Mamba 基础模型的核心 SSM,力求保留既有知识并学习新任务。 核心机制是将参数更新限制在历史特征子空间对应的零空间内。作者围绕 Mamba 的四个关键时不变参数推导整体一致性约束,处理 SSM 的递归状态空间结构与非线性离散化过程,再以零空间投影实现正交更新。作者声称,该方法在理论上保证各 SSM 模块在先前与当前任务上的输出一致性目标;具体保证的假设、约束范围,以及模块级一致性如何对应最终任务性能,需结合全文核对。 作者报告,在四个类别增量学习基准上,Mamba-CL 展现出抗遗忘效果,性能优于所比较的先进方法。摘要未提供基准名称、任务序列、数据划分、指标或具体数值,因此无法判断提升幅度及不同协议下的可比性。实验协议、消融及统计信息尚未验证。摘要称代码位于补充材料中,但其可获取性、运行配置与复现要求尚未核对。 平台推测(待验证):该机制可能对应 EEG 持续学习中新增类别或连续会话更新引起的遗忘,但依赖历史特征子空间能稳定表征需保留的知识。可复用的是零空间投影与参数一致性约束;需改造的是 EEG 时序输入、通道适配和特征子空间估计。低信噪比、跨被试差异、通道变化及小样本可能使子空间估计不稳定,或过度限制更新、妨碍新任务学习。一个可检验的假设是:在固定 EEG 类别增量协议下,使用相同 Mamba 骨干与数据划分,对照普通顺序微调和零空间约束更新,检验历史类别 Accuracy 的保留是否以新类别学习能力下降为代价。上述迁移不属于本文已验证结果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其针对 Mamba 核心 SSM 参数推导的一致性约束与零空间投影实现,尤其是理论保证的适用条件及抗遗忘与新任务学习能力之间的权衡。

  2. OpenReview · State space models78

    MambaByte:无 token 的选择性状态空间模型

    基于摘要分析。MambaByte 研究直接从原始字节学习的无 token 语言建模,旨在避免子词分词的归纳偏置,同时缓解字节序列更长带来的计算与内存压力。其核心贡献是将 Mamba 状态空间模型(SSM)用于字节序列的自回归训练,并提出结合 tokenized drafting 与 byte-level verification 的推测解码适配方案。 机制上,摘要将标准自回归 Transformer 随序列长度增长的内存需求,与 Mamba 的固定大小记忆状态及高效解码进行对照。MambaByte 的建模单位是字节,而非子词;推测解码则用 token 化序列生成草稿,再在字节层面验证。具体状态更新、选择性机制、训练损失及草稿验证流程尚未验证。 作者报告,MambaByte 在语言建模任务上可与先进的子词 Transformer 竞争,部分表现更优,并保留无 token 模型的噪声鲁棒性优势。作者还报告,其推测解码适配方案相较标准 MambaByte 实现获得 2.6 倍推理加速,解码效率与子词 Mamba 相近。摘要未提供对应数据集、模型规模、任务指标、硬件、生成长度及对照配置,因此这些结果只能在作者所述比较范围内理解,实验协议、消融及统计信息尚未验证。 平台推测(待验证):其固定大小状态机制可能对应 EEG 长时序处理中随窗口长度增长的资源瓶颈,但字节语言建模依赖离散序列与自回归监督,不能直接等同于连续、多通道 EEG 建模。可考察 SSM 主干的复用,输入编码与训练目标需改造;tokenized drafting 的优势是否成立则取决于 EEG 是否存在合适的离散草稿表示。低信噪比、跨被试分布差异、通道变化及小数据可能削弱效果。一个可检验的小实验是在固定数据划分和参数预算下,比较 SSM 与 Transformer 在不同 EEG 窗口长度上的任务指标、峰值内存及推理延迟。上述仅为迁移假设,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以固定大小状态处理长字节序列的机制,以及结合 tokenized drafting 与 byte-level verification 的推测解码方案;摘要中的语言建模与效率结论仍需结合完整实验协议核对。

  3. OpenReview · State space models72

    PathMamba:用于病理图像多类别分割的弱监督状态空间模型

    基于摘要分析。该研究针对病理图像多类别分割中密集像素标注成本高的问题,提出仅使用图像级标签训练的弱监督状态空间模型 PathMamba,通过结合像素级与 patch 级特征学习局部细节和全局上下文。 方法首先将像素视为实例,基于 Multi-Instance Multi-Label Learning 提取像素级特征图,再将其注入 Contrastive Mamba Block。该模块结合状态空间模型与对比学习,提取病理图像中的非因果双粒度特征;作者另提出 Deep Contrast Supervised Loss,以更充分利用有限的标注信息。摘要未给出对比样本构造、双粒度特征交互方式、损失公式及推理流程,具体机制尚需全文核对。 作者报告,在两个公开病理图像数据集上,PathMamba 优于所比较的先进弱监督方法,并能生成区域一致性更好的分割结果。摘要未列出数据集名称、划分协议、评价指标、分数及对照方法,因此无法判断提升幅度及适用范围;实验协议、消融及统计信息尚未验证。摘要提供了代码仓库,但其运行条件与结果可复现性尚未验证。 平台推测(待验证):其可考察的跨领域机制是由样本级弱标签学习局部特征,并结合细粒度与粗粒度上下文;这不等于已证实的 EEG/BCI 效果。若 EEG 任务具有记录级标签而缺少事件级标注,可假设将像素实例改为时间窗实例、将 patch 改为较长片段,探索弱监督事件定位。状态空间与多实例学习模块可能可复用,但图像空间邻域、粒度定义和对比关系均需改造。低信噪比、跨被试差异、通道配置变化及小数据条件可能使局部特征聚焦于伪迹而非目标事件。一个可证伪的小实验是在具有事件标注的 EEG 数据上,仅用记录级标签训练,以保留的事件标注评估定位,并在相同被试划分下比较多实例学习基线与加入双粒度模块后的结果。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其以图像级标签结合像素级与 patch 级特征进行多类别分割的机制,重点核对 Contrastive Mamba Block 与 Deep Contrast Supervised Loss 的具体实现及贡献;其对 EEG/BCI 的适用性尚未验证。

  4. OpenReview · State space models74

    VFIMamba:基于状态空间模型的视频帧插值

    基于摘要分析。VFIMamba 研究视频帧插值(VFI)中的帧间建模问题,利用 Selective State Space Models(S6)实现高效、数据依赖的跨帧信息交互,并引入课程学习以学习不同运动幅度下的帧间动态。其主要研究对象是视频中间帧生成,而非 EEG 或 BCI。 核心机制是 Mixed-SSM Block(MSB):先将相邻帧的 token 交错排列,再进行多方向 S6 建模。作者认为,这种设计能够在保持线性复杂度的同时促进跨帧信息传递,针对卷积方法感受野受限、注意力方法计算开销较高的问题提供替代路径。课程学习逐步培养模型对不同运动幅度的建模能力,但摘要未说明运动幅度的定义、课程阶段、损失函数及训练细节,相关信息尚未验证。 作者报告,VFIMamba 在多个基准上达到当时最优表现,尤其适用于高分辨率场景;在 X-TEST 数据集上,4K 帧与 2K 帧的提升分别为 0.80 dB 和 0.96 dB。摘要未明确该 dB 数值对应的指标、对照方法或数据划分,因此不能据此确认收益来源,也不能直接与其他协议下的结果比较。实验协议、消融、统计信息以及实际运行时间和显存开销尚未验证。 平台推测(待验证):若将相邻帧之间的交错建模视作相邻 EEG 时间窗之间的信息交互,MSB 的序列组织方式与 S6 模块可能为长时序建模提供可检验的思路。该假设依赖 EEG 时间窗间存在可学习的连续动态;视觉 token 编码、空间扫描方向及运动幅度课程需要改造,不能直接照搬。低信噪比、通道布局差异、跨被试分布变化及小数据训练可能削弱效果。可在固定 Cross-subject 划分与相同训练预算下,对比相邻时间窗交错排列和普通时间顺序输入,评估任务指标与计算开销,以检验交错组织是否有独立收益。已有 EEG 相关工作尚未检索确认,原视频结果不构成 BCI 有效性的证据。

    阅读价值:值得阅读的是相邻帧 token 交错排列与多方向 S6 建模如何实现线性复杂度的跨帧信息交互;作者报告的高分辨率收益仍需结合指标、对照基线和完整评估协议核对。

  5. OpenReview · State space models70

    MambaLLIE:基于先全局后局部状态空间的隐式 Retinex 感知低光照图像增强

    基于摘要分析。该研究面向低光照图像增强,提出 MambaLLIE,以隐式 Retinex 感知和先全局后局部的状态空间设计,联合处理全局光照退化与暗光条件下的局部噪声、模糊。原论文研究对象是视觉图像,而非 EEG 或 BCI。 作者认为,传统 Retinex 理论主要描述全局光照退化,未充分涵盖局部退化,而视觉状态空间模型也存在局部依赖与全局上下文融合的挑战。其 Local-Enhanced State Space Module(LESSM)在二维选择性扫描中引入增强的局部偏置,以保留局部二维依赖;Implicit Retinex-aware Selective Kernel(IRSK)通过空间变化操作与自适应核选择,按输入动态选择特征。Global-then-Local State Space Block(GLSSB)以 LayerNorm 为核心整合两者,实现全局长程建模与局部特征聚合。摘要未说明 Retinex 如何具体进入模型约束,也未给出损失函数和训练流程。 作者报告,在低光照图像增强实验中,MambaLLIE 显著优于所比较的先进 CNN 与 Transformer 方法;但摘要未提供数据集、划分、指标、具体数值或基线配置,尚不能核对优势幅度及适用条件。实验协议、消融及统计信息尚未验证。材料提供项目页,但代码、权重与复现配置的可用性尚未验证。 平台推测(待验证):可迁移的假设是“长程状态建模与局部偏置协同”可能帮助 EEG 同时利用长时间依赖和局部波形,而非将光照分解直接用于神经信号。候选模块是选择性扫描与局部聚合;需重构时间—通道表示、扫描顺序和邻域定义,因为 EEG 通道排列不天然等同于图像二维邻接。低信噪比、跨被试差异、通道变化及小数据可能使局部偏置放大伪迹或过拟合。一个小规模可证伪实验是在固定 EEG 任务与跨被试划分下,对比基础 SSM 与加入局部偏置的版本,控制训练预算并评估噪声扰动下的表现;这不是原论文已验证的结果。相关 EEG 工作尚未检索确认。

    阅读价值:值得核对 LESSM 的二维局部依赖保留机制与 IRSK 的自适应特征选择如何协同改善低光照图像增强,但摘要不足以验证性能优势,其对 EEG 的适用性仍是假设。

  6. OpenReview · State space models71

    Mamba2MIL:基于状态空间对偶的计算病理学多实例学习

    基于摘要分析。Mamba2MIL 面向计算病理学中全切片图像(WSI)的多实例学习(MIL),旨在改善多样特征融合及序列信息利用。方法结合状态空间对偶模型(SSD)、加权特征选择和适配不同 WSI 大小的序列变换,对长图像块序列进行建模;研究对象是病理图像分类,而非 EEG 或 BCI。 核心机制:SSD 用于处理 WSI 图像块构成的长序列,加权特征选择支持更多分支特征的融合,并允许按应用需求扩展。序列变换旨在增强与顺序无关的特征,同时保留局部序列信息。作者将现有 CNN、注意力及选择性扫描 SSM 框架在特征融合灵活性、可扩展性和顺序信息利用方面的限制作为改进动机,但摘要未给出分支构造、权重计算、变换操作、损失函数及训练细节。 作者报告,在多个数据集上几乎所有性能指标均有提升,并优于所比较的先进 MIL 方法。其中,NSCLC 数据集上的二分类肿瘤任务 AUC 为 0.9533、Accuracy 为 0.8794;BRACS 数据集上的多分类任务 AUC 为 0.7986、Accuracy 为 0.4981。摘要未说明数据划分、具体对照、AUC 汇总方式及统计不确定性,因此这些数值仅能作为各自任务下的报告结果,不能直接跨任务比较。实验协议、消融及统计信息尚未验证。材料提供了代码仓库,但实现完整性与复现条件尚未核对。 平台推测(待验证):假设将带整体标签的 EEG 记录切分为窗口实例,长序列 MIL 与加权特征融合可能对应长记录聚合及多类窗口特征整合的瓶颈。可尝试复用 SSD 聚合与特征选择机制,但需改造实例编码及序列变换:病理图像块的空间顺序不等同于 EEG 的时间顺序,增强顺序无关特征可能破坏事件时序;低信噪比、通道差异、跨被试变化及小数据训练也可能使权重选择失稳。一个可检验的小实验是在固定 EEG 窗口特征和相同跨被试划分下,对比简单池化、SSD 聚合及加入序列变换的版本,核对聚合收益与时序损失。相关 EEG 工作尚未检索确认,原领域结果不构成 BCI 有效性的证据。

    阅读价值:值得核对其 SSD 长序列建模、加权特征选择与序列变换如何共同改善 WSI 多实例学习;摘要给出了分类结果,但各模块贡献及其对 EEG 的适用性尚未验证。

  7. OpenReview · State space models73

    RSMamba:基于状态空间模型的遥感图像分类

    基于摘要分析。该研究面向遥感场景分类,提出基于状态空间模型(SSM)的 RSMamba,旨在通过全局感受野与线性建模复杂度改善整幅图像的语义理解;其核心贡献是动态多路径激活机制,用于增强 Mamba 对二维非因果数据的建模能力。 机制方面,作者采用 Mamba 的硬件感知设计,并针对其原有因果序列建模方式与二维图像结构之间的不适配引入多路径激活,同时保留原有 Mamba 的建模机制。摘要未提供路径构造、激活规则、图像序列化方式、训练目标及具体架构细节,这些内容尚未验证。作者将其定位为潜在视觉基础模型骨干,但摘要并未展示基础模型预训练或迁移评估。 结果方面,作者报告在 UC Merced、AID、RESISC45 遥感图像分类数据集上的 F1 分别为 95.25、92.63、95.18,并称优于同期 Vim 和 VMamba。摘要未说明数值单位、训练与测试划分、F1 平均方式及对照训练条件,因此不能据此作严格的跨方法比较;实验协议、消融及统计信息尚未验证。材料提供了代码仓库,但实现与论文结果的一致性尚未核对。 平台推测(待验证):可迁移假设是,多路径机制或可用于离线 EEG 分类中的通道—时间联合建模,缓解单一序列顺序对跨通道关系表达的限制。可考虑复用 SSM 模块,重新设计 EEG 输入表示、通道顺序与路径构造;遥感图像的二维空间结构不能直接等同于 EEG 通道—时间结构。低信噪比、跨被试差异、通道布局变化及小数据规模均可能使收益消失,非因果路径也需与在线 BCI 的因果约束区分。一个可检验的小实验是在固定 Cross-subject 划分与训练预算下,对比单路径 Mamba 和多路径变体的离线 EEG 分类表现,并检查通道顺序扰动后的稳定性。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是其以动态多路径激活机制拓展 Mamba 对二维非因果数据的建模能力,但摘要中的遥感分类结果尚不能证明其适用于 EEG 或 BCI。

  8. OpenReview · State space models73

    SMamba:通过可伸缩状态空间模型实现任意尺度超分辨率

    基于摘要分析。研究针对任意尺度超分辨率(ASSR):用单一模型将低分辨率图像重建为任意目标尺度的高分辨率图像。作者提出正文称为 S³Mamba 的方法,通过 Scalable State Space Model(SSSM)构建可随尺度调整的连续表示空间,并结合尺度感知自注意力提取不同尺度下的重要全局特征。 机制上,摘要将隐式神经表示(INR)描述为连接坐标与像素值、重建连续信号的途径。SSSM 在离散化过程中调制状态转移矩阵及步长采样矩阵,作者称由此实现具有线性计算复杂度的连续尺度建模。尺度感知自注意力用于补充不同尺度下的全局特征感知;具体调制公式、尺度条件的注入方式、训练损失,以及线性复杂度是否涵盖完整网络,尚未验证。 作者报告,在合成与真实场景基准上的实验取得了最先进的性能及任意超分辨率尺度下的泛化能力。摘要未提供基准名称、训练与测试尺度划分、对照方法、指标或数值,因而尚不能核对其提升幅度,或区分已见尺度与未见尺度的泛化。实验协议、消融及统计信息尚未验证;代码与复现条件亦未确认。 平台推测(待验证):假设该尺度条件化的连续表示机制可用于 EEG 时间轴重采样或缺失采样点重建,其潜在对应问题是不同采样率下的信号表示一致性,而不是直接提升 BCI 分类效果。可考虑复用尺度调制的状态空间模块,但需将二维图像坐标改为时间坐标,并处理通道结构、频带约束与抗混叠;原任务依赖低分辨率输入及高分辨率重建目标,迁移所需监督和数据规模尚不明确。低信噪比、小样本及跨被试差异可能使模型重建伪波形或失真频谱。一个可证伪的小实验是在按被试隔离的数据上,对高采样率 EEG 进行抗混叠降采样,比较该机制与常规插值在未见采样比例下的波形、频谱及下游任务表现。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其通过离散化过程中的状态转移与步长采样调制实现连续尺度建模的机制,尤其是线性复杂度的适用范围及尺度外泛化证据;其对 EEG 的价值尚未验证。

  9. OpenReview · State space models76

    ChangeMamba:基于时空状态空间模型的遥感变化检测

    基于摘要分析。该研究面向遥感变化检测,探索以 Mamba 状态空间模型兼顾全局空间上下文建模与多时相特征交互,针对二元变化检测(BCD)、语义变化检测(SCD)和建筑物损伤评估(BDA),分别提出 MambaBCD、MambaSCD 和 MambaBDA。研究对象是遥感影像,而非 EEG 或 BCI。 机制上,三种框架均采用 Visual Mamba 作为编码器,以学习输入影像的全局空间上下文;共有的变化解码器包含三种时空关系建模机制,用于多时相特征交互及变化信息提取。摘要将其动机归结为 CNN 感受野受限以及 Transformer 训练、部署计算开销较高,但未给出三种机制的具体操作、损失函数或训练配置,也不能据此确认实际计算与内存收益。 作者报告,在五个基准数据集上,所提框架优于所比较的 CNN 和 Transformer 方法,且未使用复杂训练策略或技巧;作者还报告了对退化数据的鲁棒性。摘要未提供数据集名称、划分、指标、数值、退化类型及对照配置,因此结果适用范围、实验协议、消融及统计信息尚未验证。摘要提供了源码仓库,复现仍需核对正文中的预处理、训练设置与评估流程。 平台推测(待验证):可迁移的假设是利用状态空间建模连接较长上下文,并在配对时段间显式交互;对应 EEG 中长时序依赖及跨时段变化识别问题。可考察状态空间模块与时段交互模块,但需将影像空间扫描改造成适配电极拓扑和时间序列的表示,并重新定义监督目标。低信噪比、通道差异、被试差异与小数据可能使模型学到伪变化;遥感退化鲁棒性不等于 EEG 鲁棒性。一个可检验的小实验是在固定 EEG 时段分类任务和相同数据划分下,对照单时段状态空间编码器与加入配对时段交互的版本,比较任务指标及噪声扰动下的性能变化。已有相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其 Visual Mamba 编码器与多时相变化解码器的配合机制,以考察全局空间建模和时相交互的实现;摘要报告了遥感基准及退化数据结果,但其 EEG/BCI 适用性尚未验证。

  10. OpenReview · State space models74

    KalMamba:面向不确定性下强化学习的高效概率状态空间模型

    基于摘要分析。该研究面向高维、部分可观测信息下的强化学习(RL),提出 KalMamba,旨在兼顾概率状态空间模型(SSM)的控制表征能力与 S4、Mamba 等确定性 SSM 的计算效率。主要研究对象是 RL 中的潜在状态表征与推断,并非 EEG 或 BCI。 核心机制是利用 Mamba 学习潜在空间中线性高斯 SSM 的动力学参数,再通过标准 Kalman filtering 和 smoothing 完成潜在状态推断。作者采用并行关联扫描实现这些推断操作,以提高概率 SSM 的计算效率和可扩展性。摘要未说明具体参数化方式、训练目标、观测模型或控制策略如何接入,相关实现尚未验证。 作者报告,在所开展的 RL 实验中,KalMamba 与当前先进 SSM 方法具有竞争力,同时显著提高计算效率,尤其是在较长交互序列上。摘要未提供任务、数据规模、对照方法、性能指标或耗时数值,因此不能量化其收益,也不能据此认定全面优于现有方法。实验协议、消融及统计信息尚未验证;复现还需核对代码可用性、硬件条件与并行推断实现。 平台推测(待验证):若 EEG 任务可建模为由含噪观测推断连续潜在状态,该机制可能用于长序列状态估计;可复用部分是动力学参数学习与 Kalman 推断,需改造部分是 EEG 观测编码、观测模型及任务监督。原方法依赖潜在空间的线性高斯建模,EEG 的非平稳性、低信噪比、跨被试差异、通道变化和小数据可能使这些假设失效。一个可检验的小实验是在固定 EEG 数据与被试内划分下,对比 KalMamba 式模型、常规线性高斯 SSM 与确定性 Mamba,统一训练预算,并随序列长度评估任务指标、推断耗时及不确定性校准;在线任务必须单独评估只用历史观测的 filtering,不能混用 smoothing 结果。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其将 Mamba 动力学参数学习与可并行 Kalman 推断结合的实现,以及长交互序列下计算效率的评估条件;其对 EEG 状态估计的价值尚未验证。

  11. OpenReview · State space models71

    RSMamba:基于状态空间模型的遥感图像分类

    基于摘要分析。该研究面向遥感图像场景分类,提出基于状态空间模型(SSM)的 RSMamba,旨在兼顾整幅图像的全局理解与线性建模复杂度;核心贡献是通过动态多路径激活机制增强 Mamba 对非因果二维图像数据的建模能力,而非提出 EEG 或 BCI 方法。 技术机制:摘要将遥感场景的复杂性、多样性及其时空分辨率变化列为分类难点。RSMamba 采用硬件感知的 Mamba 设计,在保留原有建模机制的同时,引入动态多路径激活,以应对原始 Mamba 的因果序列建模方式与二维图像结构之间的不匹配。路径如何构造、动态激活如何实现,以及训练目标和推理流程,摘要未提供细节,尚未验证。 结果与复现:作者报告,RSMamba 在多个遥感图像分类数据集上表现更优,但摘要未给出数据集名称、划分协议、对照配置、指标或数值,不能据此量化优势。作者据此提出其作为未来视觉基础模型骨干的潜力,这不等于已经完成基础模型验证。摘要表示代码将公开,当前可用性尚未验证;实验协议、消融及统计信息亦尚未验证。 平台推测(待验证):若多路径机制确实能够减少单一序列顺序对建模的限制,则可能为离线 EEG 的时间—通道联合建模提供参考。可考虑复用 SSM 建模模块,但图像路径需改造成符合电极拓扑与时间结构的路径,分类输入和任务监督也需适配。低信噪比、通道布局变化、跨被试差异及小样本训练可能削弱收益;非因果建模还需与在线 BCI 的因果约束区分。一个可检验的小实验是在固定 EEG 数据划分、预处理及训练预算下,对照单路径 Mamba 与多路径变体,分别检查被试内和跨被试表现,并测试通道扰动下的稳定性。以上仅为机制迁移假设,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是其以动态多路径激活机制扩展 Mamba 对非因果二维数据的建模能力,但性能优势及其对 EEG 的迁移价值仍需分别验证。

9月22日周五
  1. OpenReview · State space models86

    Mamba:基于选择性状态空间的线性时间序列建模

    Mamba 针对长序列模型计算效率与内容依赖推理能力之间的矛盾,通过输入依赖的选择性状态空间模型(SSM)构建不含注意力和 MLP 模块的序列建模架构。基于摘要分析,原论文主要研究语言、音频和基因组学等模态,并非 EEG 或 BCI 方法。 核心机制是让 SSM 参数成为输入的函数,使模型根据当前 token 沿序列维度选择性传播或遗忘信息。作者认为,这可缓解既有次二次时间架构在离散模态上缺乏内容依赖推理能力的问题。由于输入依赖参数使原有高效卷积计算不再适用,作者设计了硬件感知的递归模式并行算法,并将选择性 SSM 整合进 Mamba。具体参数化、训练目标与实现细节尚未验证。 作者报告,Mamba 的计算随序列长度线性扩展,推理吞吐量为 Transformer 的 5 倍,并在真实数据上观察到性能随序列长度增加而改善,最长涉及百万长度序列;摘要未提供该吞吐量比较的硬件、批量、序列长度及基线配置,不能据此推断任意部署条件下的加速效果。在语言建模的预训练及下游评估中,作者报告 Mamba-1.4B 超过同规模 Transformer,并匹配两倍规模的 Transformer。作者还报告其在语言、音频和基因组学等模态达到当时最先进表现,但数据集、具体指标、实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 任务需要从长时间序列中保留任务相关片段并抑制无关信息,输入依赖的状态更新可能提供可复用机制。可复用部分是选择性 SSM 与长序列计算框架;需改造 EEG 输入表示、通道融合及任务输出。低信噪比可能使选择机制追随伪迹,跨被试差异和小数据训练也可能削弱效果。一个可检验的小实验是在固定数据划分、预处理与训练预算下,比较选择性 SSM、非选择性 SSM 和 Transformer 的任务指标、吞吐量及显存占用,并检查噪声扰动下的稳定性。已有 EEG 相关工作尚未检索确认,原领域结果不构成 BCI 有效性的证据。

    阅读价值:值得阅读其输入依赖的选择性状态空间机制与硬件感知递归计算设计,以评估长序列建模的效率—性能取舍;其对 EEG 的适用性尚未验证。