跳到正文

算法、任务与模态

Foundation Model 最新动态

Foundation Model 研究索引;按可核对的标签归档,不以热度评价质量。

123 条精选近 30 天 74 条共收录 141 条

更新

精选归档 · 第 7 页

1月1日周一第 121–123 条
  1. OpenReview · State space models72

    状态空间模型作为基础模型:控制理论视角的概述

    基于摘要分析。本文研究线性状态空间模型(SSM)如何融入基础模型的深度序列架构,面向控制理论研究者介绍相关方法,并从控制理论视角系统综述主要 SSM 方案、比较其长序列学习表现。其贡献是梳理与比较既有架构,而非发布新的基础模型或权重。 核心联系在于:基础模型将序列编码到潜在空间以学习压缩表示,而控制理论中的 SSM 用于高效描述动态系统,两者可通过状态表示与序列动态建模建立联系。摘要以 Mamba 为背景,并提及其在语言任务中相对 Transformer 的性能优势;这属于作者对既有研究的概述,不能视为本文已验证的普遍结论。具体架构、状态更新形式、训练目标及各模型的差异尚未验证。 作者说明进行了标准化基准比较,以评估模型学习长序列的效率,但摘要未提供基准名称、数据结构、评价指标、对照设置或结果数值,因此无法据此判断哪种模型更优。实验协议、消融及统计信息尚未验证,复现还需核对全文中的模型配置、训练预算与评估实现。 平台推测(待验证):若 SSM 的状态表示能够保留 EEG 中与任务相关的长时依赖,其序列建模机制可能用于处理长时间窗信号;这是迁移假设,并非本文的 EEG/BCI 结果。可考虑复用状态更新与序列编码模块,但输入表示、多通道融合及任务输出需针对 EEG 改造。低信噪比、跨被试差异、通道变化和小数据条件可能使状态表示保留噪声或产生过拟合。一个可证伪的小实验是在固定 EEG 数据划分、预处理和训练预算下,对比 SSM 与 Transformer,分别记录分类指标、不同窗口长度下的表现及计算开销,不混合被试内与跨被试结果。已有 EEG 相关工作尚未检索确认。

    阅读价值:该综述以控制理论视角梳理 SSM 序列建模架构,并提供长序列学习的标准化基准比较,适合用于理解状态表示与动态系统建模之间的联系,但其 EEG/BCI 适用性尚未验证。

  2. OpenReview · EEG71

    Neuro-GPT:迈向 EEG 基础模型

    基于摘要分析。该研究针对 BCI 任务中 EEG 数据稀缺与异质性问题,提出由 EEG 编码器和 GPT 模型组成的基础模型 Neuro-GPT,通过大规模数据上的自监督预训练,再微调至运动想象分类任务,探索预训练在低数据条件下的价值。 核心机制是以重建被掩码的 EEG 片段作为自监督任务,使模型在下游分类训练前学习 EEG 表征。摘要明确了 EEG 编码器与 GPT 模型的组合,但编码器结构、两者的连接方式、掩码策略、重建目标与损失形式尚未验证;预训练数据集名称、规模及通道配置也未在所给材料中说明。 作者报告,在包含 9 名被试的低数据运动想象分类实验中,使用基础模型相比从头训练可显著改善分类表现,并将其解释为模型泛化能力及应对数据稀缺与异质性的证据。摘要未提供具体指标、分数、效应大小或统计检验信息,也未明确属于被试内、跨被试还是跨会话评估,因此不能据此确认跨被试或跨数据集泛化效果。 复现价值在于检验自监督预训练是否能在有限下游 EEG 数据下产生稳定收益。作者提供了公开代码;进一步核对需结合全文与实现确认预训练和下游数据的关系、数据划分、微调配置,以及从头训练对照的模型容量与训练预算。实验协议、消融及统计信息尚未验证,代码完整性与复现所需的数据、计算资源也有待核查。

    阅读价值:值得阅读的具体原因是其以 EEG 片段重建预训练衔接低数据运动想象分类,并提供公开代码,可用于核对预训练相对从头训练的收益;收益大小及跨被试、跨数据集泛化仍需验证。

  3. OpenReview · State space models74

    Mamba-CL:在零空间中优化选择性状态空间模型以实现持续学习

    基于摘要分析。该研究面向持续学习中的灾难性遗忘,提出 Mamba-CL,通过在历史任务特征子空间的正交方向更新参数,持续微调大规模 Mamba 基础模型的核心 SSM,力求保留既有知识并学习新任务。 核心机制是将参数更新限制在历史特征子空间对应的零空间内。作者围绕 Mamba 的四个关键时不变参数推导整体一致性约束,处理 SSM 的递归状态空间结构与非线性离散化过程,再以零空间投影实现正交更新。作者声称,该方法在理论上保证各 SSM 模块在先前与当前任务上的输出一致性目标;具体保证的假设、约束范围,以及模块级一致性如何对应最终任务性能,需结合全文核对。 作者报告,在四个类别增量学习基准上,Mamba-CL 展现出抗遗忘效果,性能优于所比较的先进方法。摘要未提供基准名称、任务序列、数据划分、指标或具体数值,因此无法判断提升幅度及不同协议下的可比性。实验协议、消融及统计信息尚未验证。摘要称代码位于补充材料中,但其可获取性、运行配置与复现要求尚未核对。 平台推测(待验证):该机制可能对应 EEG 持续学习中新增类别或连续会话更新引起的遗忘,但依赖历史特征子空间能稳定表征需保留的知识。可复用的是零空间投影与参数一致性约束;需改造的是 EEG 时序输入、通道适配和特征子空间估计。低信噪比、跨被试差异、通道变化及小样本可能使子空间估计不稳定,或过度限制更新、妨碍新任务学习。一个可检验的假设是:在固定 EEG 类别增量协议下,使用相同 Mamba 骨干与数据划分,对照普通顺序微调和零空间约束更新,检验历史类别 Accuracy 的保留是否以新类别学习能力下降为代价。上述迁移不属于本文已验证结果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其针对 Mamba 核心 SSM 参数推导的一致性约束与零空间投影实现,尤其是理论保证的适用条件及抗遗忘与新任务学习能力之间的权衡。