跳到正文

算法、任务与模态

Transformer 最新动态

Transformer 研究索引;按可核对的标签归档,不以热度评价质量。

222 条精选近 30 天 67 条共收录 321 条

更新

精选归档 · 第 12 页

1月1日周六第 221–222 条
  1. OpenReview · State space models73

    通过状态空间增强 Transformer 实现高效长序列建模

    基于摘要分析。该研究面向自然语言处理中的长序列建模,提出 State Space Augmented Transformer(SPADE),以 SSM 补充全局信息,并以高效局部注意力处理局部依赖,旨在缓解标准注意力的二次计算成本与高效注意力全局信息建模能力有限之间的矛盾。 核心机制是将 SSM 加入 SPADE 的底层,其余层采用高效局部注意力。作者认为,SSM 擅长长序列建模,但捕获复杂局部信息的灵活性不足;局部注意力则需要补足长程依赖,两者因而具有互补性。摘要未说明具体 SSM 形式、局部注意力算法、融合方式、损失函数或实际复杂度,不能据此推断模型规模与计算收益。 作者报告,SPADE 在 Long Range Arena benchmark 和语言建模任务上的实验支持其有效性;作者还预训练了大型 encoder-decoder 模型,并展示自然语言理解与自然语言生成任务的微调结果,以考察可扩展性。摘要未提供具体任务划分、对照基线、指标数值或资源开销,实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,SSM 的全局上下文与局部注意力的细粒度建模可能对应长时程 EEG 中持续状态与短时事件并存的建模需求。可复用的是二者互补的结构思路;需改造 EEG 的多通道输入表示、时间位置编码和任务输出端。原文评估依赖序列基准及语言任务,并包含大型预训练,不能直接推及小样本 EEG。低信噪比可能使全局状态累积噪声,通道差异与跨被试分布变化也可能削弱收益。一个可检验的小实验是在固定跨被试划分、训练预算和输入长度下,对比局部注意力模型与加入底层 SSM 的版本,同时记录任务指标、显存及推理时间,检验全局信息增益是否成立。已有 EEG 相关工作尚未检索确认。

    阅读价值:SPADE 将 SSM 的全局信息建模与局部注意力结合,为长序列计算成本与局部表达能力的权衡提供了可核对的机制路径,但其 EEG/BCI 适用性尚未验证。

  2. OpenReview · State space models80

    使用状态空间视频模型进行长电影片段分类

    基于摘要分析。本文研究长电影片段分类中的长程时序推理问题,提出 ViS4mer,将 Transformer 的短程时空特征提取与结构化状态空间序列(S4)层的长程建模结合,以缓解长序列自注意力的二次计算成本。 核心机制是使用标准 Transformer encoder 提取短程时空特征,再交由多尺度时序 S4 decoder 进行长程推理。decoder 各层逐步降低时空特征分辨率与通道维度,在压缩表示的同时建模长程时空依赖。其方法价值在于局部特征提取和长程推理的模块分工,而非将整个视频处理流程完全替换为 S4。 作者报告,相对于对应的纯自注意力模型,ViS4mer 速度为其 2.63 倍,GPU 显存需求为其八分之一;硬件、输入长度、批量大小及计时口径尚未验证。作者报告,在 Long Video Understanding(LVU)benchmark 的 9 项长电影视频分类任务中,6 项达到当时的最先进结果,并在 Breakfast 和 COIN 程序性活动数据集上取得有竞争力的结果。具体任务指标、数据划分、对照配置、消融及统计信息尚未验证,不能据此比较不同评估协议。摘要提供了公开代码地址,但运行环境、预训练依赖及复现完整性尚未核对。 平台推测(待验证):这一机制可对应长时段 EEG 建模中全局注意力成本较高的瓶颈,但视频结果不等于 BCI 效果。迁移假设依赖于任务确有长程时序信息,以及局部 EEG 特征能保留该信息;可复用 S4 长程推理模块,需改造视频时空编码和多尺度降采样,使其适配 EEG 通道、采样率及任务监督。低信噪比、跨被试分布差异、通道配置变化和小数据可能使压缩过程丢失短暂 ERP 或其他判别线索。一个可检验的小实验是固定 EEG 局部编码器与数据划分,仅比较 S4 和自注意力长程模块,在不同输入时长下记录任务指标、推理时间及显存,并严格隔离训练与测试被试。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其将短程 Transformer 特征提取与多尺度 S4 长程推理结合的机制及效率对照,但作者报告的视频任务收益尚不能视为 EEG/BCI 有效性的证据。