跳到正文

算法、任务与模态

Hybrid Architecture 最新动态

Hybrid Architecture 研究索引;按可核对的标签归档,不以热度评价质量。

52 条精选近 30 天 11 条共收录 91 条

更新

精选归档 · 第 3 页

1月1日周一第 41–52 条
  1. OpenReview · State space models75

    Multi-Scale VMamba:层级内嵌层级的视觉状态空间模型

    基于摘要分析。该研究面向视觉状态空间模型(SSMs)中多扫描策略带来的冗余,提出 Multi-Scale Vision Mamba(MSVMamba),通过多尺度 2D 扫描与通道混合模块,改善视觉任务中的效率与性能权衡。 核心机制:作者将多扫描策略的有效性与长程依赖建模联系起来,在原始及下采样特征图上执行多尺度 2D 扫描,以保留长程依赖学习能力并降低计算成本;同时引入 Convolutional Feed-Forward Network(ConvFFN),补充通道混合。摘要未给出扫描路径、尺度配置、下采样方式、参数量或计算量,具体效率收益与各模块贡献尚未验证。 作者报告:MSVMamba-Tiny 在 ImageNet 上取得 82.8% top-1 Accuracy;在 COCO 上采用 Mask R-CNN 框架和 1x 训练日程,取得 46.9% box mAP 与 42.2% instance mAP;在 ADE20K 上采用单尺度测试,取得 47.6% mIoU。这些结果分别对应图像分类、目标检测、实例分割与语义分割,不能跨任务直接比较。摘要未提供具体对照模型与完整训练配置,实验协议、消融及统计信息尚未验证。摘要提供了代码仓库,但实现与复现条件尚未核验。 平台推测(待验证):假设多尺度扫描可用于缓解 EEG 长序列建模的计算负担,可复用的部分是多尺度 SSM 扫描思路,需改造的是视觉 2D 特征布局、下采样与通道混合方式。原方法处理具有二维空间结构的图像特征;EEG 的时间—电极结构不能直接等同于图像,低信噪比、跨被试差异、通道配置变化及小数据训练都可能使收益失效,下采样也可能丢失短暂事件。一个可检验的小实验是在固定 EEG 数据划分与相同训练预算下,对比单尺度和多尺度扫描,分别报告被试内与跨被试性能、计算开销,并检查短时信息保留情况;这不是本文已验证的结果。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对多尺度 2D 扫描能否减少视觉 SSM 的多扫描冗余,同时保留长程依赖建模能力;摘要提供了多个视觉任务的结果,但效率收益及其对 EEG 的适用性尚未验证。

  2. OpenReview · State space models72

    SSUMamba:用于高光谱图像去噪的空间–光谱选择性状态空间模型

    基于摘要分析。该研究针对高光谱图像(HSI)去噪中长程空间–光谱相关性建模复杂度较高的问题,提出基于 Mamba 的 SSUMamba,以连续扫描和双向状态空间模型(SSM)建模长程依赖,并结合 3-D 卷积增强局部建模。其主要研究对象是高光谱图像,而非 EEG 或 BCI 信号。 核心组件为空间–光谱连续扫描(SSCS)Mamba:按照行、列、波段三个维度的六种不同顺序生成序列,通过双向 SSM 捕获长程空间–光谱依赖;在各顺序中,对相邻扫描之间的图像排列进行调整,以保持空间–光谱连续性。嵌入的 3-D 卷积则用于增强局部空间–光谱关系建模。摘要未提供损失函数、训练策略及完整网络配置。 作者报告,在高光谱图像去噪实验中,SSUMamba 相比基于 Transformer 的方法取得更好的去噪结果,且每批次显存消耗更低。摘要未给出数据集、噪声设置、评价指标、具体数值及对照模型,因此尚不能判断优势的适用范围;实验协议、消融及统计信息尚未验证。摘要提供了代码地址,但实现与复现条件尚未核对。 平台推测(待验证):可考察的迁移假设是,将具有明确邻接结构的 EEG 时频–通道表示组织为连续序列,用双向 SSM 建模长程关系,并以局部卷积保留邻域信息。然而,EEG 通道并不天然构成规则图像网格,频率轴也不等同于高光谱波段;扫描顺序、通道拓扑和卷积邻域需要改造,训练所需的去噪监督及数据规模亦尚未验证。低信噪比、跨被试差异、通道配置变化与小样本可能使该机制失效,去噪也可能削弱任务相关神经成分。一个可检验的小实验是在固定被试内划分和相同噪声设置下,对比连续扫描与普通序列化的 EEG 去噪模型,同时检查信号重建质量和下游任务表现,以检验连续性设计是否有效。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得关注其通过连续扫描与双向 SSM 联合建模局部和长程空间–光谱依赖的机制,以及作者报告的相对 Transformer 去噪与显存优势;这些优势的具体评估条件及 EEG 迁移有效性尚未验证。

  3. OpenReview · State space models73

    MambaMIM:通过状态空间 Token 插值预训练 Mamba

    基于摘要分析。本文研究医疗图像任务中 Mamba 的生成式自监督预训练,提出 MambaMIM,以 Selective Structure State Space Sequence Token-interpolation(S6T)为核心,旨在增强 Mamba 的长程表征能力,并支持单一或混合 Mamba 架构。 方法在编码器中引入自底向上的 3D 混合掩码策略,以保持不同架构之间的掩码一致性;随后利用 S6T 在状态空间中学习掩码序列的因果关系。这里的“因果关系”沿用摘要表述,其具体数学定义尚未验证,不应等同于医学因果推断。相较于摘要所述 CNN 和 ViT 的生成式自监督学习背景,本文的主要方法贡献是面向 Mamba 的状态空间 Token 插值预训练,而非已验证的 EEG 解码方法。 作者报告,下游医疗图像实验支持 Mamba 预训练的可行性与先进性,但摘要未提供数据集、划分协议、对照基线或具体指标,因此无法判断收益幅度及跨任务稳定性。损失形式、掩码比例、插值实现、实验协议、消融及统计信息尚未验证。摘要提供了代码仓库地址,但代码完整性、训练配置及复现条件尚未核验。 平台推测(待验证):若 S6T 能利用序列结构恢复被遮蔽信息,它可能为 EEG 长程时序表征的自监督学习提供参考;这一假设并不意味着医疗图像结果可直接迁移到 BCI。可考察的模块是状态空间 Token 插值,需改造的是 EEG 的时序与通道 Token 化、掩码方式及重建目标;原方法所依赖的训练规模与结构假设尚未明确。低信噪比、跨被试差异、通道布局变化和小数据可能使插值偏向背景噪声或被试特征。一个可证伪的小实验是在固定 EEG 数据划分与相同骨干、训练预算下,对比加入 S6T 与常规掩码重建的跨被试下游表现,并核对是否存在稳定增益。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其通过 S6T 在状态空间中处理掩码序列的预训练机制及跨架构掩码一致性设计,但摘要不足以验证具体性能收益或 EEG/BCI 适用性。

  4. OpenReview · State space models72

    MambaVLT:用于视觉-语言跟踪的时间演化多模态状态空间模型

    基于摘要分析。MambaVLT 针对视觉-语言跟踪中时序信息利用不足、参考特征难以动态更新的问题,提出基于 Mamba 的多模态状态空间模型,通过随时间演化的状态表示支持目标跟踪,并自适应调节视觉与语言参考的权重。 机制方面,模型包含 time-evolving hybrid state space block 和 selective locality enhancement block,用于捕获多模态上下文信息与自适应更新参考特征;另设 modality-selection module,动态调整视觉和语言参考的权重,以缓解任一参考模态可能产生的歧义。摘要将 Mamba 状态演化的时序记忆能力与线性复杂度作为方法动机,但具体状态更新公式、模块连接、损失、训练流程及端到端计算开销尚未验证。 作者报告,该方法在多个基准上相较先进跟踪器表现良好;摘要未提供基准名称、数据划分、对照模型或量化指标,因此尚不能判断优势幅度及适用条件。实验协议、消融及统计信息尚未验证,代码与复现条件也需核对全文。 平台推测(待验证):其原问题依赖连续视觉序列及视觉、语言参考,时序状态更新与动态模态选择可能为 EEG 与辅助模态融合提供机制参考,对应长时序建模和模态可靠性变化的瓶颈;这不代表已验证的 EEG/BCI 效果。可考虑复用状态更新和模态选择思路,但需改造输入编码、时间对齐、参考表示与任务输出。EEG 的低信噪比、跨被试差异、通道变化及小数据可能导致状态累积噪声或模态权重失稳。一个可检验的小实验是在固定被试和划分的 EEG 多模态任务中,保持编码器与训练预算一致,对比固定融合与动态模态选择,并在辅助模态受扰时检验性能变化。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其如何利用随时间演化的状态空间更新多模态参考特征,以及动态调节模态权重;具体性能优势与 EEG 迁移价值尚未验证。

9月22日周五
  1. OpenReview · State space models73

    通过状态空间增强 Transformer 实现高效长序列建模

    基于摘要分析。本文主要研究自然语言处理中的长序列建模:标准 Transformer 注意力具有二次计算成本,而高效注意力变体的全局信息建模能力受限。作者提出 State Space Augmented Transformer(SPADE),将状态空间模型(SSM)与高效局部注意力结合,以兼顾长程依赖和复杂局部信息。 核心机制是在 SPADE 的底层引入 SSM,其余层采用高效局部注意力。作者认为,SSM 提供的全局信息可以补充局部注意力对长程依赖捕获的不足,而局部注意力则补足 SSM 对复杂局部信息表达灵活性不足的问题。摘要未说明具体 SSM 形式、局部注意力方案、融合操作、损失函数或实际计算与存储开销,这些细节尚未验证。 作者报告,该方法在 Long Range Arena benchmark 和语言建模任务上取得了支持其有效性的实验结果;为考察可扩展性,作者还预训练了大型 encoder-decoder 模型,并在自然语言理解和自然语言生成任务上进行了微调评估。摘要未提供具体分数、模型规模、数据划分及对照基线,因此不能量化性能提升或效率收益,实验协议、消融及统计信息尚未验证。作者表示代码与预训练模型检查点将公开,但仅凭该材料无法确认当前可用状态。 平台推测(待验证):其全局 SSM 与局部注意力互补机制可能对应长时段 EEG 中跨时间依赖与短时波形特征并存的建模需求,但这是迁移假设,不是本文已验证的 EEG/BCI 结果。可复用的是两类模块的组合思路,需改造输入表征、通道编码及任务输出,并核对序列长度、监督方式和训练规模。EEG 的低信噪比、跨被试差异、通道配置变化及小数据条件可能削弱全局状态建模的收益。一个可检验的小实验是在固定跨被试划分与训练预算下,对比局部注意力模型及加入底层 SSM 的版本,报告同一任务指标、显存与推理耗时,检验收益是否来自全局模块。已有 EEG 相关工作尚未检索确认。

    阅读价值:SPADE 以底层 SSM 补充全局信息、其余层使用高效局部注意力,为核对长序列建模中全局依赖与局部表达的互补机制提供了具体对象,但其 EEG/BCI 适用性尚未验证。

1月1日周日
  1. OpenReview · State space models80

    用于长程时空建模的卷积状态空间模型

    基于摘要分析。本文研究长时空序列中复杂空间相关性与长程时间依赖的联合建模,提出卷积状态空间模型 ConvSSM,并形成高效变体 ConvS5;原研究对象是时空序列预测,而非 EEG 或 BCI。 核心机制是结合 ConvLSTM 的张量状态建模与 S4、S5 等状态空间方法的长序列建模思路。作者将并行扫描用于卷积递推,以实现次二次复杂度的并行计算和快速自回归生成,并建立 ConvSSM 动力学与 SSM 的等价关系,据此设计面向长程依赖的参数化及初始化策略。其针对的对照瓶颈分别是 ConvLSTM 的顺序计算,以及 Transformer 注意力成本随序列长度二次增长;具体状态结构、参数化形式和训练目标尚未验证。 作者报告,在长预测跨度的 Moving-MNIST 实验中,ConvS5 的表现显著优于 Transformers 和 ConvLSTM,训练速度为 ConvLSTM 的 3 倍,样本生成速度为 Transformers 的 400 倍;这些倍数仅对应摘要所述实验,序列长度、硬件、批量大小及具体计时口径尚未验证。作者还报告,在 DMLab、Minecraft 和 Habitat 预测基准上,其性能达到或超过所比较的先进方法,但摘要未提供具体指标及数值。实验协议、数据划分、消融及统计信息尚未验证,代码与复现配置亦需核对全文。 平台推测(待验证):假设 EEG 可被组织为具有合理空间邻接关系的多通道时间序列,卷积空间建模与状态空间长程递推可能对应多通道相关性和长时窗计算成本两个瓶颈。并行扫描及长程初始化思路可能复用,但输入表示、空间卷积和任务输出需适配电极布局与 EEG 监督方式;原任务的数据规模及监督细节尚未验证。低信噪比、跨被试分布差异、通道布局变化及小数据可能使视觉预测中的优势无法迁移。可在固定 EEG 数据划分与训练预算下,用同一空间前端比较 ConvS5 与非卷积 SSM 的长时窗任务性能、训练和推理耗时,检验卷积状态是否带来稳定增益。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其将卷积递推转化为可并行扫描的机制及长程依赖参数化策略,但作者报告的预测性能与速度优势仍需结合全文实验协议核对,EEG 迁移价值尚未验证。

  2. OpenReview · State space models76

    用于语音识别的多头状态空间模型

    基于摘要分析。该研究针对语音识别中的序列建模,提出带特殊门控机制的多头状态空间模型 MH-SSM,使并行头学习局部与全局时间动态;同时提出以 MH-SSM 层增强 transformer 模块的 Stateformer。 机制与对照:MH-SSM 被设计为 transformer 编码器中多头注意力的可直接替换模块。作者报告,在 LibriSpeech 语音识别任务上,该架构显著优于 transformer transducer,但摘要未提供这一替换方案的具体分数及显著性检验细节。Stateformer 则采用增强 transformer 模块的方式,不能与完全替换注意力的方案混为一谈。门控形式、状态空间参数化、训练目标及推理实现尚未验证。 结果:作者报告,Stateformer 在不使用外部语言模型的条件下,开发集 word error rate 为 1.76%/4.37%,测试集为 1.91%/4.36%,并称其达到 LibriSpeech 任务的当时最优表现。摘要未明确两组数值对应的子集名称,因此不补写;训练数据配置、对照设置、消融及统计信息尚未验证,也不能据此推断其计算效率优势。 平台推测(待验证):假设局部与全局时间动态的并行建模能缓解 EEG 长序列中短时事件与较长时间依赖难以兼顾的问题,可尝试复用 MH-SSM 序列模块,但需改造 EEG 通道输入与任务输出。原任务依赖语音序列及语音识别监督,其收益对训练规模的依赖尚不清楚;低信噪比、通道差异、跨被试分布变化及小数据可能使门控学到噪声或被试特异模式。一个可证伪的小实验是在同一 EEG 任务、固定跨被试划分和训练预算下,仅将基线编码器的多头注意力替换为 MH-SSM,比较预先指定的任务指标与跨被试稳定性。已有 EEG 相关工作尚未检索确认。

    阅读价值:MH-SSM 通过带门控的并行状态空间头建模局部与全局时间动态,值得核对其替换及增强注意力模块的实现与对照,但语音识别收益能否迁移至 EEG 尚未验证。

  3. OpenReview · State space models81

    用于长程时空建模的卷积状态空间模型

    基于摘要分析。本文研究长时空序列中复杂空间相关性与长程时间依赖的联合建模,提出卷积状态空间模型(ConvSSM),并据此构建高效变体 ConvS5;主要研究对象是时空序列预测与生成,而非 EEG 或 BCI。 核心机制是结合 ConvLSTM 的张量状态建模思路与 S4、S5 等状态空间方法的长序列建模能力。作者将并行扫描用于卷积递推,以实现次二次复杂度的并行化与快速自回归生成,并建立 ConvSSM 与 SSM 动力学之间的等价关系,用于指导长程依赖建模的参数化和初始化。摘要未提供具体状态结构、损失、训练流程或复杂度推导细节。 作者报告,在长预测时域的 Moving-MNIST 实验中,ConvS5 的表现显著优于 Transformers 和 ConvLSTM,训练速度为 ConvLSTM 的 3 倍,样本生成速度为 Transformers 的 400 倍;这些倍率仅对应所述实验背景,硬件、序列长度、模型规模及计时口径尚未验证。作者还报告,在 DMLab、Minecraft 和 Habitat 预测基准上,其表现达到或超过当时先进方法;具体指标、数据划分、实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设 EEG 通道间关系能够表示为适合卷积的空间结构,张量状态与长程递推可能用于联合建模通道相关性和长时间上下文。可考虑复用卷积状态递推与并行扫描,但需改造通道空间表示、输入编码及任务输出;不规则电极布局、跨被试差异、低信噪比和小数据可能削弱其优势。一个可检验的小实验是在固定 Cross-subject 划分与训练预算下,对比 ConvS5、ConvLSTM 和 Transformer 在不同 EEG 窗口长度上的同一任务指标、训练耗时及推理耗时,并核对空间卷积是否带来稳定增益。此为迁移假设,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其卷积递推的并行扫描及与 SSM 动力学的等价关系,这为兼顾空间结构与长程依赖提供了具体方法路径,但摘要中的效率优势及其 EEG 适用性仍需分别验证。

  4. OpenReview · State space models77

    使用状态空间 Transformer 进行高效电影场景检测

    基于摘要分析。研究针对电影场景检测需要跨越长视频片段进行推理、而常见视频识别模型侧重短时分析的问题,提出可端到端训练的 TranS4mer,以分层的局部与长程建模捕获电影场景线索。原论文研究对象是电影视频,并非 EEG 或 BCI。 核心模块 S4A 结合 structured state-space sequence(S4)与自注意力(A)。输入为已划分为镜头的帧序列:模块先通过自注意力捕获镜头内部的短程依赖,再用状态空间运算聚合镜头之间的长程线索;多个 S4A 模块堆叠构成 TranS4mer。其机制依赖帧—镜头的层级结构,区别于仅对短视频片段建模的方案。具体监督信号、损失函数、模块数量、训练规模与镜头划分方式尚未验证。 作者报告,TranS4mer 在 MovieNet、BBC 和 OVSD 三个电影场景检测数据集上优于此前方法;相较标准 Transformer,速度为其 2 倍,所需 GPU 显存约为其三分之一。摘要未给出检测指标、数据划分、基线配置及测速硬件、序列长度等条件,因此这些结果不能脱离原评估协议比较。实验协议、消融及统计信息尚未验证。作者表示将发布代码和模型,材料不能确认其已公开。 平台推测(待验证):迁移假设是,将 EEG 长记录划为局部时间窗,以自注意力处理窗内关系、以 S4 聚合跨窗依赖,可能缓解长序列全局注意力的计算负担。可复用的是局部—长程分工,需改造视频特征输入、分段策略及任务输出,并重新设计监督目标。EEG 缺少天然镜头边界,低信噪比、跨被试差异、通道配置变化及小数据训练均可能使该结构失效。可检验的小实验是在同一 EEG 数据划分与训练预算下,对比该结构、纯自注意力及纯 S4,检验长上下文是否带来任务指标收益,并记录显存与运行时间;这不是原论文已证实的结论,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得关注其以镜头内自注意力与镜头间状态空间运算分工处理长视频的机制;作者报告了效率优势,但能否迁移到 EEG 长序列建模尚未验证。

  5. OpenReview · EEG74

    EEG Conformer:用于 EEG 解码与可视化的卷积 Transformer

    基于摘要分析。该研究针对 EEG 解码中 CNN 感受野有限、可能难以捕获长期依赖的问题,提出紧凑的 EEG Conformer,将局部特征提取与全局关联建模整合到统一的 EEG 分类框架,并提供脑地形图可视化策略。 核心机制是先通过一维时间卷积和空间卷积学习低层局部特征,再直接连接自注意力模块,提取局部时间特征之间的全局关联,最后使用基于全连接层的分类器预测 EEG 类别。其方法价值在于将卷积与自注意力作为互补模块,而非单独依赖局部卷积;具体网络深度、参数量、损失函数、训练配置与推理成本尚未验证。 可视化方面,作者将类激活映射投影到脑地形图,以增强分类结果的可解释性。摘要未提供该投影的具体计算流程或解释性验证结果,因此不能据此认定可视化已经揭示了可靠的神经生理机制。 作者报告,在涵盖 EEG 运动想象与情绪识别范式的三个公开数据集上,方法取得了当时的 state-of-the-art 性能,并提出其有潜力成为通用 EEG 解码的新基线。摘要未列出数据集名称、被试数量、数据划分、被试内或跨被试等评估协议、对照方法与具体指标,故目前无法核对性能提升的幅度或跨协议可比性;实验协议、消融及统计信息尚未验证。 作者说明代码已公开,可作为复现入口。复现时需结合全文与实现核对 EEG 预处理、输入窗口、卷积和注意力配置、训练策略及评估划分,并分别检验全局关联模块的增益与脑地形图可视化的稳定性。摘要尚不足以确定其跨被试、跨会话泛化能力。

    阅读价值:值得核对其局部卷积特征与全局自注意力的组合机制,以及类激活映射到脑地形图的可视化策略;摘要提供了公开代码入口,但性能优势及解释性仍需结合完整实验协议验证。

1月1日周六
  1. OpenReview · EEG78

    用于 EEG 解码的深度黎曼网络

    基于摘要分析。本研究针对深度黎曼网络(Deep Riemannian Networks,DRNs)在 EEG 解码中的架构设计、端到端学习及内部数据变换问题,提出 EE(G)-SPDNet,并通过广泛的超参数分析探索深度学习与黎曼几何解码方法的结合。 方法与机制:研究重点包括网络规模、端到端学习能力及网络内部表示与传统 EEG 解码方式的关联。EE(G)-SPDNet 被描述为一种宽型、端到端 DRN,可直接从原始 EEG 学习任务相关信息,无需手工设计滤波器组。摘要未提供其具体层结构、黎曼几何运算、损失函数或训练配置,这些实现细节尚未验证。 实验与结果:作者报告,在五个公开 EEG 数据集上测试网络并与先进 ConvNets 比较,EE(G)-SPDNet 可以取得优于这些对照模型的解码表现。摘要未列出数据集名称、任务、被试数、被试内或跨被试等评估协议及具体指标,因此不能据此判断优势大小、适用任务或泛化范围。 滤波与表示分析:作者报告,模型使用了具有生理合理性的频率区域;端到端学习得到的滤波器比面向传统 alpha、beta、gamma 频段的带通滤波器更复杂,且通道特异性滤波可改善性能。这些观察支持进一步研究可学习滤波与空间通道差异的作用,但不能仅凭摘要将生理合理性等同于机制解释或跨场景鲁棒性。 局限与复现核对:作者的架构分析提示,网络可能未充分利用黎曼几何特有的信息,仍有改进空间。复现需核对各数据集的预处理与划分、ConvNet 基线配置、网络宽度与端到端训练的对照,以及通道特异性滤波的具体实现。实验协议、消融及统计信息尚未验证,代码可用性亦尚未确认。

    阅读价值:值得阅读的具体原因是其结合架构分析与滤波分析,考察端到端黎曼几何网络如何从原始 EEG 学习任务相关信息;摘要中的性能优势仍需结合具体数据划分、ConvNet 基线及统计结果核对。

  2. OpenReview · State space models77

    使用状态空间 Transformer 的高效电影场景检测

    基于摘要分析。本文研究电影场景检测:场景理解需要跨越较长电影片段整合线索,而多数视频识别模型侧重短时分析。作者提出可端到端训练的 State-Space Transformer 模型 TranS4mer,通过结合局部自注意力与长程状态空间运算,建模电影中的短程和长程依赖。 核心模块 S4A 结合 structured state-space sequence(S4)与自注意力(A)。输入是已划分为电影镜头的帧序列;模块先用自注意力捕获镜头内短程依赖,再用状态空间运算聚合镜头间长程线索。TranS4mer 由多个 S4A 模块堆叠构成,具体堆叠数量、特征提取方式、损失函数及训练配置尚未验证。该设计的关键在于利用镜头这一层级结构,分别处理局部关系与跨镜头上下文。 作者报告,在 MovieNet、BBC 和 OVSD 三个电影场景检测数据集上,TranS4mer 优于此前方法;相较标准 Transformer,速度为其 2 倍,GPU 显存需求约为其三分之一。摘要未给出检测指标、划分协议、具体对照配置及效率测量条件,因此这些结果仅适用于作者所述电影场景检测评估,实验协议、消融及统计信息尚未验证。作者表示将发布代码和模型,材料不能确认其已公开。 平台推测(待验证):可检验的迁移假设是,将局部交互与长程状态聚合分离,可能缓解长时 EEG 建模的计算负担。可复用的是 S4A 的分工机制,但电影镜头结构不能直接等同于 EEG 时间窗;需要改造信号编码、时间分段与任务监督。摘要也不足以判断原方法的数据规模要求。低信噪比、跨被试差异、通道布局变化及小数据训练均可能使局部注意力学习到噪声,或使长程聚合混合不同生理状态。一个小规模可证伪实验是在同一 EEG 数据集、固定跨被试划分及相同输入长度和训练预算下,对比局部注意力加 S4、纯注意力和纯 S4,核对任务指标与速度、显存,并测试时间窗长度变化。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是 TranS4mer 将镜头内自注意力与镜头间 S4 状态空间聚合分工结合的长序列建模机制;其效率优势由作者报告,对 EEG 的迁移价值尚未验证。