跳到正文

算法、任务与模态

Multi-branch 最新动态

Multi-branch 研究索引;按可核对的标签归档,不以热度评价质量。

25 条精选近 30 天 14 条共收录 44 条

更新

精选归档 · 第 2 页

1月1日周三第 21–25 条
  1. OpenReview · State space models71

    HydraMamba:用于全局点云学习的多头状态空间模型

    基于摘要分析。HydraMamba 面向点云学习中长程依赖建模、无序点集序列化和局部几何学习难以兼顾的问题,提出结合 shuffle serialization、ConvBiS6 与多头 S6(MHS6)的状态空间模型网络。 核心机制:摘要以注意力机制的二次复杂度为背景,利用 Mamba 核心选择性状态空间模型 S6 的线性复杂度与长程建模能力处理全点云交互。shuffle serialization 旨在使无序点集更适配 S6 的因果特性;ConvBiS6 旨在协同捕获局部几何与全局上下文依赖;MHS6 将多头设计扩展到 S6,以增强建模能力。具体排序方式、层内结构、多头融合、损失函数及训练流程尚未验证,不能仅凭模块名称确定其实现。 结果与复现:作者报告 HydraMamba 在物体级和场景级的多项任务上达到 state-of-the-art,但摘要未提供任务名称、数据集、划分、指标数值及对照基线,因此尚不能判断收益大小或跨协议可比性。摘要提供了代码地址,实际可运行性、配置和计算成本尚未验证;实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移至 EEG 的假设是,将电极及其空间位置视作带信号特征的点集,复用局部—全局建模与多头 S6 思路,以应对跨通道依赖和局部空间结构建模。原方法依赖点集序列化及几何关系,EEG 则还具有真实时间顺序,需改造输入表征并区分空间扫描与时间因果关系,不能直接将空间 shuffle 用于时间轴。低信噪比、跨被试差异、通道配置变化及小数据过拟合均可能使该假设失效。一个可证伪的小实验是在固定 Cross-subject 划分、相同训练预算下,对比普通 S6 与逐项加入空间 shuffle、局部几何模块和多头设计的版本,观察任务指标及通道扰动下的稳定性。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其 shuffle serialization、ConvBiS6 与 MHS6 如何协同处理无序点云的序列化及局部—全局建模,但作者所称领先结果和各模块收益仍需结合全文实验核对。

  2. OpenReview · State space models75

    GroupMamba:高效的基于分组的视觉状态空间模型

    基于摘要分析。GroupMamba 针对纯状态空间模型(SSM)在计算机视觉中扩大模型规模时的训练不稳定与效率问题,提出结合分组扫描、通道调制和蒸馏训练的视觉模型,以改善参数效率及大模型训练稳定性。 核心机制是 Modulated Group Mamba 层:将输入通道划分为四组,每组独立应用一个 Visual Single Selective Scanning(VSSS)块,分别沿四个空间方向之一扫描;再通过通道调制算子改善跨通道信息交流。作者还引入基于蒸馏的训练目标,并报告其带来稳定性改善和一致的性能增益。摘要未说明蒸馏教师、具体损失形式及训练配置,这些细节尚未验证。 作者报告在 ImageNet-1K 图像分类、MS-COCO 目标检测与实例分割、ADE20K 语义分割上优于现有方法。其中,23M 参数的 tiny 变体在 ImageNet-1K 分类评估中取得 83.3% top-1 Accuracy;作者称相较同模型规模下最佳现有 Mamba 设计,参数效率改善 26%。摘要未给出该对照模型名称、效率计算口径及完整评估设置,因此不将这一比例解释为计算量或推理速度提升。实验协议、消融及统计信息尚未验证。作者提供了代码与模型地址,但实现和复现条件尚未核验。 平台推测(待验证):假设分组扫描与通道调制能用于 EEG 的长时序建模和跨通道交互,其原始机制依赖视觉空间方向及特征通道结构,不能直接等同于电极拓扑。可复用候选是分组处理、SSM 扫描和通道调制;需要改造扫描轴、分组依据及输入表示。低信噪比、跨被试差异、通道配置变化和小数据可能使分组削弱有效关联,也可能限制蒸馏收益。一个可证伪的小实验是在固定 EEG 数据划分、训练预算及参数量下,对比普通 SSM、分组扫描和加入通道调制的版本,分别检验被试内与跨被试性能及多次训练的波动。该假设不属于论文已验证结果;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其分组定向扫描、跨通道调制与蒸馏训练能否分别改善参数效率和训练稳定性,但视觉任务结果不能直接视为 EEG/BCI 有效性证据。

1月1日周一
  1. OpenReview · State space models70

    PhysMamba:用于远程生理测量的状态空间对偶模型

    基于摘要分析。该研究针对从面部视频提取生理信号的 Remote Photoplethysmography(rPPG)在真实环境中易受运动伪影和噪声影响的问题,提出 PhysMamba,利用 State Space Duality 构建时频交互双路径模型,以学习更具代表性的特征。 机制方面,作者设计 Cross-Attention State Space Duality(CASSD),促进两条路径之间的信息交换与特征互补。摘要将时频交互及跨路径融合与噪声条件下的鲁棒性提升联系起来,但具体时频表示、状态空间实现、交互位置、损失函数及训练流程尚未验证。 作者报告在 PURE、UBFC-rPPG 和 MMPD 数据集上开展比较实验,并达到 SOTA,尤其在复杂环境下表现突出。摘要未提供具体指标、数值、数据划分及对照方法,因此目前无法判断优势幅度,也不能确定这些结果属于数据集内评估还是 Cross-dataset 评估。实验协议、消融及统计信息尚未验证;复现还需核对视频预处理、信号标签、评估流程及实现可用性。 平台推测(待验证):若 CASSD 的时频互补机制不依赖面部视频的特定空间结构,可探索其对 EEG 非平稳信号和伪影干扰的适用性。可复用候选是双路径信息交互模块,需改造视频输入与特征编码;原方法对监督信号、数据规模和时频表示的依赖尚不明确。EEG 的低信噪比、跨被试差异、通道变化及小数据条件可能使交互模块放大伪影或过拟合。一个可检验的小实验是在固定 Cross-subject EEG 划分、相同预处理与训练预算下,对比单路径、双路径无交互及 CASSD 交互模型,并检查受控噪声扰动下的性能变化。该迁移假设不构成已验证的 EEG/BCI 效果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得关注其通过 CASSD 实现时频双路径信息交互的机制,但复杂环境下的鲁棒性优势仍需结合完整实验协议、指标与消融核对。

  2. OpenReview · State space models70

    PhysMamba:用于远程生理测量的状态空间对偶模型

    基于摘要分析。该研究针对从面部视频提取生理信号的 Remote Photoplethysmography(rPPG)在现实环境中受运动伪迹与噪声干扰的问题,提出 PhysMamba,以基于 State Space Duality 的双路径时频交互学习更具代表性的特征。这是一项远程生理测量方法研究,不是直接的 EEG 或 BCI 验证。 核心机制是通过两条路径开展时频信息交互,并使用改进的 Cross-Attention State Space Duality(CASSD)促进路径间的信息交换与特征互补。摘要未说明两条路径的具体输入表示、CASSD 的计算形式、损失函数或训练与推理流程,这些技术细节尚未验证。 作者报告在 PURE、UBFC-rPPG 和 MMPD 数据集上进行了对比实验,并声称 PhysMamba 达到最先进性能,尤其适用于复杂环境。但摘要未提供具体指标、数值、数据划分、对照方法及复杂环境的定义,因此无法判断优势大小或不同评估协议下的泛化能力。实验协议、消融及统计信息尚未验证;复现还需核对视频预处理、参考生理信号、训练配置和实现可用性。 平台推测(待验证):若双路径时频互补确实能增强抗噪能力,其机制可能对应 EEG 中时域动态与频谱线索联合建模的需求。迁移需将面部视频输入模块改造为多通道 EEG 表征,并明确监督信号与数据规模,不能假定视频运动伪迹与 EEG 伪迹具有相同结构。低信噪比、跨被试差异、通道配置变化和小数据训练可能削弱交互模块的收益。一个可证伪的小实验是在固定 EEG 数据划分与匹配模型容量下,比较单路径、双路径无交互及加入 CASSD 的版本,并在相同噪声条件下评估;这仅是迁移假设,不是论文已验证结果。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 PhysMamba 的双路径时频交互与 CASSD 如何应对运动伪迹和噪声,但摘要中的领先性能主张及其向 EEG 的迁移价值尚需验证。

1月1日周日
  1. OpenReview · State space models76

    用于语音识别的多头状态空间模型

    基于摘要分析。该研究针对语音识别中的序列建模,提出带特殊门控机制的多头状态空间模型 MH-SSM,使并行头学习局部与全局时间动态;同时提出以 MH-SSM 层增强 transformer 模块的 Stateformer。 机制与对照:MH-SSM 被设计为 transformer 编码器中多头注意力的可直接替换模块。作者报告,在 LibriSpeech 语音识别任务上,该架构显著优于 transformer transducer,但摘要未提供这一替换方案的具体分数及显著性检验细节。Stateformer 则采用增强 transformer 模块的方式,不能与完全替换注意力的方案混为一谈。门控形式、状态空间参数化、训练目标及推理实现尚未验证。 结果:作者报告,Stateformer 在不使用外部语言模型的条件下,开发集 word error rate 为 1.76%/4.37%,测试集为 1.91%/4.36%,并称其达到 LibriSpeech 任务的当时最优表现。摘要未明确两组数值对应的子集名称,因此不补写;训练数据配置、对照设置、消融及统计信息尚未验证,也不能据此推断其计算效率优势。 平台推测(待验证):假设局部与全局时间动态的并行建模能缓解 EEG 长序列中短时事件与较长时间依赖难以兼顾的问题,可尝试复用 MH-SSM 序列模块,但需改造 EEG 通道输入与任务输出。原任务依赖语音序列及语音识别监督,其收益对训练规模的依赖尚不清楚;低信噪比、通道差异、跨被试分布变化及小数据可能使门控学到噪声或被试特异模式。一个可证伪的小实验是在同一 EEG 任务、固定跨被试划分和训练预算下,仅将基线编码器的多头注意力替换为 MH-SSM,比较预先指定的任务指标与跨被试稳定性。已有 EEG 相关工作尚未检索确认。

    阅读价值:MH-SSM 通过带门控的并行状态空间头建模局部与全局时间动态,值得核对其替换及增强注意力模块的实现与对照,但语音识别收益能否迁移至 EEG 尚未验证。