跳到正文

算法、任务与模态

Efficient AI 最新动态

Efficient AI 研究索引;按可核对的标签归档,不以热度评价质量。

191 条精选近 30 天 118 条共收录 219 条

更新

精选归档 · 第 9 页

9月26日周四第 161–180 条
  1. OpenReview · State space models73

    DyGMamba:利用状态空间模型高效建模连续时间动态图的长期时间依赖

    DyGMamba 面向连续时间动态图(CTDG)的表示学习,尝试同时解决长节点交互历史的计算开销与关键时间信息筛选问题,核心贡献是将 Mamba 状态空间模型(SSM)用于节点历史编码和时间模式驱动的信息选择。以下基于摘要分析,未取得论文全文。 机制上,节点级 SSM 首先编码历史节点交互序列;时间级 SSM 随后提取历史图中的时间模式,其输出用于动态选择交互历史中的关键信息。摘要描述的设计重点不只是扩大历史窗口,而是让时间模式参与信息筛选。具体输入表示、两个 SSM 的连接方式、选择操作、损失函数及训练流程尚未验证。 作者在动态链接预测任务上进行评估,并报告 DyGMamba 在多数情形下达到当时最优表现,同时保持较高的计算资源效率,使有限计算预算下的长时间依赖建模成为可能。摘要未提供数据集、划分协议、基线、指标数值或资源测量口径,因此不能量化其性能与效率优势;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若将 EEG 通道或脑区表示为节点、将带时间戳的连接变化表示为交互,该机制可能用于筛选长时程连接历史中的任务相关信息。此迁移假设依赖于 EEG 能否形成有意义的交互事件,而不是直接将原始波形视为动态图。可复用部分是历史序列编码和时间模式驱动的选择模块;需改造的是节点定义、连接估计、事件构造与任务输出。低信噪比可能产生伪交互,跨被试及通道差异可能破坏事件语义,小数据也可能使选择机制过拟合。一个可证伪的小实验是在固定 EEG 数据与跨被试划分下,以相同连接构造和历史窗口比较完整机制与不使用时间级选择的对照,同时记录任务指标及资源开销。上述仅为迁移假设,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其利用节点级与时间级 SSM 编码长交互历史并动态选择关键信息的机制,但动态图预测收益及其向 EEG 时变连接建模迁移的有效性仍需核对实验与验证。

  2. OpenReview · Representation learning76

    DenoiseRep:用于表征学习的去噪模型

    基于摘要分析。DenoiseRep 研究如何将去噪机制用于判别任务的表征学习,通过联合特征提取与去噪提升特征的判别能力。其核心贡献是将骨干网络中的各嵌入层视为逐步去噪层,并通过参数融合消除独立去噪计算。 机制上,作者将从低层到高层的级联特征提取,与递归、逐步的特征去噪统一起来。作者称,特征提取层与去噪层的参数可以融合,并给出了融合前后等价性的理论论证,据此主张特征去噪无需额外计算。摘要未说明去噪目标、噪声构造、损失形式、训练流程或参数融合的适用条件,这些内容尚需全文核对。该方法被描述为无需标签,也可与可用标签互补;这不等于所有下游任务的训练均不使用标签。 作者报告,在重识别数据集 Market-1501、DukeMTMC-reID、MSMT17、CUHK-03、vehicleID,图像分类数据集 ImageNet、UB200、Oxford-Pet、Flowers,以及 COCO 目标检测和 ADE20K 图像分割任务上观察到稳定的改进,并在 ResNet、ViT、Swin、Vmamda 架构上验证有效性。摘要未提供具体指标、数值、数据划分或对照基线,无法据此判断收益大小及不同任务间的可比性;实验协议、消融及统计信息尚未验证。复现还需核对融合实现、训练配置及代码可得性。 平台推测(待验证):若逐层去噪确实能够保留判别信息,并且融合条件适用于 EEG 编码器,该机制可能用于缓解 EEG 表征中的噪声干扰。可复用部分是逐层特征去噪与参数融合思路;需改造部分包括时序与通道特征处理、噪声定义及下游监督方式。视觉数据上的结果不能证明其适用于低信噪比、跨被试或小样本 EEG;去噪可能误删弱任务信号,通道变化也可能破坏特征假设。一个可检验的小实验是在固定跨被试划分下,对比同一 EEG 骨干加入与不加入 DenoiseRep 的表现,同时检查融合前后输出一致性及推理开销。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其特征提取与去噪层参数融合的等价性条件,以及无需标签的特征增强能否在不增加推理计算的前提下稳定改善判别任务;向 EEG 迁移的有效性尚未验证。

  3. OpenReview · State space models74

    Multi-Scale VMamba:层级内嵌层级的视觉状态空间模型

    基于摘要分析。研究针对视觉 State Space Models(SSMs)中多扫描策略带来的冗余,提出 Multi-Scale Vision Mamba(MSVMamba),通过多尺度二维扫描与通道混合模块改善效率和性能之间的权衡。 核心机制:作者分析认为,长程依赖是多扫描策略有效的重要原因。MSVMamba 在原始及下采样特征图上进行多尺度二维扫描,旨在保留长程依赖学习能力并降低计算成本;同时引入 Convolutional Feed-Forward Network(ConvFFN),补充通道混合。摘要未给出具体扫描路径、下采样配置、模块结构、损失或参数量,相关细节尚未验证。 作者报告:MSVMamba-Tiny 在 ImageNet 上取得 83.0% top-1 Accuracy;在 COCO 上,采用 Mask R-CNN 框架及 1x 训练日程,取得 46.9% box mAP 和 42.5% instance mAP;在 ADE20K 上采用单尺度测试,取得 47.9% mIoU。摘要未提供具体对照结果或实测计算开销,不能据此确认相对优势幅度。实验协议、消融及统计信息尚未验证。材料提供了代码仓库,但实现与复现条件尚未核对。 平台推测(待验证):迁移假设是,多尺度扫描可能用于 EEG 的长短时程依赖建模,缓解长序列计算负担,但原方法依赖视觉二维特征图,不能直接等同于 EEG 通道与时间结构。可考虑复用 SSM 和多尺度处理思路,改造扫描顺序、下采样方式及通道混合模块。风险包括下采样丢失短暂 ERP 或高频信息、空间邻接不匹配,以及跨被试、通道变化和小数据条件下泛化不足。一个可证伪的小实验是在固定 EEG 任务与跨被试划分下,对比单尺度与多尺度扫描,控制参数量和训练预算,同时记录任务指标、延迟及短时事件识别表现。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其多尺度扫描能否在保留长程依赖建模能力的同时降低计算开销,以及 ConvFFN 的独立贡献;摘要提供了多任务结果,但效率收益与消融证据尚未验证。

  4. OpenReview · State space models79

    VMamba:视觉状态空间模型

    基于摘要分析。该研究针对计算机视觉网络的计算效率问题,将状态空间语言模型 Mamba 改造为视觉骨干 VMamba,提出通过二维扫描聚合上下文信息的架构,并以线性时间复杂度为设计特征。 核心机制是由 Visual State-Space(VSS)块构成网络,并在其中使用 2D Selective Scan(SS2D)模块。SS2D 沿四条扫描路径遍历二维数据,以衔接一维 selective scan 的有序处理方式与二维视觉数据的非序列结构,从不同方向收集上下文信息。作者据此构建一组 VMamba 架构,并通过架构及实现层面的优化加速;具体扫描顺序、网络配置、训练损失及优化细节尚未验证。 作者报告,VMamba 在多种视觉感知任务中表现良好,相较所比较的基准模型具有更好的输入规模扩展效率。摘要未提供具体任务、数据集、指标数值、对照模型或计算成本测量条件,因此尚不能核对性能与效率之间的权衡。实验协议、消融及统计信息尚未验证。摘要提供了源码仓库,但代码与论文实验的一致性、运行环境及复现成本仍需核对。 平台推测(待验证):迁移假设是,将 SS2D 用于 EEG 的通道×时间表示,可能为长时间窗与跨通道上下文建模提供一种计算效率较高的路径;这不是已验证的 EEG/BCI 结果。原方法依赖具有二维组织结构的视觉输入,而 EEG 通道顺序不天然等同于规则图像网格,需改造通道排列、空间编码及输入适配模块。低信噪比、跨被试分布变化、通道配置差异和小数据训练可能使视觉扫描机制失效。可检验的小实验是在同一 EEG 数据集、固定 Cross-subject 划分及训练预算下,对比二维扫描与一维时间扫描,并扰动通道排列,检验收益是否依赖人为顺序,同时测量不同时间窗长度下的运行成本。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其用四条扫描路径将一维 selective scan 适配二维视觉数据的机制及输入规模扩展效率评估,但该机制对 EEG 的适用性尚未验证。

  5. OpenReview · State space models76

    Coupled Mamba:利用耦合状态空间模型增强多模态融合

    基于摘要分析。研究针对多模态融合中复杂的模态内与模态间相关性,提出 Coupled SSM,通过耦合不同模态的状态链建模动态交互,同时保持各模态内部状态过程的独立性;Coupled Mamba 是其多模态融合模型。 核心机制是跨模态隐状态转移:当前状态依赖自身状态链及相邻状态链在前一时间步的状态。为兼容 SSM 的硬件感知并行设计,作者通过引入历史状态并推导状态方程,得到全局卷积核。其具体耦合参数化、卷积核构造、训练损失及并行实现尚未验证,不能仅凭摘要判断其计算复杂度或适用序列长度。 作者报告,在 CMU-MOSEI、CH-SIMS、CH-SIMSV2 的多域输入实验中,相较所比较的方法,F1-Score 分别提高 0.4%、0.9% 和 2.3%。这里保留摘要的百分比表述,其指相对增幅还是绝对百分点尚未验证。作者还报告推理快 49%、GPU 显存节省 83.7%;对应基线、硬件、输入长度、批量大小及测量口径尚未验证,不能据此推断其他任务中的加速幅度。数据划分、F1 计算方式、消融及统计信息同样需查阅全文。 平台推测(待验证):若跨模态状态耦合能利用互补时序信息,它可能适用于 EEG 与其他生理信号的联合建模,但这不构成已验证的 BCI 效果。迁移依赖可配对、可对齐的多模态序列及明确的任务监督;可复用状态链耦合思路,需改造信号编码、采样率对齐与状态更新时间尺度。EEG 低信噪比、跨被试差异、通道变化及小数据可能使耦合传播噪声而非有效信息。一个可证伪的小实验是在固定跨被试划分、相同编码器和训练预算下,对比独立状态链与耦合状态链,并测试模态缺失或时间错位时的表现。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其跨模态隐状态耦合与硬件并行兼容的推导,作为多模态序列融合的机制参考;摘要中的性能与资源收益仍需结合全文评估协议核对。

  6. OpenReview · State space models74

    PointMamba:用于点云分析的简单状态空间模型

    基于摘要分析。本文研究点云分析中全局建模与计算成本之间的权衡,提出 PointMamba,将源自 NLP 的 Mamba 状态空间模型(SSM)用于点云分析,以线性复杂度算法替代具有二次复杂度的注意力机制。 核心方法是利用空间填充曲线进行点 token 化,并采用简单、非层级的 Mamba 编码器作为骨干。其设计关注如何将三维点云组织成可供序列模型处理的表示,再通过 Mamba 完成全局建模;摘要未说明具体曲线类型、token 构造细节、训练目标及推理设置,相关机制仍需全文核对。 作者报告,在多个数据集的评估中,PointMamba 获得更优性能,同时显著降低 GPU 显存使用与 FLOPs。摘要未提供数据集名称、任务、划分、对照模型和具体数值,因此无法量化优势或判断不同协议下的可比性。实验协议、消融及统计信息尚未验证。材料提供了代码仓库,但代码完整性、环境依赖及复现条件尚未核查。 平台推测(待验证):可迁移的假设是,按空间结构组织 token 后使用 Mamba,可能为多通道 EEG 的长序列建模提供较低成本的方案,而非点云结果直接证明 BCI 有效。原方法依赖点云空间结构;迁移时可考虑复用 Mamba 编码器,但需重新设计电极空间与时间维度的 token 化、排序和任务监督。EEG 的低信噪比、跨被试差异、通道布局变化及小数据训练都可能使该排序不稳定,或削弱模型收益。一个可检验的小实验是在固定数据划分与训练预算下,对比空间排序、随机排序及注意力基线,分别记录任务指标、显存和 FLOPs,检验空间组织是否确有贡献。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以空间填充曲线组织点云 token、结合非层级 Mamba 编码器实现线性复杂度全局建模的设计,但具体性能与资源优势需核对全文,EEG 迁移价值尚未验证。

9月18日周三
  1. OpenReview · State space models78

    状态空间模型的参数高效微调

    基于摘要分析。本文研究 Mamba 等深度状态空间模型(SSMs)的参数高效微调(PEFT),重点比较现有方法的适用性及微调模块的选择,并提出 LoRA with Selective Dimension tuning(SDLoRA),将线性投影矩阵上的 LoRA 与 SSM 模块中部分通道和状态的选择性更新结合。 作者报告,在 SSM 模型上对四种基本 PEFT 方法进行经验评估后,prompt-based 方法(如 prefix-tuning)效果不佳,理论分析也支持这一观察;相比之下,LoRA 仍然有效。针对 LoRA 的应用位置,作者报告,理论与实验均支持仅将 LoRA 应用于线性投影矩阵、而不修改 SSM 模块的配置效果最好,直接以 LoRA 微调 SSM 模块则效果不佳。SDLoRA 并非在 SSM 模块中简单增加 LoRA,而是对其中部分通道和状态进行选择性更新,同时保留投影矩阵上的 LoRA。作者报告,该组合优于标准 LoRA,但摘要未提供具体任务、数据集、指标或增益幅度。 需核对的关键细节包括:四种 PEFT 方法的完整设置、通道与状态的选择规则、可训练参数预算及其匹配方式,以及理论结论的适用条件。实验协议、消融及统计信息尚未验证,不能据此判断其在不同模型规模或任务上的普适性。 平台推测(待验证):若已有预训练 EEG SSM 编码器,该机制可能用于缓解跨被试适配中训练样本有限、全量微调成本较高的问题。可复用的是投影矩阵 LoRA 和 SSM 维度选择性更新的思路;需改造的是 EEG 输入映射、任务输出头及维度选择策略。其原始论证背景为语言建模中的 SSM,摘要未说明依赖的预训练规模或下游监督条件;低信噪比、通道配置变化和个体差异可能使所选维度不稳定。一个可证伪的小实验是在固定预训练编码器和 Cross-subject 划分下,以匹配的可训练参数预算比较投影矩阵 LoRA 与 SDLoRA,并检查多次运行的稳定性。已有 EEG 相关工作尚未检索确认。

    阅读价值:该研究通过经验比较与理论分析区分 SSM 模块和线性投影矩阵的微调适用性,为复现 Mamba 类模型的 PEFT 提供了具体切入点,但实验协议与性能增益尚待全文核对。

7月10日周三
  1. OpenReview · State space models78

    MambaByte:无分词的选择性状态空间模型

    基于摘要分析。MambaByte 研究直接从原始字节学习的 token-free 语言建模:去除子词分词的归纳偏置,却也使序列显著变长。其核心贡献是将 Mamba 状态空间模型(SSM)适配为在字节序列上自回归训练的语言模型,并设计结合 tokenized drafting 与 byte-level verification 的推测解码方案。 机制上,摘要将标准自回归 Transformer 随序列长度增长的有效内存需求,与 Mamba 的固定大小记忆状态和高效解码进行对比。MambaByte 利用后者应对字节级长序列;解码阶段由分词模型生成草稿,再进行字节级验证。具体状态更新、训练损失、草稿模型配置与验证规则尚未验证。 作者报告,在语言建模任务上,MambaByte 可与先进的子词 Transformer 竞争,部分比较中甚至表现更好,同时保留 token-free 模型对噪声的鲁棒性。作者报告,相对于标准 MambaByte 实现,其推测解码方案实现 2.6× 推理加速,解码效率接近子词 Mamba。摘要未提供数据集、模型规模、性能指标、硬件、批量大小及序列长度,因此这些效果与速度结论的适用范围,以及实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,固定大小状态的序列处理机制可能缓解长时程 EEG 建模的计算与内存压力,但原任务依赖离散字节及自回归监督,并不等价于连续、多通道 EEG。可考察复用 SSM 序列模块,输入表示、通道融合与任务输出需改造;字节级验证方案不能直接照搬。低信噪比、跨被试差异、通道变化与小数据训练可能削弱收益。一个可证伪的小实验是在同一 EEG 数据划分与匹配训练预算下,对比 SSM 与 Transformer 随输入时长变化的任务性能、峰值内存及推理耗时;仅降低资源消耗不能证明解码效果改善。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其以固定大小状态处理长字节序列、并结合 tokenized drafting 与 byte-level verification 加速解码的机制,但语言建模效果与效率结论仍需核对全文实验协议。

6月21日周五
  1. OpenReview · Representation learning72

    迈向高效的大规模语言-3D 表征学习

    基于摘要分析。该研究探索如何高效学习大规模 3D 对象与语言之间的跨模态表征,提出 MaskCL3D,结合 3D 点云、语言描述和多视角图像上的对比学习与掩码重建,并构建覆盖多类对象及描述的语言-3D 数据集。 机制上,对比学习用于跨模态表征学习,掩码重建提供补充学习信号;但摘要未说明具体对齐对象、掩码施加位置、重建目标、损失组合及推理流程,不能据此确定效率提升来自何种设计。其贡献同时涉及训练方法和数据资源,阅读全文时需核对两者的独立作用,以及训练与测试效率的衡量方式。 作者报告,在其评估的零样本分类和检索任务中,使用新数据集训练的模型优于使用其他数据集训练的模型,MaskCL3D 与新数据集的组合相较现有基线达到最先进性能;作者还报告,表征分析显示语言和 3D 表征包含丰富语义信息。摘要未提供数据集名称、规模、划分、基线、具体指标或数值,因此这些结论目前只能保留为作者的定性报告,实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 与文本描述或刺激图像存在可靠配对,可假设跨模态对比学习与掩码重建的组合有助于学习语义相关表征,但 3D 对象上的结果不等于 EEG/BCI 效果。可复用的是学习目标的组合思路,需改造点云编码与重建模块以适应 EEG 时序和通道结构;低信噪比、跨被试差异及小规模配对数据可能导致模型学习刺激或被试特征,而非目标语义。一个可检验的小实验是在固定跨被试划分和相同数据预算下,比较仅对比学习与加入 EEG 掩码重建的模型,检查跨模态检索表现是否稳定改善。相关 EEG 工作尚未检索确认;代码、数据可用性及完整复现条件也尚未验证。

    阅读价值:值得核对 MaskCL3D 如何联合对比学习与掩码重建,以及方法改进和新数据集分别对零样本分类、检索及计算效率的贡献;摘要尚不足以分离这些因素。

5月18日周六
  1. OpenReview · State space models73

    STG-Mamba:通过选择性状态空间模型进行时空图学习

    基于摘要分析。本文面向动态、异质且非平稳的时空图(STG)预测问题,提出 STG-Mamba,将图网络视为随时间演化的系统,以选择性状态空间模型学习潜在时空特征,并结合 Kalman Filtering Graph Neural Networks(KFGN)融合不同时间粒度的图嵌入。 核心机制:作者认为,既有部分 GNN 方法侧重节点间关系,对系统内在特征随时间演化的建模不足。STG-Mamba 使用 Spatial-Temporal Selective State Space Module(ST-S3M)关注选定的 STG 潜在特征;KFGN 则采用基于 Kalman Filtering 统计理论的可学习方法,动态整合并更新多时间粒度嵌入。摘要未披露具体状态更新方程、图构建方式、损失函数及训练设置,不能据此确定其实现细节。作者将该工作称为利用选择性状态空间模型开展 STG 学习的首次探索,该优先性尚未独立核实。 结果与复现:作者报告,在三个 STG 预测基准数据集上,STG-Mamba 的预测表现优于所比较的现有方法,并降低 FLOPs 与测试推理时间。摘要未提供数据集名称、划分协议、指标数值、对照配置或计时条件,性能与效率优势的幅度及适用范围尚未验证;实验协议、消融及统计信息尚未验证。材料提供了实现代码地址,但代码内容与可复现性未核验。 平台推测(待验证):若将 EEG 通道作为节点、时间窗作为动态图序列,系统状态演化与多时间粒度融合可能对应 EEG 非平稳性及不同时间尺度信息整合的瓶颈。这一假设依赖可靠的图结构和足够的时序训练数据,不能由原领域结果直接推出 BCI 有效性。可考察复用 ST-S3M 与 KFGN,但需改造通道图、输入特征和任务输出;低信噪比、跨被试差异、通道配置变化及小样本可能削弱状态估计和嵌入融合。一个可检验的小实验是在固定 EEG 数据划分与相同输入条件下,比较基础图时序模型、加入 ST-S3M、再加入 KFGN 的任务指标及推理耗时。已有 EEG 相关工作尚未检索确认。

    阅读价值:STG-Mamba 将选择性状态空间建模与基于 Kalman Filtering 的多时间粒度图嵌入融合结合,值得核对其时空预测性能与计算效率的实验依据,但其对 EEG/BCI 的适用性尚未验证。

5月2日周四
  1. OpenReview · State space models80

    Vision Mamba:基于双向状态空间模型的高效视觉表征学习

    基于摘要分析。本文研究如何在不依赖自注意力的情况下构建高效、通用的视觉骨干,提出采用双向 Mamba 模块的 Vim,以位置嵌入标记图像序列,并通过双向状态空间模型压缩视觉表征。主要研究对象是图像分类、目标检测和语义分割,而非 EEG 或 BCI。 机制上,作者针对视觉数据的位置敏感性及全局上下文需求,将位置嵌入与双向序列建模结合,探索纯 SSM 视觉骨干作为视觉 Transformer 的替代方案。摘要未给出图像序列构造方式、双向信息融合细节、损失函数和训练配置,这些实现条件尚未验证。 作者报告,在 ImageNet 分类、COCO 目标检测及 ADE20k 语义分割任务上,Vim 相比 DeiT 等视觉 Transformer 获得更高性能,但摘要未提供各任务的具体指标和对照配置。作者另报告,在分辨率为 1248×1248 的图像上进行批量推理并提取特征时,Vim 相比 DeiT 快 2.8 倍,GPU 显存使用节省 86.8%;该结果属于特定高分辨率特征提取场景,批大小、硬件及模型规格尚未验证,不能直接推广到所有训练或推理条件。实验协议、消融及统计信息尚未验证。 平台推测(待验证):双向 SSM 对长序列的建模机制可能用于离线 EEG 长时间窗表征,以探索全局时序上下文与计算成本之间的权衡,但这是迁移假设。可复用部分是双向序列建模思路;图像序列输入及位置嵌入需改造为适配时间采样和通道布局的表示,监督方式与所需训练规模仍需评估。低信噪比、跨被试分布差异、通道变化和小数据训练可能使视觉领域优势无法成立;双向上下文也不能未经改造用于严格因果的在线 BCI。可检验的小实验是在固定 EEG 数据划分和训练预算下,对比双向 SSM 与自注意力骨干,分别记录 Cross-subject 分类指标、推理延迟和峰值显存,并核对位置编码及双向建模的作用。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其位置编码与双向状态空间建模如何兼顾视觉全局上下文和高分辨率推理效率,但摘要中的优势限于视觉任务,不能直接视为 EEG/BCI 有效性的证据。

4月22日周一
  1. OpenReview · State space models71

    Audio Mamba:用于音频表征学习的双向状态空间模型

    基于摘要分析。本文研究音频分类是否必须依赖自注意力,提出 Audio Mamba(AuM),探索以纯状态空间模型(SSM)进行音频表征学习与分类,以避开 Audio Spectrogram Transformers(ASTs)中自注意力的二次复杂度开销。 核心方法是用 SSM 而非自注意力构建音频分类模型;标题明确其采用双向状态空间模型,但摘要未说明双向信息如何融合、音频输入如何表示,以及训练目标与推理实现。作者将 AuM 描述为首个不含自注意力、完全基于 SSM 的音频分类模型,此优先性主张尚未独立核实。避免二次自注意力开销是研究动机,不能据此直接认定实际运行速度或显存占用优于 AST。 作者报告,在涵盖六个不同基准的音频数据集评估中,AuM 相较成熟 AST 模型取得相当或更好的表现。摘要未给出基准名称、指标、具体分数、数据划分或对照配置,因而不能量化优势;实验协议、消融及统计信息尚未验证。复现还需核对模型配置、预训练条件、计算预算及代码可用性。 平台推测(待验证):若 SSM 能在较低计算成本下保留长序列中的分类信息,其机制可能对应 EEG 长时序建模的计算瓶颈,但音频结果不等于 BCI 有效性。可考虑复用 SSM 序列编码器,需针对 EEG 改造输入分块、通道表示与分类输出;原研究所依赖的数据规模和监督设置尚未明确。低信噪比、跨被试分布差异、通道配置变化及小数据训练均可能使迁移失效。一个可检验的小实验是在固定 EEG 数据划分与相同训练预算下,对比 SSM 与自注意力编码器的分类表现、运行时间及显存占用,分别报告被试内与跨被试结果。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以纯 SSM 替代音频分类自注意力的机制与对照实验,但摘要仅支持作者报告的性能概述,计算效率及向 EEG 迁移的有效性尚未验证。

1月1日周一
  1. OpenReview · State space models75

    Coupled Mamba:通过耦合状态空间模型增强多模态融合

    基于摘要分析。该研究针对多模态融合中复杂的模态内与模态间关联,提出 Coupled SSM,并构建 Coupled Mamba,在保留模态内状态演化过程独立性的同时耦合不同模态的状态链,试图兼顾跨模态交互建模与硬件感知并行计算。 核心机制是跨模态隐状态转移:当前状态依赖本模态状态链及相邻状态链在前一时间步的状态。为适配硬件感知并行设计,作者通过引入历史状态、推导状态方程得到全局卷积核。其可核对的机制特点是将模态交互引入状态演化过程;具体耦合拓扑、参数化方式、训练目标及并行实现细节尚未验证。 作者报告,在 CMU-MOSEI、CH-SIMS、CH-SIMSV2 的多域输入实验中,相较摘要所称的当前先进方法,三个数据集的 F1-Score 分别提高 0.4%、0.9% 和 2.3%;摘要未明确这些百分比表示相对增幅还是百分点差值,因此不能转换解读。作者还报告推理速度提升 49%、GPU 显存节省 83.7%,但对应基线、硬件、输入规模及测量条件尚未验证。数据划分、实验协议、消融及统计信息均需结合全文核对。 平台推测(待验证):该机制可能适用于具有时间对应关系的 EEG 与其他模态序列融合,但原任务结果不等于 BCI 有效。可复用的是跨模态状态耦合思路;需改造输入编码、采样率对齐和缺失模态处理。EEG 低信噪比、跨被试差异及小数据条件可能使耦合传播噪声或增加过拟合风险。一个可检验的小实验是在同一同步多模态数据集与相同跨被试划分下,对比独立状态链、简单后期融合与耦合状态链,并检验单模态受噪声污染时的性能变化。相关 EEG 工作尚未检索确认。

    阅读价值:值得核对其跨模态状态耦合与硬件并行实现:摘要给出了具体的状态交互机制及效果、效率结果,但比较基线与评估协议仍需全文验证。

  2. OpenReview · State space models70

    PointMamba:用于点云分析的简单状态空间模型

    基于摘要分析。该研究面向点云分析中全局建模能力与计算成本的权衡,提出 PointMamba,将源于 NLP 的 Mamba 状态空间模型(SSM)用于点云任务。其核心贡献是采用空间填充曲线进行点标记化,并以简单、非层级的 Mamba 编码器作为骨干,探索替代具有二次复杂度注意力机制的线性复杂度方案。 机制上,空间填充曲线为三维点云构造可供序列模型处理的 token 顺序,Mamba 编码器承担全局建模。摘要未提供具体曲线类型、token 构造细节、监督方式、损失函数或训练规模,这些内容尚未验证。该方法的主要研究对象是三维点云,而不是 EEG 或 BCI。 作者报告,在多个数据集上的评估中,PointMamba 获得更优表现,同时显著降低 GPU 显存使用量和 FLOPs;但摘要未列出数据集名称、任务、划分、对照基线及具体数值,因此无法量化收益或判断不同协议下的可比性。实验协议、消融及统计信息尚未验证。材料提供了代码仓库,复现前仍需核对配置、依赖、数据处理及资源测量条件。 平台推测(待验证):若将 EEG 通道视为带空间坐标的采样点,空间排序与 Mamba 序列建模可能为多通道建模提供一种假设,但点云的空间结构并不等同于 EEG 的时空结构。可复用的是空间排序思路和编码器,需改造输入标记化及时间维处理;低信噪比、跨被试差异、通道布局变化和小样本训练均可能削弱收益。一个可检验的小实验是在固定跨被试划分和相同预处理下,对比空间填充曲线排序与固定通道排序的 Mamba 模型,同时记录任务指标、显存与 FLOPs,以检验空间排序是否带来稳定增益。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的具体原因是 PointMamba 将空间填充曲线点标记化与非层级 Mamba 编码器结合,为点云全局建模提供线性复杂度基线;其性能和资源收益仍需结合全文实验协议核对,EEG 适用性尚未验证。

  3. OpenReview · EEG77

    利用 EEGformer 降低可穿戴癫痫发作检测的误报:面向 MCU 的紧凑 Transformer 模型

    基于摘要分析。研究针对可穿戴设备长期连续监测 EEG 时的癫痫发作自动检测问题,提出紧凑 Transformer 模型 EEGformer,仅使用颞区通道,并通过面向硬件的设计探索兼顾检测延迟、误报率及低功耗 MCU 部署需求。 技术机制:摘要将 Transformer 用于无需手工特征提取的端到端时间序列处理,核心贡献在于将少通道采集条件与端侧计算约束纳入模型设计。具体网络结构、输入窗口、损失函数、训练策略及硬件优化方法尚未验证,不能据摘要判断性能收益分别来自模型设计、预处理还是检测后处理。 检测结果:作者报告,在 CHB-MIT 数据集上,相较于面向颞区采集的现有最先进模型,发作起始检测延迟降低 20%,同时达到 73% 的癫痫发作检测概率和每小时 0.15 次误报(FP/h)。摘要未给出对照模型名称、绝对延迟、被试内或跨被试协议及数据划分,因此这些结果应限定于作者所用评估条件。作者另报告,在一个新的、具有挑战性的头皮 EEG 数据集上,检测到 88% 的标注发作事件,误报率为 0.45 FP/h;该数据集名称、被试规模和评估划分尚未验证,两组结果不能直接比较。 部署结果:作者在单核 Apollo4 MCU 以及并行 GAP8、GAP9 MCU 上评估部署,报告最节能的 GAP9 实现每次推理耗时 13.7 ms、能耗 0.31 mJ。作者据此认为模型可支持少通道、具有多日续航的可穿戴检测系统;但单次推理指标不等于整机续航实测,推理频率、采集与通信功耗及电池条件仍需核对。 复现重点是确认颞区通道配置、连续记录的训练与测试划分、发作事件匹配规则、误报统计时长,以及检测阈值对检出概率、误报率和延迟的影响。实验协议、消融及统计信息尚未验证,代码与部署资源的可用性也尚未确认。该研究属于 EEG 临床监测算法与端侧部署研究,摘要中的检测结果不应直接视为临床有效性验证。

    阅读价值:值得阅读的具体原因是,作者将颞区少通道 EEG 癫痫发作检测的误报率、检测延迟与 MCU 推理能耗联合评估,为可穿戴端侧模型的设计提供了可核对的参考,但数据划分和检测协议仍需全文验证。

  4. OpenReview · State space models71

    SSD4Rec:用于高效序列推荐的结构化状态空间对偶模型

    基于摘要分析。研究面向序列推荐中用户行为序列较长、长度不一时的偏好建模与计算效率问题,提出受 Mamba 启发的推荐骨干 SSD4Rec。其主要贡献是通过序列寄存器标记物品序列,并使用双向 Structured State Space Duality(SSD)块处理物品表示,以兼顾长程建模与硬件友好的计算。 核心机制:原任务依赖用户历史交互形成的离散物品序列,而非神经信号。摘要将序列寄存器与变长、长序列处理联系起来,将双向 SSD 块与硬件感知的矩阵乘法联系起来;寄存器的具体组织方式、双向信息融合、推荐目标与损失、训练和推理流程尚未验证。双向处理与推荐任务的信息可用范围如何匹配,也需结合全文协议核对。 结果与复现:作者报告,在四个基准数据集上的评估达到其所称的 state-of-the-art 性能,并随用户序列长度保持近线性扩展性。摘要未提供数据集名称、划分方式、对照基线、指标数值或扩展性测量条件,因此不能量化收益或直接比较不同协议。作者提供了公开代码链接,但实现与论文的一致性、实验协议、消融及统计信息尚未验证。 平台推测(待验证):可检验的迁移假设是,变长序列处理与 SSD 长程建模机制可能用于长时 EEG 的窗口表示序列,但推荐领域的结果不构成 BCI 有效性证据。可考虑复用 SSD 序列骨干,需改造连续信号编码、通道处理和任务输出;原方法对监督方式与训练规模的依赖尚不明确。低信噪比、跨被试差异、通道变化及小数据条件可能削弱其优势,双向处理也不能直接用于严格因果在线解码。一个小规模可证伪实验是在固定 EEG 数据划分与同一输入编码下,对比 SSD 骨干与 Transformer 的任务指标、运行时间和显存随序列长度的变化,分别限定离线与因果使用条件。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 SSD4Rec 如何利用序列寄存器与双向 SSD 块处理变长、长序列,以及推荐性能与近线性扩展性的评估协议;其 EEG/BCI 迁移价值尚未验证。

  5. OpenReview · State space models72

    Audio Mamba:用于音频表征学习的双向状态空间模型

    基于摘要分析。本文研究音频分类是否必须依赖自注意力,提出 Audio Mamba(AuM),以纯状态空间模型(SSM)进行音频表征学习与分类,探索替代 Audio Spectrogram Transformers(ASTs)的技术路线。作者报告,在六个音频基准上,AuM 的表现与成熟 AST 模型相当或更好;摘要未提供基准名称、评估指标、数据划分或具体分数。 核心动机是 AST 的自注意力具有二次扩展成本,而 Mamba 等 SSM 提供了避开该成本的候选机制。标题明确采用双向状态空间模型,摘要将 AuM 描述为不含自注意力、完全基于 SSM 的模型,并声称其为首个此类音频分类模型;这一优先性尚未独立核验。输入表示、双向信息融合方式、网络结构、损失与训练流程,以及实际计算量、显存和推理速度尚未验证。实验协议、消融及统计信息也尚未验证,不能仅凭移除自注意力认定其端到端效率更高。 平台推测(待验证):其跨领域价值在于检验 SSM 能否替代长序列分类中的自注意力,而不是已证实的 EEG 或 BCI 效果。原研究依赖音频分类数据,但摘要未说明表征方式、监督配置及训练规模。若迁移至 EEG,可考虑复用 SSM 序列编码机制,改造输入切分、通道编码与分类输出;低信噪比、跨被试差异、通道布局变化和小样本训练均可能使音频领域结果失效。双向建模还需核对对完整输入窗口的依赖,不能直接视为适用于因果在线解码。 一个可检验的假设是:在固定 EEG 数据划分、预处理和训练预算下,SSM 编码器能以较低资源成本达到与自注意力编码器相当的分类表现。可先在单一 EEG 分类任务上进行匹配对照,分别报告分类指标、显存及延迟,再评估跨被试表现;具体复现仍依赖全文与实现信息。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的具体原因是其以纯 SSM 音频分类模型检验对自注意力的依赖,并提供六个基准上的 AST 对照;性能与计算成本的具体证据仍需全文核对。

  6. OpenReview · State space models72

    PointMamba:用于点云分析的简单状态空间模型

    基于摘要分析。本文研究点云分析中全局建模与计算成本之间的权衡,提出 PointMamba,将源于 NLP 的 Mamba 状态空间模型(SSM)用于点云分析,以线性复杂度算法替代具有二次复杂度的注意力机制。 核心机制是利用空间填充曲线进行点 token 化,再以简单、非层级的 Mamba 编码器作为骨干。方法的关键路径是将三维空间中的点组织成可供序列模型处理的 token 序列,并利用 SSM 进行全局建模;摘要未说明具体空间填充曲线、点特征构造、训练目标或推理设置。 作者报告,在多个数据集上的评估中,PointMamba 获得更优性能,同时显著降低 GPU 显存使用量与 FLOPs。但摘要没有给出数据集名称、具体任务、划分协议、对照模型或数值,因此无法判断优势的适用范围及不同设置下的可比性。实验协议、消融及统计信息尚未验证。摘要表示代码将公开,当前发布状态及复现所需配置尚未验证。 平台推测(待验证):可迁移的假设是,线性复杂度的 Mamba 编码器可能缓解长时段 EEG 建模的计算开销;但点云的空间序列化并不直接等同于 EEG 的时间与通道组织。编码器思路可供参考,token 化则需改造成保留时间顺序及电极空间关系的表示,原研究所依赖的监督方式和训练规模尚不明确。低信噪比、跨被试分布差异、通道布局变化及小数据条件均可能使该假设失效。一个可检验的小实验是在固定 EEG 数据划分、训练预算与输入长度条件下,对比 Mamba 与 Transformer 编码器,分别考察任务性能、显存和计算量,并检验通道排序变化的影响。相关 EEG 工作尚未检索确认,这不构成已证实的 BCI 效果。

    阅读价值:值得核对其空间填充曲线序列化与非层级 Mamba 编码器如何兼顾全局建模和计算开销,但摘要中的性能与资源优势及其对 EEG 的适用性尚待验证。

  7. OpenReview · State space models72

    Event USKT:用于事件相机知识迁移的 U 形状态空间模型

    基于摘要分析。该研究针对事件相机数据有限、难以充分利用已有 RGB 预训练模型的问题,提出 U 形状态空间模型知识迁移框架 USKT。其核心贡献是生成与 RGB 帧兼容的输入,使事件数据能够复用 RGB 预训练模型,并引入采用共享权重策略的 Bidirectional Reverse State Space Model(BiR-SSM)。 机制上,摘要将 USKT 描述为 Event-to-RGB 知识迁移框架:通过输入兼容化连接事件数据与 RGB 模型,而非仅依赖事件数据训练新模型。BiR-SSM 与常规双向扫描机制的区别在于共享权重;作者认为该设计有助于高效建模并节省计算资源。具体事件表示、U 形结构、反向扫描方式、损失函数、冻结或调优的参数范围及推理成本尚未验证。 结果方面,作者报告,使用 ResNet50 作为骨干时,在 DVS128 Gesture、N-Caltech101 和 CIFAR-10-DVS 上的模型性能分别提升 0.95%、3.57% 和 2.9%。摘要未明确这些提升对应的指标、比较基线、数据划分,以及百分比是否表示相对增幅,因此不能将其改写为 Accuracy 的百分点提升,也不能跨数据集直接比较。实验协议、消融及统计信息尚未验证。材料称代码将在论文被接收后公开,当前代码可用性及接收状态均尚未验证。 平台推测(待验证):可迁移假设是,输入兼容化与共享权重双向建模可能帮助数据有限的 EEG 任务复用预训练表示。但事件视觉数据与 EEG 的通道语义、时间结构和噪声特征不同,RGB 输入兼容不等于保留 EEG 判别信息。可考察状态空间建模及参数共享模块,输入映射则需针对 EEG 改造;低信噪比、跨被试差异、通道布局变化与小样本训练可能使映射丢失有效信息或过拟合。一个可证伪的小实验是在固定跨被试划分、相同预训练骨干和调优预算下,对比简单 EEG 输入映射与 USKT 式映射,并以取消双向权重共享作为对照,检查性能与计算成本是否同时改善。相关 EEG 工作尚未检索确认。

    阅读价值:值得核对 USKT 如何将事件数据转换为 RGB 预训练模型可用的输入,以及 BiR-SSM 的共享权重机制能否在减少参数调优与计算开销的同时保留任务信息;其 EEG 迁移价值尚未验证。

  8. OpenReview · State space models73

    Mamba-ST:用于高效风格迁移的状态空间模型

    基于摘要分析。该研究面向图像风格迁移:给定内容图像与风格来源,生成保留内容、呈现目标艺术风格的图像。作者提出 Mamba-ST,通过修改 Mamba 的状态空间模型(SSM)内部方程,使其接收并融合两路独立数据流,以替代风格迁移中的 cross-attention 功能。 核心机制是将两个独立嵌入组合为单一输出,而不依赖额外的 cross-attention 或定制归一化层。研究针对的是 Transformer 注意力层的内存开销,以及扩散模型较高的推理时间。作者称这是其所知首次通过改写 SSM 方程、在不使用上述额外模块的情况下完成这类视觉风格迁移任务;这一优先性主张尚未独立核实。摘要未给出具体方程、两路输入的组织方式、训练目标或推理流程。 作者报告,在与 Transformer 和扩散模型的风格迁移比较中,Mamba-ST 在 ArtFID 和 FID 指标上表现更好,并具有内存与时间复杂度优势。摘要未提供分数、数据集、划分、对照模型或硬件条件,因此不能量化改善幅度,也不能判断效率优势在何种分辨率和输入长度下成立。实验协议、消融及统计信息尚未验证。摘要提供了代码仓库,但实现完整性与复现条件尚未核对。 平台推测(待验证):可供 EEG/BCI 研究考察的是双数据流条件融合机制,而非图像风格迁移效果本身。假设 EEG 时序表示需要与任务或被试条件表示交互,该机制可能成为 cross-attention 的替代候选;但需改造输入编码、时间对齐与训练目标,且原方法对配对数据、监督和训练规模的具体依赖尚未验证。低信噪比、通道差异及小数据可能使融合机制难以学到稳定关系。一个可检验的小实验是在固定跨被试划分、编码器与训练预算下,仅替换双流融合模块,对比 cross-attention 与改造后的 Mamba-ST,核对分类 Accuracy、显存和推理延迟。该假设不构成已验证的 EEG/BCI 效果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 Mamba-ST 如何通过修改 SSM 内部方程实现双数据流融合,以及其相对 cross-attention 的质量与资源开销权衡;摘要报告了效果优势,但具体评估协议与效率数据尚未验证。