跳到正文

算法、任务与模态

Efficient AI 最新动态

Efficient AI 研究索引;按可核对的标签归档,不以热度评价质量。

227 条精选近 30 天 124 条共收录 262 条

更新

精选归档 · 第 11 页

1月1日周一第 201–220 条
  1. OpenReview · Representation learning75

    面向表征学习的鲁棒性重编程

    基于摘要分析。本文研究能否在不改变已训练深度学习模型参数的条件下,通过模型重编程增强其对对抗性或噪声输入扰动的鲁棒性。核心贡献是重新审视表征学习中的特征变换机制,提出非线性稳健模式匹配技术作为替代,并引入三种模型重编程范式,以适应不同效率要求下的鲁棒性控制需求。 机制与证据:论文以稳健统计为设计视角,将重编程作为改善模型鲁棒性的路径,而非直接修改原模型参数。摘要未披露模式匹配的数学定义、三种范式的具体结构、优化目标或额外训练需求,因此不能据此认定该方法无需训练或无需标签。作者报告,在基础线性模型、MLP、浅层及现代深层 ConvNets 上的实验与消融支持方法有效性;但摘要未提供数据集、扰动类型与强度、对照方法、评价指标及数值,实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设该模式匹配机制能够迁移到 EEG 特征变换,它可能用于检验冻结解码器在输入噪声下的稳健性,而不是直接解决跨被试域偏移。可考虑复用重编程思路,但输入表示、时序与通道处理需按 EEG 数据结构改造;方法对监督信息、数据规模及扰动分布的依赖仍需核对。低信噪比条件下,稳健处理可能同时抑制任务相关弱信号,被试差异、通道变化及小数据也可能使重编程效果失稳。一个可证伪的小实验是:在固定被试内训练与测试划分下冻结同一 EEG 解码器,比较原模型与重编程模型在干净输入及预先定义噪声条件下的 Accuracy 和推理成本,检查鲁棒性增益是否以干净性能下降为代价。该方案仅是迁移假设,已有 EEG 相关工作尚未检索确认。复现原论文仍需全文中的算法、训练和评估细节。

    阅读价值:值得核对其非线性稳健模式匹配如何在不改变模型参数的条件下提升输入扰动鲁棒性,以及三种重编程范式的效率权衡;其对 EEG 的适用性尚未验证。

  2. OpenReview · State space models72

    Audio Mamba:用于音频表征学习的双向状态空间模型

    基于摘要分析。本文研究音频分类是否必须依赖自注意力,提出 Audio Mamba(AuM),以纯状态空间模型(SSM)进行音频表征学习与分类,探索替代 Audio Spectrogram Transformers(ASTs)的技术路线。作者报告,在六个音频基准上,AuM 的表现与成熟 AST 模型相当或更好;摘要未提供基准名称、评估指标、数据划分或具体分数。 核心动机是 AST 的自注意力具有二次扩展成本,而 Mamba 等 SSM 提供了避开该成本的候选机制。标题明确采用双向状态空间模型,摘要将 AuM 描述为不含自注意力、完全基于 SSM 的模型,并声称其为首个此类音频分类模型;这一优先性尚未独立核验。输入表示、双向信息融合方式、网络结构、损失与训练流程,以及实际计算量、显存和推理速度尚未验证。实验协议、消融及统计信息也尚未验证,不能仅凭移除自注意力认定其端到端效率更高。 平台推测(待验证):其跨领域价值在于检验 SSM 能否替代长序列分类中的自注意力,而不是已证实的 EEG 或 BCI 效果。原研究依赖音频分类数据,但摘要未说明表征方式、监督配置及训练规模。若迁移至 EEG,可考虑复用 SSM 序列编码机制,改造输入切分、通道编码与分类输出;低信噪比、跨被试差异、通道布局变化和小样本训练均可能使音频领域结果失效。双向建模还需核对对完整输入窗口的依赖,不能直接视为适用于因果在线解码。 一个可检验的假设是:在固定 EEG 数据划分、预处理和训练预算下,SSM 编码器能以较低资源成本达到与自注意力编码器相当的分类表现。可先在单一 EEG 分类任务上进行匹配对照,分别报告分类指标、显存及延迟,再评估跨被试表现;具体复现仍依赖全文与实现信息。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的具体原因是其以纯 SSM 音频分类模型检验对自注意力的依赖,并提供六个基准上的 AST 对照;性能与计算成本的具体证据仍需全文核对。

  3. OpenReview · State space models72

    CollaMamba:基于跨智能体时空状态空间模型的高效协同感知

    基于摘要分析。CollaMamba 面向多智能体协同感知,研究如何在计算与通信资源受限时,通过共享互补感知信息建模长距离空间关系与长时间历史依赖。其核心贡献是结合空间状态空间模型(SSM)骨干与时间 SSM 历史特征增强模块,而非针对 EEG 或 BCI 提出算法。 机制上,空间 SSM 骨干从单智能体与跨智能体视角捕获位置因果依赖,生成紧凑的中间特征;作者称其保持线性复杂度。时间 SSM 模块从较长历史帧中提取上下文线索,用于改善模糊特征并控制额外开销。摘要未说明扫描顺序、跨智能体对齐方式、融合操作、损失函数或训练监督,相关实现尚未验证。 作者报告,在多个未具名数据集上,CollaMamba 的模型精度优于所比较的现有方法,并降低计算与通信开销;摘要分别给出最高 71.9% 与“1/64”的表述。具体任务、数据划分、精度指标、对照基线、资源测量方式,以及“1/64”表示降至原来的比例还是减少比例,均尚未验证,不能据此作统一性能比较。实验协议、消融及统计信息尚未验证。摘要表示源码将公开,不等于已有可用代码。 平台推测(待验证):其长历史建模与紧凑特征机制可能对应 EEG 长时序处理及多节点信号传输的资源瓶颈。原方法依赖具有空间位置关系的多智能体观测和连续历史帧,具体监督与数据规模尚不明确;迁移时可考察时间 SSM 和特征压缩,但空间模块需适配电极拓扑、通道缺失及被试差异,不能将跨智能体融合等同于跨被试学习。低信噪比、小数据和通道配置变化可能使历史增强放大噪声或削弱有效信号。一个可检验的小实验是在固定 EEG 任务、相同被试内划分和训练预算下,仅替换时间建模模块,比较任务指标、推理开销及历史长度敏感性。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其空间与时间 SSM 如何同时支持跨智能体特征融合和资源压缩,但摘要中的精度与开销优势尚需结合具体任务、基线及测量协议验证,不能直接视为 EEG/BCI 效果。

  4. OpenReview · Representation learning73

    联邦模型异质的 Matryoshka 表征学习

    基于摘要分析。本文研究模型异质联邦学习(MHeteroFL)中,不同结构的客户端模型如何交换知识,提出面向监督学习任务的 FedMRL。其核心贡献是在异质本地模型之外引入客户端共享的小型同构辅助模型,通过个性化表征融合和 Matryoshka 嵌套表征学习增强协同训练。 机制上,两类模型的特征提取器分别产生泛化表征与个性化表征,再由个性化轻量表征投影器融合,以适应本地数据分布。融合表征用于构造多维度、多粒度的 Matryoshka 表征,由全局同构模型与本地异质模型的预测头共同学习。作者将其与主要依赖训练损失传递知识的既有 MHeteroFL 方法区分;具体嵌套方式、损失形式、参数聚合及训练流程需由全文核对。 作者报告,理论分析给出 O(1/T) 的非凸收敛速率,但摘要未定义 T,也未说明成立条件。作者报告,在基准数据集上与七种基线比较时,FedMRL 具有较高准确率及较低通信、计算成本;相对最先进基线与同类别最佳基线,准确率提升最高分别为 8.48% 和 24.94%。摘要未提供数据集、划分、模型配置、绝对准确率及提升计算口径,不能将上述百分比直接解释为百分点,也不能据此比较不同协议。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 联邦分类场景具有带标签的本地数据、可兼容的特征接口及不同客户端模型结构,该机制可能用于缓解模型异质性与个性化需求之间的冲突。可复用共享辅助模型和表征融合思路,需改造 EEG 编码器、通道接口及表征维度;低信噪比、跨被试分布差异、通道不一致和小样本可能使共享表征或投影器失效。一个可检验的小实验是在固定 EEG 划分、异质客户端配置及通信预算下,对照完整方法与去除表征融合或 Matryoshka 构造的版本,评估 Accuracy、通信量及客户端间性能差异。已有 EEG 相关工作尚未检索确认,原领域结果不构成 BCI 有效性的证据。

    阅读价值:FedMRL 通过共享小模型与个性化表征融合处理联邦客户端模型结构异质性,值得核对其嵌套表征构造及通信成本对照,但摘要中的准确率提升口径与实验协议尚未验证。

  5. OpenReview · State space models72

    基于状态空间模型的图像恢复多尺度表征学习

    基于摘要分析。该研究针对图像退化造成的多尺度细节丢失与对比度下降,提出用于图像恢复的 MS-Mamba,将全局与区域状态空间模型(SSM)和梯度、频域细节模块结合,以兼顾多尺度表征能力与计算效率;主要研究对象是图像恢复,而非 EEG 或 BCI。 机制方面,作者以 Transformer 计算复杂度较高、CNN 感受野受限为出发点,提出全局与区域 SSM 模块增强多尺度表征学习,并通过 Adaptive Gradient Block(AGB)捕获不同方向的梯度,通过 Residual Fourier Block(RFB)促进频域细节学习。摘要未说明 SSM 的具体实现、图像序列化方式、模块连接、损失函数与训练监督设置,这些内容尚未验证。 作者报告,在去雨、去雾、去噪和低光增强四类图像恢复任务、共九个公开基准上,该方法达到新的最先进性能并保持较低计算复杂度。摘要未提供基准名称、数据划分、对照方法、评价指标、具体分数及复杂度测量条件,因此目前不能量化或独立确认其优势;实验协议、消融及统计信息尚未验证。作者表示源代码将公开,不代表代码已经发布。 平台推测(待验证):全局与区域 SSM 的组合可作为 EEG 长时依赖与局部波形联合建模的候选机制,RFB 的频域处理也可能对应节律信息提取,但图像空间尺度和方向梯度并不直接等同于 EEG 时间尺度或电极拓扑。迁移需改造输入组织、多尺度定义及 AGB,且训练监督和数据规模依赖仍需查阅全文。低信噪比、跨被试差异、通道布局变化及小数据条件可能使细节增强放大伪迹,或使模型学习不稳定的频谱特征。一个可检验的小实验是假设上述组合有助于 EEG 去噪,在固定被试划分、相同污染条件与训练预算下,对比单一 SSM、加入全局与区域建模、再加入频域模块的重建误差及节律保真度;该实验仅用于检验迁移假设,不构成已有 BCI 效果证据。相关 EEG 工作尚未检索确认。

    阅读价值:值得核对 MS-Mamba 如何结合全局与区域 SSM、方向梯度和频域细节建模实现高效图像恢复,但其性能优势及对 EEG 的可迁移性尚未验证。

  6. OpenReview · State space models72

    PointMamba:用于点云分析的简单状态空间模型

    基于摘要分析。本文研究点云分析中全局建模与计算成本之间的权衡,提出 PointMamba,将源于 NLP 的 Mamba 状态空间模型(SSM)用于点云分析,以线性复杂度算法替代具有二次复杂度的注意力机制。 核心机制是利用空间填充曲线进行点 token 化,再以简单、非层级的 Mamba 编码器作为骨干。方法的关键路径是将三维空间中的点组织成可供序列模型处理的 token 序列,并利用 SSM 进行全局建模;摘要未说明具体空间填充曲线、点特征构造、训练目标或推理设置。 作者报告,在多个数据集上的评估中,PointMamba 获得更优性能,同时显著降低 GPU 显存使用量与 FLOPs。但摘要没有给出数据集名称、具体任务、划分协议、对照模型或数值,因此无法判断优势的适用范围及不同设置下的可比性。实验协议、消融及统计信息尚未验证。摘要表示代码将公开,当前发布状态及复现所需配置尚未验证。 平台推测(待验证):可迁移的假设是,线性复杂度的 Mamba 编码器可能缓解长时段 EEG 建模的计算开销;但点云的空间序列化并不直接等同于 EEG 的时间与通道组织。编码器思路可供参考,token 化则需改造成保留时间顺序及电极空间关系的表示,原研究所依赖的监督方式和训练规模尚不明确。低信噪比、跨被试分布差异、通道布局变化及小数据条件均可能使该假设失效。一个可检验的小实验是在固定 EEG 数据划分、训练预算与输入长度条件下,对比 Mamba 与 Transformer 编码器,分别考察任务性能、显存和计算量,并检验通道排序变化的影响。相关 EEG 工作尚未检索确认,这不构成已证实的 BCI 效果。

    阅读价值:值得核对其空间填充曲线序列化与非层级 Mamba 编码器如何兼顾全局建模和计算开销,但摘要中的性能与资源优势及其对 EEG 的适用性尚待验证。

  7. OpenReview · State space models70

    SSAMBA:基于 Mamba 状态空间模型的自监督音频表征学习

    基于摘要分析。本文研究音频表征学习中 Transformer 的计算与显存开销问题,提出 Self-Supervised Audio Mamba(SSAMBA),以双向 Mamba 构建无注意力机制的状态空间模型,并结合判别与生成目标进行自监督预训练。研究对象是音频,而非 EEG 或 BCI。 核心机制是利用双向 Mamba 捕获音频模式,并从大规模无标签数据中学习表征。作者将 SSAMBA 描述为首个自监督、无注意力且基于状态空间模型的音频表征模型;该首创性表述尚未独立核验。摘要未给出输入表征、双向信息融合方式、判别与生成目标的具体损失形式,也未说明是否采用掩码建模。 作者报告,在音频分类、keyword spotting 和 speaker identification 等任务中,SSAMBA 在多数任务上优于 Self-Supervised Audio Spectrogram Transformer(SSAST),但摘要未列出各任务的数据集、划分及性能指标。效率方面,作者报告,在 tiny 模型规模、输入 token 数为 22k 的条件下,相比 SSAST,批量推理速度约快 92.7%,显存使用效率改善约 95.4%。这些数值仅对应上述模型与输入条件;硬件、批大小、计时方式及显存统计口径尚未验证,不能直接推广至其他规模或实时流式场景。实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可迁移假设是,状态空间序列建模可能缓解长时段 EEG 表征学习的计算开销,自监督双目标可能利用未标注 EEG;这不意味着音频中的收益已在 BCI 成立。可复用的是 Mamba 主干与预训练思路,需改造音频输入编码、通道组织及训练目标。EEG 的低信噪比、跨被试差异、通道变化和较小训练规模可能使收益减弱;双向建模还需核对是否满足在线因果推理要求。一个可检验的小实验是在固定 EEG 数据划分、输入长度和训练预算下,对比 Mamba 与 Transformer 主干的跨被试任务性能、推理时间及峰值显存,再检验双目标预训练的增益。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对双向 Mamba 与判别、生成双目标预训练在音频表征中的作用,尤其是相对 SSAST 的长输入推理效率;其对 EEG 的价值尚未验证。

  8. OpenReview · State space models72

    Event USKT:用于事件相机知识迁移的 U 形状态空间模型

    基于摘要分析。该研究针对事件相机数据有限、难以充分利用已有 RGB 预训练模型的问题,提出 U 形状态空间模型知识迁移框架 USKT。其核心贡献是生成与 RGB 帧兼容的输入,使事件数据能够复用 RGB 预训练模型,并引入采用共享权重策略的 Bidirectional Reverse State Space Model(BiR-SSM)。 机制上,摘要将 USKT 描述为 Event-to-RGB 知识迁移框架:通过输入兼容化连接事件数据与 RGB 模型,而非仅依赖事件数据训练新模型。BiR-SSM 与常规双向扫描机制的区别在于共享权重;作者认为该设计有助于高效建模并节省计算资源。具体事件表示、U 形结构、反向扫描方式、损失函数、冻结或调优的参数范围及推理成本尚未验证。 结果方面,作者报告,使用 ResNet50 作为骨干时,在 DVS128 Gesture、N-Caltech101 和 CIFAR-10-DVS 上的模型性能分别提升 0.95%、3.57% 和 2.9%。摘要未明确这些提升对应的指标、比较基线、数据划分,以及百分比是否表示相对增幅,因此不能将其改写为 Accuracy 的百分点提升,也不能跨数据集直接比较。实验协议、消融及统计信息尚未验证。材料称代码将在论文被接收后公开,当前代码可用性及接收状态均尚未验证。 平台推测(待验证):可迁移假设是,输入兼容化与共享权重双向建模可能帮助数据有限的 EEG 任务复用预训练表示。但事件视觉数据与 EEG 的通道语义、时间结构和噪声特征不同,RGB 输入兼容不等于保留 EEG 判别信息。可考察状态空间建模及参数共享模块,输入映射则需针对 EEG 改造;低信噪比、跨被试差异、通道布局变化与小样本训练可能使映射丢失有效信息或过拟合。一个可证伪的小实验是在固定跨被试划分、相同预训练骨干和调优预算下,对比简单 EEG 输入映射与 USKT 式映射,并以取消双向权重共享作为对照,检查性能与计算成本是否同时改善。相关 EEG 工作尚未检索确认。

    阅读价值:值得核对 USKT 如何将事件数据转换为 RGB 预训练模型可用的输入,以及 BiR-SSM 的共享权重机制能否在减少参数调优与计算开销的同时保留任务信息;其 EEG 迁移价值尚未验证。

  9. OpenReview · State space models73

    Mamba-ST:用于高效风格迁移的状态空间模型

    基于摘要分析。该研究面向图像风格迁移:给定内容图像与风格来源,生成保留内容、呈现目标艺术风格的图像。作者提出 Mamba-ST,通过修改 Mamba 的状态空间模型(SSM)内部方程,使其接收并融合两路独立数据流,以替代风格迁移中的 cross-attention 功能。 核心机制是将两个独立嵌入组合为单一输出,而不依赖额外的 cross-attention 或定制归一化层。研究针对的是 Transformer 注意力层的内存开销,以及扩散模型较高的推理时间。作者称这是其所知首次通过改写 SSM 方程、在不使用上述额外模块的情况下完成这类视觉风格迁移任务;这一优先性主张尚未独立核实。摘要未给出具体方程、两路输入的组织方式、训练目标或推理流程。 作者报告,在与 Transformer 和扩散模型的风格迁移比较中,Mamba-ST 在 ArtFID 和 FID 指标上表现更好,并具有内存与时间复杂度优势。摘要未提供分数、数据集、划分、对照模型或硬件条件,因此不能量化改善幅度,也不能判断效率优势在何种分辨率和输入长度下成立。实验协议、消融及统计信息尚未验证。摘要提供了代码仓库,但实现完整性与复现条件尚未核对。 平台推测(待验证):可供 EEG/BCI 研究考察的是双数据流条件融合机制,而非图像风格迁移效果本身。假设 EEG 时序表示需要与任务或被试条件表示交互,该机制可能成为 cross-attention 的替代候选;但需改造输入编码、时间对齐与训练目标,且原方法对配对数据、监督和训练规模的具体依赖尚未验证。低信噪比、通道差异及小数据可能使融合机制难以学到稳定关系。一个可检验的小实验是在固定跨被试划分、编码器与训练预算下,仅替换双流融合模块,对比 cross-attention 与改造后的 Mamba-ST,核对分类 Accuracy、显存和推理延迟。该假设不构成已验证的 EEG/BCI 效果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 Mamba-ST 如何通过修改 SSM 内部方程实现双数据流融合,以及其相对 cross-attention 的质量与资源开销权衡;摘要报告了效果优势,但具体评估协议与效率数据尚未验证。

  10. OpenReview · State space models80

    状态空间模型的无状态推理:传递函数方法

    基于摘要分析。本文研究深度学习状态空间模型的高效序列计算,通过其对偶表示——传递函数——设计频域参数化,并提出无需显式状态的序列并行推理算法。核心贡献是直接计算对应卷积核的频谱,降低状态规模增大带来的计算与内存开销。 机制上,作者利用所提出的频域传递函数参数化性质,通过一次 Fast Fourier Transform(FFT)得到对应卷积核的频谱。作者称,无状态推理不会随着状态规模增加而产生显著的额外内存或计算成本;这一表述不等于整体计算成本为零,也不能据此认定其支持同样高效的逐样本在线推理。参数化的具体形式、数值稳定性及训练与推理的实现细节尚未验证。 结果方面,作者报告:在 Long Range Arena 上,跨多个序列长度与状态规模的实验中,相对采用时域参数化的 S4 层,平均训练速度提升 35%,并在所比较的无注意力方法中取得作者所称的领先下游表现。摘要未提供具体任务分项、绝对分数、硬件与计时条件,不能据此比较不同协议的性能。作者还报告,在语言建模中,仅引入该传递函数参数化即可相对长卷积 Hyena 基线改善 perplexity,但未给出数值。摘要提供了代码地址;实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,若 EEG 长序列建模确实受状态规模相关开销限制,该参数化与卷积计算模块可能具有复用价值,但仍需适配多通道输入与任务监督。低信噪比、通道差异和小样本可能使计算优势无法转化为解码收益。可在固定数据划分、输入长度、硬件与训练预算下,对照 S4 比较训练吞吐量、峰值显存及同一任务指标,并随序列长度与状态规模变化检验该假设;这不是已证实的 BCI 效果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其传递函数参数化如何降低大状态规模下的序列并行计算开销,以及作者报告的相对 S4 训练提速能否在相同实现与评估条件下复现;其对 EEG 长序列建模的价值尚未验证。

  11. OpenReview · State space models79

    VMamba:视觉状态空间模型

    基于摘要分析。本文研究如何构建计算高效的视觉网络,将状态空间语言模型 Mamba 适配为具有线性时间复杂度的视觉骨干 VMamba,核心贡献是用 2D Selective Scan(SS2D)处理二维视觉数据与一维选择性扫描之间的结构差异。 技术机制:VMamba 由 Visual State-Space(VSS)块堆叠构成,SS2D 沿四条扫描路径遍历二维数据,以收集不同来源和视角的上下文信息。作者据此构建一系列 VMamba 架构,并通过架构与实现层面的改进加速。摘要未给出具体扫描方向、状态更新公式、损失、训练配置及各加速措施,尚不能核对其计算开销与性能收益的来源。 结果与复现:作者报告,VMamba 在多种视觉感知任务上表现良好,相较现有基准模型具有更优的输入规模扩展效率。摘要未列出任务、数据集、指标、数值或对照配置,因此不能据此判断优势幅度,也不能将线性时间复杂度直接等同于实际运行速度。实验协议、消融及统计信息尚未验证。材料提供了源码仓库,但实现与论文版本的对应关系及完整复现条件仍需核对。 平台推测(待验证):迁移假设是将 EEG 的时间与通道,或时频表示,组织为二维输入,借用多路径选择性扫描建模上下文。原方法依赖二维结构,预训练数据规模与监督设置在摘要中未说明;EEG 的通道排列并不天然等同于图像邻接关系,因此可考察 SS2D 与 VSS 模块,但需改造输入编码、通道拓扑和任务输出。低信噪比、跨被试差异、缺失通道及小数据可能使扫描路径引入不稳定依赖或过拟合。一个可证伪的小实验是在固定 EEG 任务、训练预算与数据划分下,对比二维多路径扫描、仅时间扫描及常规基线,并扰动通道顺序,检验收益是否依赖人为排列;这不是论文已验证的结果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以四条扫描路径将一维选择性扫描适配到二维视觉数据的机制,以及输入规模扩展效率的评估;该机制对 EEG 的适用性尚未验证。

  12. OpenReview · State space models70

    用于图像去模糊的高效视觉状态空间模型

    基于摘要分析。本文针对图像去模糊中长程依赖建模与高分辨率计算成本之间的矛盾,提出高效视觉状态空间模型 EVSSM,以状态空间模型(SSMs)提取非局部信息,并通过视觉扫描模块降低多固定方向扫描带来的计算开销。 核心机制是:在各个基于 SSM 的模块之前施加不同几何变换,以捕获有用的非局部信息。摘要将其与采用多个固定方向扫描的既有方法对照,强调扫描方式的效率改进;具体变换类型、扫描顺序、网络结构、损失函数及训练配置尚未验证。作者以 Transformer 模型计算复杂度随图像分辨率呈二次增长作为研究动机,但摘要没有给出 EVSSM 的复杂度公式或实测资源消耗。 作者报告,EVSSM 在图像去模糊基准数据集和真实拍摄图像上,相较现有先进方法表现良好。摘要未列出数据集名称、划分、对照方法或定量指标,因此尚不能判断性能增益、效率收益及二者的权衡;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若将 EEG 表示为通道×时间或时频特征,SSM 的序列建模和扫描组织方式可能用于捕获较长时间范围的依赖。但原方法依赖图像空间结构,其几何变换不能直接视为 EEG 的有效变换:通道排列具有电极拓扑意义,时间方向也有特定语义。可复用候选是 SSM 建模与扫描组织思路,需改造的是输入表示及变换规则;低信噪比、跨被试差异、通道缺失和小数据训练均可能使收益消失。可检验的小实验是在固定数据划分和训练预算下,对照单方向扫描、多个固定方向扫描与保留电极拓扑的变换方案,分别报告被试内及跨被试性能、推理耗时和显存占用。该假设并非本文已验证的 EEG 结果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对几何变换驱动的视觉扫描如何兼顾非局部建模与计算效率,但摘要未提供定量性能或复杂度数据,其优势及向 EEG 的迁移价值尚未验证。

  13. OpenReview · State space models78

    VMamba:视觉状态空间模型

    基于摘要分析。本文研究如何构建计算高效的视觉网络,将状态空间语言模型 Mamba 迁移为具有线性时间复杂度的视觉骨干 VMamba,核心贡献是通过 2D Selective Scan(SS2D)适配二维视觉数据的结构。 机制上,VMamba 由 Visual State-Space(VSS)块堆叠构成,其中 SS2D 沿四条扫描路径遍历,以连接一维选择性扫描的有序处理方式与二维视觉数据的非序列结构,从不同方向汇集上下文信息。作者据此构建了一组 VMamba 架构,并通过架构与实现层面的改进加速。摘要未展开具体扫描顺序、状态更新形式、训练目标或加速实现,相关细节尚未验证。 作者报告,VMamba 在多种视觉感知任务中展现出良好性能,相较既有基准模型具有输入规模扩展效率优势。摘要未提供任务名称、数据集、数据划分、对照模型、数值指标及复杂度测量条件,因此不能据此量化性能提升,或将线性复杂度直接等同于实际运行速度优势。实验协议、消融及统计信息尚未验证。材料提供了公开代码仓库,复现仍需核对具体配置、训练预算与软硬件环境。 平台推测(待验证):若 EEG 被表示为通道×时间或时频二维结构,SS2D 的多方向上下文聚合可能用于建模长程依赖;这一假设依赖二维排列能够保留有意义的通道或时频关系,视觉领域结果不等于 EEG/BCI 效果。可考察复用 VSS 与扫描机制,但需改造输入编码、通道排列和任务输出。低信噪比、不规则电极布局、跨被试差异及小数据训练可能削弱收益,预训练与监督规模要求也尚未验证。一个可检验的小实验是在固定 EEG 数据划分、训练预算和相近模型容量下,对照多方向 SS2D 与单方向扫描,并扰动通道排列,观察任务指标及计算成本是否稳定改善。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以四条扫描路径将一维选择性扫描适配到二维视觉数据的机制,并核对输入规模扩展效率的对照实验;该机制对 EEG 的适用性尚未验证。

  14. OpenReview · State space models72

    VmambaIR:用于图像恢复的视觉状态空间模型

    基于摘要分析。VmambaIR 面向从退化输入恢复高质量图像的问题,将 State Space Models(SSMs)引入图像恢复,旨在兼顾长程依赖建模与计算效率。其核心贡献是采用 Unet 架构堆叠 Omni Selective Scan(OSS)块,以多方向扫描缓解 SSM 的单向建模限制。 机制方面,每个 OSS 块由 OSS 模块与 Efficient Feed-Forward Network(EFFN)组成。作者提出的 omni selective scan 对六个方向的图像信息流进行建模,并将 SSM 的线性复杂度作为相对于 Transformer 二次复杂度的效率优势。摘要未说明六个方向的具体定义、扫描与融合方式、EFFN 结构、损失函数及训练策略,这些细节尚未验证。 作者报告,在 image deraining、single image super-resolution 和 real-world image super-resolution 等任务中,VmambaIR 达到 SOTA,同时使用更少的计算资源与参数。摘要未提供数据集、数据划分、对照模型、评价指标或资源测量条件,因此该结论目前只能作为作者报告,不能据此量化优势或比较不同任务的性能。实验协议、消融及统计信息尚未验证。 平台推测(待验证):该方法原本依赖具有空间邻接关系的图像数据;多方向扫描与高效长程建模可能为 EEG 去噪提供机制参考,但原领域有效不等于 BCI 有效。可考虑复用 SSM 与扫描模块,需改造时间—通道表示、扫描顺序及训练目标,并核对是否依赖成对退化/参考信号监督。低信噪比、跨被试差异、不规则通道布局和小数据可能削弱效果,恢复过程也可能损伤 ERP 等任务相关成分。一个可证伪的小实验是在固定被试划分与噪声条件下,比较单向扫描和多方向扫描的 EEG 去噪误差、ERP 波形保真度及资源开销,检查效率收益是否伴随信号失真。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其 Omni Selective Scan 如何以线性复杂度缓解 SSM 的单向建模限制,并核对图像恢复效果与资源开销的对照证据;其对 EEG 的适用性尚未验证。

  15. OpenReview · State space models72

    利用平衡截断压缩含对角状态空间层的 S4 模型

    基于摘要分析。本文研究面向长序列处理、含 Diagonal State Space(DSS)层的 Structured State Space Sequence(S4)模型如何进行压缩,以支持边缘设备部署。核心贡献是将控制理论中的 balanced truncation(平衡截断)用于预训练 S4 模型的 DSS 层,并将降阶后的参数用于后续 S4 模型主训练过程的初始化。 方法包含两个用途:压缩预训练模型中的状态空间层,以及利用压缩所得参数初始化较小模型。摘要未给出平衡截断的具体实现、降阶维度选择、降阶后如何保持或转换 DSS 参数形式,以及后续训练设置,这些机制细节尚需全文核对。 作者报告,在摘要所述数值实验中,结合平衡截断训练的模型以更少参数取得了高于常规 Skew-HiPPO 初始化模型的准确率;作者还报告,原模型准确率越高,经该方法训练的模型准确率也越高,认为该方法能够利用原模型的优势。摘要未提供任务、数据集、划分协议、参数量及准确率数值,实验协议、消融及统计信息尚未验证。上述结果不直接证明实际边缘设备上的延迟、内存或能耗收益。 平台推测(待验证):若 EEG 长序列模型采用 S4/DSS 层,该方法可能对应边缘端部署时的模型规模瓶颈。可复用部分是预训练状态空间层的降阶及参数初始化流程;需核对降阶参数与现有 DSS 实现的兼容性,并根据 EEG 任务调整输入、输出及训练配置。其依赖已训练模型和后续任务训练,但摘要未说明监督方式与数据规模。低信噪比、通道差异、小样本及跨被试变化可能使原模型优势难以保留,降阶也可能损失判别所需的时序信息。一个可证伪的小实验是在同一 EEG 数据划分和训练预算下,对比未压缩 S4、平衡截断初始化的小模型与参数量匹配的 Skew-HiPPO 初始化小模型,同时测量任务准确率及设备延迟。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其将控制理论中的 balanced truncation 用于 DSS 层压缩与训练初始化的机制,以及相对 Skew-HiPPO 初始化的参数量—准确率权衡;其在 EEG 长序列建模中的适用性尚未验证。

  16. OpenReview · State space models75

    Multi-Scale VMamba:层级内嵌层级的视觉状态空间模型

    基于摘要分析。该研究面向视觉状态空间模型(SSMs)中多扫描策略带来的冗余,提出 Multi-Scale Vision Mamba(MSVMamba),通过多尺度 2D 扫描与通道混合模块,改善视觉任务中的效率与性能权衡。 核心机制:作者将多扫描策略的有效性与长程依赖建模联系起来,在原始及下采样特征图上执行多尺度 2D 扫描,以保留长程依赖学习能力并降低计算成本;同时引入 Convolutional Feed-Forward Network(ConvFFN),补充通道混合。摘要未给出扫描路径、尺度配置、下采样方式、参数量或计算量,具体效率收益与各模块贡献尚未验证。 作者报告:MSVMamba-Tiny 在 ImageNet 上取得 82.8% top-1 Accuracy;在 COCO 上采用 Mask R-CNN 框架和 1x 训练日程,取得 46.9% box mAP 与 42.2% instance mAP;在 ADE20K 上采用单尺度测试,取得 47.6% mIoU。这些结果分别对应图像分类、目标检测、实例分割与语义分割,不能跨任务直接比较。摘要未提供具体对照模型与完整训练配置,实验协议、消融及统计信息尚未验证。摘要提供了代码仓库,但实现与复现条件尚未核验。 平台推测(待验证):假设多尺度扫描可用于缓解 EEG 长序列建模的计算负担,可复用的部分是多尺度 SSM 扫描思路,需改造的是视觉 2D 特征布局、下采样与通道混合方式。原方法处理具有二维空间结构的图像特征;EEG 的时间—电极结构不能直接等同于图像,低信噪比、跨被试差异、通道配置变化及小数据训练都可能使收益失效,下采样也可能丢失短暂事件。一个可检验的小实验是在固定 EEG 数据划分与相同训练预算下,对比单尺度和多尺度扫描,分别报告被试内与跨被试性能、计算开销,并检查短时信息保留情况;这不是本文已验证的结果。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对多尺度 2D 扫描能否减少视觉 SSM 的多扫描冗余,同时保留长程依赖建模能力;摘要提供了多个视觉任务的结果,但效率收益及其对 EEG 的适用性尚未验证。

  17. OpenReview · State space models74

    Mamba3D:通过状态空间模型增强 3D 点云分析的局部特征

    基于摘要分析。本文研究 3D 点云分析中 Transformer 的二次复杂度与直接采用 Mamba 时表征效果不理想的问题,提出面向点云学习的状态空间模型 Mamba3D,以增强局部几何特征提取并兼顾全局表征。原论文的主要对象是点云,而非 EEG 或 BCI。 机制上,Mamba3D 使用 Local Norm Pooling(LNP)模块提取局部几何特征;同时引入 bidirectional SSM(bi-SSM),包含沿 token 方向运行的前向 SSM,以及在特征通道上运行的反向 SSM。这里的“反向”不宜直接理解为对 token 序列进行逆序扫描。摘要未披露 LNP 的具体运算、点云序列化方式、训练损失及预训练目标,这些实现细节尚未验证。 作者报告,Mamba3D 在多个点云任务中优于 Transformer 对照及同期方法,并具有线性复杂度。在分类任务中,ScanObjectNN 从头训练的 overall accuracy 为 92.6%;ModelNet40 使用单模态预训练后的 overall accuracy 为 95.1%。两项结果对应不同数据集与训练条件,不能直接横向比较。摘要未给出具体数据划分、输入点数、对照配置、复杂度的计量对象及实际运行效率;实验协议、消融及统计信息尚未验证。作者提供了代码与权重地址,但其可用性及复现条件尚未核对。 平台推测(待验证):若将 EEG 电极空间邻域用于局部特征提取,并以时间 token 的 SSM 建模长时依赖,其“局部结构增强+线性复杂度全局建模”机制可能具有借鉴价值。可复用的是局部聚合与 SSM 建模思路;需改造点云几何输入、序列组织及特征通道处理,且电极通道不能直接等同于网络特征通道。低信噪比、跨被试差异、不同电极布局及小样本训练都可能削弱效果。一个可检验的小实验是在固定 EEG 数据划分、训练预算和输入条件下,对比基础 SSM 与加入电极邻域局部聚合的版本,分别核对被试内和跨被试分类表现。该迁移假设不构成已验证的 BCI 贡献,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其 Local Norm Pooling 与 token/特征通道双向 SSM 如何改善点云局部与全局表征,以及线性复杂度下的分类表现;其对 EEG 的适用性尚未验证。

  18. OpenReview · State space models74

    GroupMamba:参数高效且准确的分组视觉状态空间模型

    基于摘要分析。该研究面向计算机视觉中纯状态空间模型(SSM)扩展至较大规模时的训练不稳定与参数效率问题,提出 GroupMamba,以分组空间扫描、跨通道调制及蒸馏训练目标改善模型性能;其主要研究对象是视觉任务,而非 EEG 或 BCI。 核心机制是 Modulated Group Mamba 层:将输入特征通道划分为四组,每组独立使用一个 Visual Single Selective Scanning(VSSS)模块,分别沿四个空间方向扫描;再通过通道调制算子增强组间的跨通道信息交流。这里的“通道”指视觉特征通道,不能直接等同于 EEG 电极。作者还引入基于蒸馏的训练目标以稳定大模型训练,但摘要未给出教师模型、蒸馏损失形式及具体训练配置。 作者报告,该方法在 ImageNet-1K 图像分类、MS-COCO 目标检测与实例分割、ADE20K 语义分割上优于现有方法。其中,具有 23M 参数的 tiny 变体在 ImageNet-1K 分类中取得 83.3% 的 top-1 Accuracy;作者称其相较同等模型规模的最佳现有 Mamba 设计,参数效率提高 26%。摘要未明确这一效率比例的计算口径及具体对照型号,也未提供其余任务的分数,因此不能将不同任务或配置的结果直接比较。实验协议、消融及统计信息尚未验证。摘要提供了代码与模型发布地址,但实现与权重可用性尚未核验。 平台推测(待验证):若 EEG 表征包含有意义的时间—空间或时间—频率结构,分组扫描与跨组调制可能成为降低计算开销、保留长程依赖的候选机制。可复用部分是分组 SSM 和调制思路,需改造输入编码与扫描方向;视觉二维邻接关系不能直接套用到电极布局。低信噪比、跨被试差异、通道缺失及小数据条件可能削弱收益,蒸馏还依赖可靠教师。一个可检验的小实验是在固定 EEG 输入、训练预算与被试划分下,对比分组扫描、加入调制及加入蒸馏的配置,分别报告被试内与跨被试性能、参数量和训练稳定性。此为迁移假设,并非本文已验证结论;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其分组定向扫描、跨通道调制与蒸馏训练如何共同改善视觉 SSM 的参数效率和训练稳定性,但这些机制对 EEG 的适用性尚未验证。

  19. OpenReview · State space models78

    MambaByte:无 token 的选择性状态空间模型

    基于摘要分析。MambaByte 研究直接从原始字节学习的无 token 语言建模,旨在避免子词分词的归纳偏置,同时缓解字节序列更长带来的计算与内存压力。其核心贡献是将 Mamba 状态空间模型(SSM)用于字节序列的自回归训练,并提出结合 tokenized drafting 与 byte-level verification 的推测解码适配方案。 机制上,摘要将标准自回归 Transformer 随序列长度增长的内存需求,与 Mamba 的固定大小记忆状态及高效解码进行对照。MambaByte 的建模单位是字节,而非子词;推测解码则用 token 化序列生成草稿,再在字节层面验证。具体状态更新、选择性机制、训练损失及草稿验证流程尚未验证。 作者报告,MambaByte 在语言建模任务上可与先进的子词 Transformer 竞争,部分表现更优,并保留无 token 模型的噪声鲁棒性优势。作者还报告,其推测解码适配方案相较标准 MambaByte 实现获得 2.6 倍推理加速,解码效率与子词 Mamba 相近。摘要未提供对应数据集、模型规模、任务指标、硬件、生成长度及对照配置,因此这些结果只能在作者所述比较范围内理解,实验协议、消融及统计信息尚未验证。 平台推测(待验证):其固定大小状态机制可能对应 EEG 长时序处理中随窗口长度增长的资源瓶颈,但字节语言建模依赖离散序列与自回归监督,不能直接等同于连续、多通道 EEG 建模。可考察 SSM 主干的复用,输入编码与训练目标需改造;tokenized drafting 的优势是否成立则取决于 EEG 是否存在合适的离散草稿表示。低信噪比、跨被试分布差异、通道变化及小数据可能削弱效果。一个可检验的小实验是在固定数据划分和参数预算下,比较 SSM 与 Transformer 在不同 EEG 窗口长度上的任务指标、峰值内存及推理延迟。上述仅为迁移假设,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以固定大小状态处理长字节序列的机制,以及结合 tokenized drafting 与 byte-level verification 的推测解码方案;摘要中的语言建模与效率结论仍需结合完整实验协议核对。

  20. OpenReview · State space models73

    SMamba:通过可伸缩状态空间模型实现任意尺度超分辨率

    基于摘要分析。研究针对任意尺度超分辨率(ASSR):用单一模型将低分辨率图像重建为任意目标尺度的高分辨率图像。作者提出正文称为 S³Mamba 的方法,通过 Scalable State Space Model(SSSM)构建可随尺度调整的连续表示空间,并结合尺度感知自注意力提取不同尺度下的重要全局特征。 机制上,摘要将隐式神经表示(INR)描述为连接坐标与像素值、重建连续信号的途径。SSSM 在离散化过程中调制状态转移矩阵及步长采样矩阵,作者称由此实现具有线性计算复杂度的连续尺度建模。尺度感知自注意力用于补充不同尺度下的全局特征感知;具体调制公式、尺度条件的注入方式、训练损失,以及线性复杂度是否涵盖完整网络,尚未验证。 作者报告,在合成与真实场景基准上的实验取得了最先进的性能及任意超分辨率尺度下的泛化能力。摘要未提供基准名称、训练与测试尺度划分、对照方法、指标或数值,因而尚不能核对其提升幅度,或区分已见尺度与未见尺度的泛化。实验协议、消融及统计信息尚未验证;代码与复现条件亦未确认。 平台推测(待验证):假设该尺度条件化的连续表示机制可用于 EEG 时间轴重采样或缺失采样点重建,其潜在对应问题是不同采样率下的信号表示一致性,而不是直接提升 BCI 分类效果。可考虑复用尺度调制的状态空间模块,但需将二维图像坐标改为时间坐标,并处理通道结构、频带约束与抗混叠;原任务依赖低分辨率输入及高分辨率重建目标,迁移所需监督和数据规模尚不明确。低信噪比、小样本及跨被试差异可能使模型重建伪波形或失真频谱。一个可证伪的小实验是在按被试隔离的数据上,对高采样率 EEG 进行抗混叠降采样,比较该机制与常规插值在未见采样比例下的波形、频谱及下游任务表现。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其通过离散化过程中的状态转移与步长采样调制实现连续尺度建模的机制,尤其是线性复杂度的适用范围及尺度外泛化证据;其对 EEG 的价值尚未验证。