跳到正文

算法、任务与模态

Efficient AI 最新动态

Efficient AI 研究索引;按可核对的标签归档,不以热度评价质量。

86 条精选近 30 天 61 条共收录 97 条

更新

精选归档 · 第 4 页

9月17日周四第 61–80 条
  1. OpenReview · Representation learning71

    Representax:基于 JAX 的可扩展表征学习

    基于摘要分析。该工作面向跨模态表征学习中训练与评估工具分散、研究实现难以扩展的问题,提出开源 JAX 框架 Representax,将多类表征学习方法与共享训练基础设施整合,支持从方法探索到规模化训练。 框架统一了可扩展的训练和评估任务,覆盖 dense retrieval、late-interaction retrieval、多模态对比学习、reward modeling 和 joint-embedding predictive learning。共享基础设施支持模型适配、多模态数据处理、内存高效优化,以及 GPU 和 TPU 上的分布式执行。摘要体现的贡献主要是研究软件与任务整合,而非明确提出新的表征学习损失;具体模型结构、损失实现、优化策略及接口约束尚未验证。 作者报告,通过与既有框架比较训练性能、训练并评估检索和多模态模型,以及测量多 GPU strong scaling,观察到具有竞争力的吞吐量、留出检索任务上的改进和高效扩展。摘要未提供数据集、划分、基线名称、硬件配置或数值,因此不能量化优势,也不能据此推断跨数据集泛化;实验协议、消融及统计信息尚未验证。复现需进一步核对源码获取方式、依赖版本、训练配置、数据处理流程和计时口径。 平台推测(待验证):若其多模态对比学习与 joint-embedding predictive learning 接口允许接入 EEG 时序编码器,该框架可能用于组织 EEG 自监督预训练实验,但这只是工程复用假设,不是已证实的 BCI 效果。需改造输入处理、通道适配、时间窗口与任务评估;对比学习还依赖合理的配对或增强设计。低信噪比、通道差异、被试差异和小数据可能削弱收益。一个可检验的小实验是在固定数据、跨被试划分、编码器与训练预算下,对照原实现和 Representax 实现,核对下游指标、吞吐量与峰值显存。已有 EEG 相关工作尚未检索确认。

    阅读价值:Representax 将多类表征学习方法与 JAX 分布式训练基础设施统一,值得核对其任务扩展接口、性能对照与多 GPU 扩展协议,以评估能否降低研究实现成本;其 EEG/BCI 适用性尚未验证。

9月8日周二
  1. OpenReview · State space models73

    视觉状态空间模型的选择性操作量化

    基于摘要分析。该研究面向视觉 State Space Models(SSMs)在资源受限边缘设备上的部署,提出训练后量化(Post-Training Quantization,PTQ)方法 SELective Operation Quantization(SELOQ),重点解决选择性操作中特殊激活分布造成的量化困难。 核心机制是针对不同量化对象分别处理:作者分析指出,离散参数的分布具有长尾偏斜,隐藏状态序列则具有高度动态的变化;据此设计 Long-tailed Skewness Quantization(LtSQ)量化离散参数,以及 Temporal Scale Quantization(TSQ)量化隐藏状态,以降低量化误差。摘要未提供具体量化公式、位宽、尺度计算方式或校准数据要求,不能据此判断其实现开销与适用边界。 作者报告,在多个视觉任务、模型规模与架构上,SELOQ 对量化视觉 SSMs 的表现显著优于现有方法。摘要未列出任务与数据集名称、评估指标、具体数值及对照基线,因此尚不能量化收益,也不能将任务表现直接等同于真实设备上的加速或能耗改善;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若用于 EEG 的 SSM 同样出现离散参数长尾偏斜与隐藏状态尺度随时间变化,SELOQ 的分对象量化思路可能有助于边缘部署,但视觉模型中的有效性不等于 EEG/BCI 有效性。可复用的是 LtSQ 与 TSQ 的设计思路,需改造和核对的是 EEG 模型中的选择性操作实现、时间维度及校准数据覆盖。低信噪比、跨被试或通道变化可能使校准分布失配,小数据条件也可能难以覆盖隐藏状态变化。一个可检验的小实验是:在已有 EEG SSM 上固定数据划分、量化位宽与校准样本,对比常规 PTQ、分别加入 LtSQ 或 TSQ、以及两者组合,检查量化误差与原任务指标,并独立测量设备延迟。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其针对离散参数长尾偏斜与隐藏状态时序变化分别设计量化策略的机制,但性能收益、部署成本及向 EEG 模型迁移的有效性仍需核对。

9月5日周六
  1. OpenReview · EEG76

    CoEEG:EEG 解码中的协作学习基准评估

    基于摘要分析。CoEEG 针对 EEG 解码中的被试间差异、单用户标注稀缺及隐私限制下的数据分散问题,构建联合比较模型与协作学习协议的基准。其贡献是将 MI(运动想象)、SSVEP、P300 三种范式、不同模型家族及共享边界放入统一评估框架,而非将协作学习视为普遍有效的训练方案。 基准覆盖具有范式特定先验的传统机器学习模型、从头训练的深度模型及 EEG 基础模型,共比较十种模型和四种涵盖非协作与协作训练的协议。摘要未给出协议名称、客户端构成、具体数据集或被试划分,不能据此判定结果属于何种 Within-subject、Cross-subject 或 Cross-session 设置。 作者报告,SSVEP 中十种模型有九种从协作中获益,并将这一现象解释为被试间决策边界较为共享;P300 中,只有各客户端保留私有分类头时,所有模型才均获益;MI 的收益则集中于独立训练表现较差的模型。在六个联邦评估组合中,从头训练模型家族的平均表现更高,但某个基础模型在其中两个组合取得单模型最佳成绩;摘要未说明这些组合的定义及对应指标。 作者以测得的表征对齐程度和推断的决策边界共享程度解释共享边界的作用,并报告私有分类头在 MI 中产生分化,未改善最弱客户端。摘要还报告 SSVEP 中最弱客户端下降 20.7 个百分点、最强客户端下降 9.3 个百分点,但对应指标、参照协议与客户端分组方式尚未验证,不能据此推导绝对表现。 作者报告,纳入参数量、内存及通信后,轻量模型在多数设置中具有更好的性能—成本权衡,最大基础模型的传输量最高达 378.73 GiB;该数值对应的训练轮次、统计范围及通信方向尚未验证。复现时应重点核对共享与私有模块、客户端数据划分、弱势客户端定义和成本核算口径;实验协议、消融及统计信息尚未验证。

    阅读价值:CoEEG 将 EEG 范式、模型家族与参数共享边界纳入同一评估框架,值得核对其协作收益、弱势客户端表现及通信成本之间的权衡,但具体协议与统计可靠性尚未验证。

5月1日周五
  1. OpenReview · State space models76

    SF-Mamba:重新思考用于视觉的状态空间模型

    基于摘要分析。本文针对视觉 Mamba 的扫描机制限制图像 patch 间非因果交互、多扫描策略带来数据重排开销,以及短 token 序列下计算速度较慢的问题,提出 SF-Mamba,尝试同时改善视觉编码的信息流与计算效率。 核心机制包括两项:辅助 patch swapping,在单向扫描中编码双向信息流;batch folding 配合周期性状态重置,以提升 GPU 并行度。其思路不是单纯增加扫描方向,而是重新组织 patch 交互与计算执行。摘要未说明交换规则、折叠维度、状态重置周期,以及这些操作如何保持上下文信息,具体实现尚未验证。 作者报告,在图像分类、目标检测、实例分割和语义分割实验中,SF-Mamba 在不同模型规模下优于作者所称的最先进基线,并提升吞吐量。摘要未提供数据集、划分、评价指标、数值、硬件环境及吞吐测量条件,因此目前不能量化性能收益或判断不同设置下的可比性;实验协议、消融及统计信息尚未验证。摘要提供了代码仓库,但代码内容、运行依赖与复现结果尚未核验。 平台推测(待验证):若 EEG 被组织为时间片段或通道—时间 token,patch swapping 可能为单向扫描补充双向上下文,batch folding 则可能改善短序列训练或推理的 GPU 利用率。这一假设依赖 token 的时空结构及计算规模,视觉任务中的收益不能直接视为 BCI 效果。迁移时需改造交换规则以匹配电极与时间关系,并核对周期性状态重置是否截断关键时序信息;低信噪比、跨被试差异、通道变化和小数据可能削弱收益,在线因果解码也需单独评估。可先在固定 EEG 数据划分和硬件条件下,对比原始单向 Mamba 与分别加入两项机制的版本,记录任务指标、吞吐及延迟,以检验机制收益能否迁移。相关 EEG 工作尚未检索确认。

    阅读价值:值得核对 SF-Mamba 如何以 patch swapping 和 batch folding 同时改善视觉状态空间模型的信息交互与 GPU 吞吐,但性能优势及其对 EEG 的迁移价值尚需验证。

9月15日周一
  1. OpenReview · State space models75

    SF-Mamba:重新思考面向视觉的状态空间模型

    基于摘要分析。该研究针对视觉 Mamba 中单向递归扫描限制图像 patch 非因果交互、多扫描策略引入数据重排开销,以及短 token 序列下计算速度较慢的问题,提出视觉编码器 SF-Mamba,试图同时改善信息交互与计算效率。 核心机制包括两项设计:通过辅助 patch 交换,在单向扫描下编码双向信息流;通过 batch folding 与周期性状态重置,提升 GPU 并行性。摘要未给出 patch 交换规则、batch folding 的具体张量组织、状态重置周期及其对上下文保留的影响,因此这些实现细节尚未验证。其创新重点是重新设计扫描与执行方式,而非仅增加扫描方向。 作者报告,在图像分类、目标检测、实例分割和语义分割实验中,SF-Mamba 相比作者所称的最先进基线取得更好的任务表现,并在不同模型规模下提高吞吐量。摘要未提供数据集、指标数值、基线名称、硬件、batch size 或吞吐量测量条件,无法据此量化收益或判断公平比较;实验协议、消融及统计信息尚未验证。材料称代码将在发表后发布,当前代码可用性与论文发表状态不能由此推定。 平台推测(待验证):该方法原本依赖图像 patch 序列及 GPU 批处理结构,其扫描效率设计可能为短序列 EEG 编码提供参考,但不构成已验证的 BCI 效果。迁移假设是,辅助 token 交换能够改善 EEG 时间窗或通道 token 的信息交互;需改造 patch/token 构造与交换规则,并检查周期性状态重置是否损失跨窗依赖。低信噪比、跨被试差异、通道排列变化及小数据训练可能削弱收益。可在固定 EEG 数据划分与同一硬件、batch size 下,对照普通单向扫描,分别加入交换和状态重置,比较任务指标与吞吐量;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 SF-Mamba 如何以辅助 patch 交换和周期性状态重置兼顾信息交互与 GPU 吞吐量,但其相对基线的效果及迁移至 EEG 的适用性尚未验证。

7月8日周二
  1. OpenReview · State space models71

    MS-SSM:用于高效序列建模的多尺度状态空间模型

    基于摘要分析。MS-SSM 针对传统状态空间模型(SSM)有效记忆受限、难以同时捕获多尺度依赖的问题,将序列动态表示在多个分辨率上,并为各分辨率配置专门的状态空间动力学;同时引入输入依赖的 scale-mixer,动态融合不同分辨率的信息。 核心机制是同时建模细粒度高频模式与粗粒度全局趋势,以改善记忆效率和长程建模。相较于摘要所述依赖扩大状态尺寸来提升召回能力的传统 SSM,本文侧重多分辨率处理与动态跨尺度融合。分辨率如何构造、各尺度状态如何更新、scale-mixer 的具体形式,以及训练目标、稳定性约束和复杂度尚未验证。 作者报告,在包括 Long Range Arena、hierarchical reasoning、time series classification 和 image recognition 的基准实验中,MS-SSM 持续优于此前的 SSM 模型,并保持计算效率。摘要未提供具体分数、数据划分、对照模型配置或效率测量条件,因此无法判断提升幅度及性能与成本的权衡;实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设多尺度机制能区分 EEG 的局部快速变化与较慢的时序背景,其可能缓解长序列建模中的记忆压缩瓶颈,但原领域结果不等于 EEG/BCI 有效。可尝试复用多尺度状态动态与 scale-mixer,需按采样率和目标信号调整分辨率构造,并适配多通道输入。低信噪比可能使动态融合追随伪迹,降采样可能损失任务相关信息,跨被试差异与小数据也可能限制泛化。一个可检验的小实验是在固定 EEG 任务和相同 Cross-subject 划分下,对比单尺度 SSM、多尺度但固定融合、完整 MS-SSM,并控制参数量与训练预算,联合检查任务指标、推理成本和噪声扰动下的稳定性。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对多分辨率状态空间动力学与输入依赖 scale-mixer 能否在计算成本可比时改善长程记忆,以及各模块对性能的独立贡献;其 EEG 迁移价值尚未验证。

6月13日周五
  1. OpenReview · State space models73

    DyGMamba:利用状态空间模型高效建模连续时间动态图中的长期时间依赖

    基于摘要分析。DyGMamba 面向连续时间动态图(CTDG)表示学习,试图同时解决长节点交互历史带来的计算开销,以及从长历史中识别关键时间信息的难题。其核心贡献是结合节点级与时间级状态空间模型(SSM),在编码历史交互的同时动态选择重要信息。 机制上,DyGMamba 源于 Mamba:节点级 SSM 首先编码节点历史交互序列,时间级 SSM 再提取历史图中的时间模式,并用其输出动态选择交互历史中的关键信息。摘要支持这种功能分工,但未说明选择操作、时间间隔编码、损失形式和训练细节,不能据此推断具体网络结构或复杂度阶数。 作者在动态图链接预测任务上验证该方法,并报告其在多数情况下达到最先进水平,同时保持较高的计算资源效率,使有限计算预算下捕获长期时间依赖成为可能。摘要未提供数据集、划分、对照基线、指标数值或资源测量条件,因此尚不能判断优势集中在哪类图、历史长度或预测协议;实验协议、消融及统计信息尚未验证。 平台推测(待验证):该机制可能适用于将 EEG 表示为带时间戳交互事件图的研究,探索长时依赖与关键交互筛选,但原领域有效不等于 BCI 有效。可复用的是历史交互序列编码和时间信息选择思路;需要改造的是 EEG 通道或脑区节点定义、边事件构建及任务监督。其依赖的事件图结构与常规连续 EEG 信号并不等同,低信噪比可能产生不稳定边事件,跨被试通道差异和小数据也可能削弱选择机制。一个可检验的小实验是在固定 EEG 图构建、数据划分与计算预算下,对比完整机制和不使用时间级动态选择的版本,检查长历史是否带来稳定收益。已有 EEG 相关工作尚未检索确认;具体复现仍需取得全文及核对实现条件。

    阅读价值:值得核对其节点级历史编码与时间级动态信息选择的协同机制,以及长交互历史下预测性能和计算资源开销的权衡;摘要中的领先结果仍需结合具体评估协议验证。

5月1日周四
  1. OpenReview · State space models72

    状态空间模型的参数高效微调

    基于摘要分析。本文研究 Mamba 等深度状态空间模型(SSMs)的参数高效微调(PEFT),重点考察既有方法的表现及应调节的参数位置,并提出面向 SSM 模块的 Sparse Dimension Tuning(SDT),与用于线性投影矩阵的 LoRA 组合。 作者报告,LoRA 及其变体在所开展的比较中持续优于其他 PEFT 方法,但效果依赖于目标参数:LoRA 对线性投影矩阵有效,在 SSM 模块上则未奏效,尽管仍优于其他适用于 SSM 的方法。这里的关键研究问题是不同模块是否需要不同的微调机制,而非将同一种低秩更新统一施加到所有参数。摘要未说明 SDT 如何选择稀疏维度、更新哪些参数,以及其训练目标与参数预算。 作者报告,SDT 与 LoRA 的组合在广泛实验中达到最先进性能;但摘要未提供任务、数据集、模型规模、数据划分、对照基线或指标数值,因此尚不能判断优势的适用范围。实验协议、消融及统计信息尚未验证,复现还需核对 SDT 的实现、训练配置与各方法的可训练参数预算。 平台推测(待验证):若 EEG 任务采用预训练 SSM,该模块分工式微调可能对应小数据条件下全量微调成本高、易过拟合的问题。可复用的是 SSM 模块使用 SDT、线性投影使用 LoRA 的适配思路;EEG 的通道输入、时间采样与任务输出仍需改造。原研究面向语言建模背景,具体预训练数据结构、监督方式与规模尚未验证,不能据此推定 EEG 效果。低信噪比、跨被试差异及通道变化可能使稀疏维度选择不稳定。一个可检验的小实验是在固定 EEG 预训练 SSM 和 Cross-subject 划分下,以匹配的可训练参数预算比较 LoRA 与 SDT+LoRA,并检查多次运行的性能与稳定性。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其针对 SSM 模块与线性投影矩阵分别选择微调方法的分析,但 SDT 的具体机制及其相对 LoRA 的收益仍需全文核对。

1月23日周四
  1. OpenReview · State space models78

    HOPE:长记忆状态空间模型的稳健参数化

    基于摘要分析。本文研究基于线性时不变(LTI)系统的状态空间模型(SSM)为何依赖专门设计的初始化,以及状态矩阵在对数尺度上以很小学习率训练的做法,并提出基于 Hankel operator 理论的参数化方案 HOPE,旨在改善初始化与训练稳定性。 机制上,HOPE 利用 Hankel operators 中的 Markov parameters 对 LTI 系统进行参数化,并通过对 LTI 系统传递函数进行非均匀采样实现高效计算。作者报告,该方案相较于常规 SSM 使用更少参数,并改善训练稳定性。摘要未给出具体参数化公式、采样策略、损失形式或参数量,相关实现条件尚未验证。 实验方面,作者报告,在 Long-Range Arena(LRA)任务上,基于 Hankel operators 参数化的 SSM 相较于采用 HiPPO 初始化的 S4、S4D 表现更好;摘要未提供具体任务分项、指标、数据划分及数值。作者还报告,该参数化具有固定时间窗内不衰减的记忆,并以加入填充噪声的 sequential CIFAR-10 任务提供经验支持。这不等同于无限时长记忆,也不能直接外推为生理信号中的抗噪能力。实验协议、消融及统计信息尚未验证。 平台推测(待验证):其迁移假设是,若 EEG 任务依赖较长时间跨度的有效信息,HOPE 的记忆参数化可能有助于降低长序列训练对初始化的敏感性。原方法依赖时序输入与 LTI 动态建模;迁移时可复用参数化及传递函数采样机制,但需适配多通道 EEG 输入与任务输出。低信噪比可能使长记忆同时保留无关噪声,跨被试差异、通道变化和小数据条件也可能削弱收益。可在一个固定的 EEG 任务与数据划分下,以相同输入处理和训练预算比较 HOPE 与 S4D,并改变有效片段后的噪声填充长度,检验任务指标与训练稳定性是否更稳健。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是 HOPE 将长记忆 SSM 的初始化与训练稳定性问题统一到 Hankel operator 参数化视角;作者报告的固定时间窗内不衰减记忆,为评估噪声背景下的长时依赖提供了具体切入点,但 EEG 适用性尚未验证。

  2. OpenReview · State space models78

    面向不规则时间序列的连续状态空间 Feynman-Kac 模型摊销控制

    基于摘要分析。本文研究不规则、离散观测下的连续时间序列建模,提出 Amortized Control of continuous State Space Model(ACSSM),以观测条件化的连续潜在动力学统一支持分类、回归、插值和外推任务。 核心机制是先通过多边缘 Doob's h-transform 构造以不规则观测为条件的连续动力系统,再借助随机最优控制(SOC)理论进行变分推断,近似难以直接求解的 Doob's h-transform 并模拟条件化动力学。作者提出具有紧致证据下界(ELBO)的推断算法,但该下界的具体形式、成立条件及紧致性论证尚未验证。 在计算实现上,ACSSM 使用辅助变量灵活参数化潜在动力学与摊销控制,并结合 simulation-free 潜在动力学框架和基于 transformer 的数据同化方案,使潜在状态推断与 ELBO 计算能够并行进行。这里的关键阅读点是条件化动力学、控制近似与并行推断如何衔接;摘要不足以确定 simulation-free 的具体实现及其与动力学模拟之间的关系。 作者报告,在多种真实世界数据集上的分类、回归、插值和外推评估中,ACSSM 获得更优性能并保持计算效率。摘要未给出数据集名称、划分、对照基线、指标数值或运行资源,故不能判断优势幅度及适用范围;实验协议、消融及统计信息尚未验证。 平台推测(待验证):该机制可能适用于存在缺测或异步采样的 EEG 多模态记录,但原领域结果不等于 BCI 有效。迁移假设依赖可用时间戳和足够观测信息,可复用连续动力学及摊销推断思路,需改造观测模型与通道表示;低信噪比、跨被试差异和小数据可能导致潜在动力学估计不稳定。可在固定被试内划分下,对同一 EEG 数据施加受控缺测,比较 ACSSM 与规则重采样后的基线在插值误差及下游任务指标上的变化。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读的是其将多边缘 Doob's h-transform、随机最优控制与摊销推断结合,用于不规则观测下的连续潜在动力学建模;性能优势与计算效率仍需结合全文中的评估协议核对。

1月1日周三
  1. OpenReview · State space models72

    用于图像去模糊的高效视觉状态空间模型

    基于摘要分析。该研究针对高分辨率图像去模糊中长程依赖建模与计算成本之间的矛盾,提出高效视觉状态空间模型 EVSSM,以视觉扫描模块获取非局部信息,并用频域前馈网络 EDFFN 表征局部信息。 核心机制:摘要指出,ViTs 的计算复杂度随图像分辨率呈二次增长,而现有部分视觉 SSM 方法采用多个固定方向扫描,也会增加计算成本。EVSSM 在各 SSM 模块之前应用不同几何变换,以捕获有用的非局部信息并维持效率;EDFFN 则估计有助于恢复潜在清晰图像的频率信息。具体几何变换、扫描路径、频域运算、损失函数及训练配置尚未验证,不能据摘要确定其复杂度或参数规模。 结果与证据边界:作者报告,EVSSM 在基准数据集和真实图像上相较先进方法表现有利。摘要未提供数据集名称、划分、对照方法、评价指标、数值或运行硬件,因此尚不能量化质量与效率的权衡;实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,SSM 的长程建模与频率信息筛选可能用于 EEG 时序去噪,但图像去模糊的二维空间结构及清晰图像恢复目标不能直接等同于 EEG。可考虑复用 SSM 与频域处理思路;扫描和几何变换需依据时间轴、通道拓扑改造,并明确干净信号或其他监督来源。低信噪比下的频率筛选可能误抑制任务相关活动,跨被试差异、通道排列变化及小数据训练也可能削弱效果。一个可检验的小实验是,在固定被试划分和受控噪声条件下,对比 SSM 基线、加入 EDFFN 的版本及改造扫描的版本,同时检查信号恢复与下游任务指标,避免仅凭重建质量判断 BCI 价值。已有相关 EEG 工作尚未检索确认。

    阅读价值:值得关注其通过几何变换组织 SSM 扫描、结合频域前馈网络处理非局部与局部信息的机制,但效率优势、去模糊收益及 EEG 迁移价值仍需核对全文或实验验证。

  2. OpenReview · State space models71

    SSMLoRA:利用状态空间模型增强低秩适应

    基于摘要分析。SSMLoRA 针对语言模型参数高效微调中 LoRA 表现随插入位置变化、部分插入可能造成参数冗余的问题,引入状态空间模型(SSM)连接低秩矩阵,使适配过程能够利用前一低秩空间的计算,并支持更稀疏的插入。 机制上,摘要描述了输入到低秩空间的映射,以及低秩空间之间的计算复用;其目标不仅是减少可训练参数,还包括减少不必要的适配模块插入。SSM 状态如何传递、低秩矩阵如何连接、插入位置如何选择,以及训练损失与推理开销,均需全文核对,不能仅凭摘要确定具体结构。 作者报告,在 General Language Understanding Evaluation(GLUE)benchmark 上,SSMLoRA 使用 LoRA 一半的适配参数即可取得相当表现;这一结论限于摘要所述 GLUE 对照,基础模型、各任务指标、数据划分、低秩维度及参数统计口径尚未验证。作者还认为其结构有望处理更长输入序列,但摘要未提供长序列实验结果,因此不能视为已验证优势。实验协议、消融及统计信息尚未验证。摘要提供了代码仓库链接,代码完整性与可复现性仍待检查。 平台推测(待验证):若 EEG 预训练模型采用多处 LoRA 适配,可假设低秩空间之间的状态传递有助于减少插入点。可复用的是低秩适配与状态连接思路,需改造的是 EEG 骨干接口、跨模块状态定义及通道布局适配。该假设依赖可适配的预训练骨干和足够的任务监督;低信噪比、跨被试差异、通道变化及小样本可能使共享状态传播噪声或产生过拟合。一个可证伪的小实验是在固定跨被试划分与同一 EEG 骨干上,对比常规 LoRA、稀疏 LoRA 和 SSMLoRA,同时控制可训练参数预算与训练条件,检验收益是否来自状态连接而非参数配置。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 SSM 连接低秩空间是否能降低 LoRA 对插入位置的敏感性:作者报告在 GLUE 上以一半适配参数取得相当表现,但具体参数口径、插入方案与评估协议尚未验证。

10月10日周四
  1. OpenReview · State space models77

    状态空间模型的参数高效微调

    基于摘要分析。本文研究深度状态空间模型(SSMs,如 Mamba)中的参数高效微调(PEFT),比较既有方法的适用性,并分析哪些模块适合微调;在此基础上提出 LoRA with Selective Dimension tuning(SDLoRA),将线性投影矩阵上的 LoRA 与 SSM 模块内的选择性维度更新结合。 作者对四种基础 PEFT 方法进行了经验评估,报告 prompt-based 方法(如 prefix-tuning)在所研究的 SSM 模型与实验条件下不再有效,并提供理论分析支持;相比之下,LoRA 仍然有效。进一步的理论与实验分析表明,在其比较设置中,将 LoRA 应用于线性投影矩阵、而不修改 SSM 模块,效果最佳;作者同时报告,直接用 LoRA 调整 SSM 模块并不有效。这一结论针对具体微调方式,不等于 SSM 内部参数完全不值得更新。 SDLoRA 的机制是在 SSM 模块中选择性更新部分通道和状态,同时对线性投影矩阵应用 LoRA。作者报告该方法优于标准 LoRA,但摘要未给出数据集、任务组成、模型规模、可训练参数预算、指标或提升幅度;维度选择规则、训练配置、实验协议、消融及统计信息尚未验证。复现时需核对各方法的参数预算与训练条件,以及理论结论适用的模型假设。 平台推测(待验证):若 EEG 任务已有可用的预训练 SSM,该方法可能为小数据微调提供候选方案;但原研究针对语言建模背景下的 SSM,不能据此认定其对 EEG 有效。迁移假设是选择性更新状态维度能够适应 EEG 时序差异,同时限制可训练参数规模。可复用部分是投影矩阵上的 LoRA 与选择性维度更新,需改造 EEG 输入表征及任务输出模块;低信噪比、跨被试差异和通道配置变化可能使所选维度失效。可在固定跨被试划分与匹配可训练参数预算的条件下,小规模比较标准 LoRA 与 SDLoRA,并检查多次运行的稳定性。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其关于 LoRA 在 SSM 内部模块与线性投影矩阵上效果差异的理论和实验分析,为选择参数高效微调的位置提供依据,但具体评估协议与效果幅度尚未验证。

9月27日周五
  1. OpenReview · State space models75

    MatMamba:一种 Matryoshka 状态空间模型

    基于摘要分析。MatMamba 研究如何让单个状态空间模型适应不同推理计算预算,将 Matryoshka 式学习与 Mamba2 结合,通过修改模型块以包含嵌套维度,实现不同规模子模型的联合训练与自适应推理。 核心机制是从一个训练完成的大模型中提取多个较小的嵌套子模型,而非为每种部署规模分别训练模型。摘要将其与 Matryoshka Representation Learning 及其在 Transformer 骨干上的应用 MatFormer 联系起来;具体维度嵌套方式、训练目标、子模型采样策略和推理规模选择规则尚未验证。 作者报告,在参数规模为 35M 至 1.4B 的语言与图像模型实验中,嵌套小模型能够保持或超过从头训练的小模型基线的性能。作者还报告,ImageNet 和 FineWeb 上的结果显示 MatMamba 具有与 Transformers 相近的扩展表现,并具备更高效的推理特性。摘要未提供具体指标、计算预算、硬件、数据划分或延迟数值,因此不能量化性能收益或推理加速;实验协议、消融及统计信息尚未验证。“免费”获得子模型应理解为不必逐个从头训练,不代表联合训练或部署没有额外开销。 平台推测(待验证):若 EEG 时序任务需要在不同设备计算预算间部署,嵌套子模型可能提供可复用的弹性容量机制。该假设依赖共享模型在不同容量下仍能学习有效时序表征;原摘要的语言与图像实验不能直接证明 EEG 效果。可复用部分是 Mamba2 中的嵌套维度与联合训练思路,EEG 输入编码、通道组织及任务输出模块则需改造。低信噪比、跨被试差异、通道变化和小数据条件可能使较小子模型丢失有效信息。一个可检验的小实验是在固定 EEG 任务及 Cross-subject 划分下,比较联合训练的嵌套子模型与相应规模的独立训练基线,同时记录任务指标、参数量和同一硬件上的推理延迟。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其将 Matryoshka 式嵌套维度引入 Mamba2、联合训练多种规模子模型的机制,并核对弹性推理的性能—计算开销权衡;摘要尚不足以验证实际加速幅度或 EEG 适用性。

9月26日周四
  1. OpenReview · State space models73

    DyGMamba:利用状态空间模型高效建模连续时间动态图的长期时间依赖

    DyGMamba 面向连续时间动态图(CTDG)的表示学习,尝试同时解决长节点交互历史的计算开销与关键时间信息筛选问题,核心贡献是将 Mamba 状态空间模型(SSM)用于节点历史编码和时间模式驱动的信息选择。以下基于摘要分析,未取得论文全文。 机制上,节点级 SSM 首先编码历史节点交互序列;时间级 SSM 随后提取历史图中的时间模式,其输出用于动态选择交互历史中的关键信息。摘要描述的设计重点不只是扩大历史窗口,而是让时间模式参与信息筛选。具体输入表示、两个 SSM 的连接方式、选择操作、损失函数及训练流程尚未验证。 作者在动态链接预测任务上进行评估,并报告 DyGMamba 在多数情形下达到当时最优表现,同时保持较高的计算资源效率,使有限计算预算下的长时间依赖建模成为可能。摘要未提供数据集、划分协议、基线、指标数值或资源测量口径,因此不能量化其性能与效率优势;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若将 EEG 通道或脑区表示为节点、将带时间戳的连接变化表示为交互,该机制可能用于筛选长时程连接历史中的任务相关信息。此迁移假设依赖于 EEG 能否形成有意义的交互事件,而不是直接将原始波形视为动态图。可复用部分是历史序列编码和时间模式驱动的选择模块;需改造的是节点定义、连接估计、事件构造与任务输出。低信噪比可能产生伪交互,跨被试及通道差异可能破坏事件语义,小数据也可能使选择机制过拟合。一个可证伪的小实验是在固定 EEG 数据与跨被试划分下,以相同连接构造和历史窗口比较完整机制与不使用时间级选择的对照,同时记录任务指标及资源开销。上述仅为迁移假设,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其利用节点级与时间级 SSM 编码长交互历史并动态选择关键信息的机制,但动态图预测收益及其向 EEG 时变连接建模迁移的有效性仍需核对实验与验证。

  2. OpenReview · Representation learning76

    DenoiseRep:用于表征学习的去噪模型

    基于摘要分析。DenoiseRep 研究如何将去噪机制用于判别任务的表征学习,通过联合特征提取与去噪提升特征的判别能力。其核心贡献是将骨干网络中的各嵌入层视为逐步去噪层,并通过参数融合消除独立去噪计算。 机制上,作者将从低层到高层的级联特征提取,与递归、逐步的特征去噪统一起来。作者称,特征提取层与去噪层的参数可以融合,并给出了融合前后等价性的理论论证,据此主张特征去噪无需额外计算。摘要未说明去噪目标、噪声构造、损失形式、训练流程或参数融合的适用条件,这些内容尚需全文核对。该方法被描述为无需标签,也可与可用标签互补;这不等于所有下游任务的训练均不使用标签。 作者报告,在重识别数据集 Market-1501、DukeMTMC-reID、MSMT17、CUHK-03、vehicleID,图像分类数据集 ImageNet、UB200、Oxford-Pet、Flowers,以及 COCO 目标检测和 ADE20K 图像分割任务上观察到稳定的改进,并在 ResNet、ViT、Swin、Vmamda 架构上验证有效性。摘要未提供具体指标、数值、数据划分或对照基线,无法据此判断收益大小及不同任务间的可比性;实验协议、消融及统计信息尚未验证。复现还需核对融合实现、训练配置及代码可得性。 平台推测(待验证):若逐层去噪确实能够保留判别信息,并且融合条件适用于 EEG 编码器,该机制可能用于缓解 EEG 表征中的噪声干扰。可复用部分是逐层特征去噪与参数融合思路;需改造部分包括时序与通道特征处理、噪声定义及下游监督方式。视觉数据上的结果不能证明其适用于低信噪比、跨被试或小样本 EEG;去噪可能误删弱任务信号,通道变化也可能破坏特征假设。一个可检验的小实验是在固定跨被试划分下,对比同一 EEG 骨干加入与不加入 DenoiseRep 的表现,同时检查融合前后输出一致性及推理开销。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其特征提取与去噪层参数融合的等价性条件,以及无需标签的特征增强能否在不增加推理计算的前提下稳定改善判别任务;向 EEG 迁移的有效性尚未验证。

  3. OpenReview · State space models74

    Multi-Scale VMamba:层级内嵌层级的视觉状态空间模型

    基于摘要分析。研究针对视觉 State Space Models(SSMs)中多扫描策略带来的冗余,提出 Multi-Scale Vision Mamba(MSVMamba),通过多尺度二维扫描与通道混合模块改善效率和性能之间的权衡。 核心机制:作者分析认为,长程依赖是多扫描策略有效的重要原因。MSVMamba 在原始及下采样特征图上进行多尺度二维扫描,旨在保留长程依赖学习能力并降低计算成本;同时引入 Convolutional Feed-Forward Network(ConvFFN),补充通道混合。摘要未给出具体扫描路径、下采样配置、模块结构、损失或参数量,相关细节尚未验证。 作者报告:MSVMamba-Tiny 在 ImageNet 上取得 83.0% top-1 Accuracy;在 COCO 上,采用 Mask R-CNN 框架及 1x 训练日程,取得 46.9% box mAP 和 42.5% instance mAP;在 ADE20K 上采用单尺度测试,取得 47.9% mIoU。摘要未提供具体对照结果或实测计算开销,不能据此确认相对优势幅度。实验协议、消融及统计信息尚未验证。材料提供了代码仓库,但实现与复现条件尚未核对。 平台推测(待验证):迁移假设是,多尺度扫描可能用于 EEG 的长短时程依赖建模,缓解长序列计算负担,但原方法依赖视觉二维特征图,不能直接等同于 EEG 通道与时间结构。可考虑复用 SSM 和多尺度处理思路,改造扫描顺序、下采样方式及通道混合模块。风险包括下采样丢失短暂 ERP 或高频信息、空间邻接不匹配,以及跨被试、通道变化和小数据条件下泛化不足。一个可证伪的小实验是在固定 EEG 任务与跨被试划分下,对比单尺度与多尺度扫描,控制参数量和训练预算,同时记录任务指标、延迟及短时事件识别表现。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其多尺度扫描能否在保留长程依赖建模能力的同时降低计算开销,以及 ConvFFN 的独立贡献;摘要提供了多任务结果,但效率收益与消融证据尚未验证。

  4. OpenReview · State space models79

    VMamba:视觉状态空间模型

    基于摘要分析。该研究针对计算机视觉网络的计算效率问题,将状态空间语言模型 Mamba 改造为视觉骨干 VMamba,提出通过二维扫描聚合上下文信息的架构,并以线性时间复杂度为设计特征。 核心机制是由 Visual State-Space(VSS)块构成网络,并在其中使用 2D Selective Scan(SS2D)模块。SS2D 沿四条扫描路径遍历二维数据,以衔接一维 selective scan 的有序处理方式与二维视觉数据的非序列结构,从不同方向收集上下文信息。作者据此构建一组 VMamba 架构,并通过架构及实现层面的优化加速;具体扫描顺序、网络配置、训练损失及优化细节尚未验证。 作者报告,VMamba 在多种视觉感知任务中表现良好,相较所比较的基准模型具有更好的输入规模扩展效率。摘要未提供具体任务、数据集、指标数值、对照模型或计算成本测量条件,因此尚不能核对性能与效率之间的权衡。实验协议、消融及统计信息尚未验证。摘要提供了源码仓库,但代码与论文实验的一致性、运行环境及复现成本仍需核对。 平台推测(待验证):迁移假设是,将 SS2D 用于 EEG 的通道×时间表示,可能为长时间窗与跨通道上下文建模提供一种计算效率较高的路径;这不是已验证的 EEG/BCI 结果。原方法依赖具有二维组织结构的视觉输入,而 EEG 通道顺序不天然等同于规则图像网格,需改造通道排列、空间编码及输入适配模块。低信噪比、跨被试分布变化、通道配置差异和小数据训练可能使视觉扫描机制失效。可检验的小实验是在同一 EEG 数据集、固定 Cross-subject 划分及训练预算下,对比二维扫描与一维时间扫描,并扰动通道排列,检验收益是否依赖人为顺序,同时测量不同时间窗长度下的运行成本。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其用四条扫描路径将一维 selective scan 适配二维视觉数据的机制及输入规模扩展效率评估,但该机制对 EEG 的适用性尚未验证。

9月18日周三
  1. OpenReview · State space models78

    状态空间模型的参数高效微调

    基于摘要分析。本文研究 Mamba 等深度状态空间模型(SSMs)的参数高效微调(PEFT),重点比较现有方法的适用性及微调模块的选择,并提出 LoRA with Selective Dimension tuning(SDLoRA),将线性投影矩阵上的 LoRA 与 SSM 模块中部分通道和状态的选择性更新结合。 作者报告,在 SSM 模型上对四种基本 PEFT 方法进行经验评估后,prompt-based 方法(如 prefix-tuning)效果不佳,理论分析也支持这一观察;相比之下,LoRA 仍然有效。针对 LoRA 的应用位置,作者报告,理论与实验均支持仅将 LoRA 应用于线性投影矩阵、而不修改 SSM 模块的配置效果最好,直接以 LoRA 微调 SSM 模块则效果不佳。SDLoRA 并非在 SSM 模块中简单增加 LoRA,而是对其中部分通道和状态进行选择性更新,同时保留投影矩阵上的 LoRA。作者报告,该组合优于标准 LoRA,但摘要未提供具体任务、数据集、指标或增益幅度。 需核对的关键细节包括:四种 PEFT 方法的完整设置、通道与状态的选择规则、可训练参数预算及其匹配方式,以及理论结论的适用条件。实验协议、消融及统计信息尚未验证,不能据此判断其在不同模型规模或任务上的普适性。 平台推测(待验证):若已有预训练 EEG SSM 编码器,该机制可能用于缓解跨被试适配中训练样本有限、全量微调成本较高的问题。可复用的是投影矩阵 LoRA 和 SSM 维度选择性更新的思路;需改造的是 EEG 输入映射、任务输出头及维度选择策略。其原始论证背景为语言建模中的 SSM,摘要未说明依赖的预训练规模或下游监督条件;低信噪比、通道配置变化和个体差异可能使所选维度不稳定。一个可证伪的小实验是在固定预训练编码器和 Cross-subject 划分下,以匹配的可训练参数预算比较投影矩阵 LoRA 与 SDLoRA,并检查多次运行的稳定性。已有 EEG 相关工作尚未检索确认。

    阅读价值:该研究通过经验比较与理论分析区分 SSM 模块和线性投影矩阵的微调适用性,为复现 Mamba 类模型的 PEFT 提供了具体切入点,但实验协议与性能增益尚待全文核对。

7月10日周三
  1. OpenReview · State space models78

    MambaByte:无分词的选择性状态空间模型

    基于摘要分析。MambaByte 研究直接从原始字节学习的 token-free 语言建模:去除子词分词的归纳偏置,却也使序列显著变长。其核心贡献是将 Mamba 状态空间模型(SSM)适配为在字节序列上自回归训练的语言模型,并设计结合 tokenized drafting 与 byte-level verification 的推测解码方案。 机制上,摘要将标准自回归 Transformer 随序列长度增长的有效内存需求,与 Mamba 的固定大小记忆状态和高效解码进行对比。MambaByte 利用后者应对字节级长序列;解码阶段由分词模型生成草稿,再进行字节级验证。具体状态更新、训练损失、草稿模型配置与验证规则尚未验证。 作者报告,在语言建模任务上,MambaByte 可与先进的子词 Transformer 竞争,部分比较中甚至表现更好,同时保留 token-free 模型对噪声的鲁棒性。作者报告,相对于标准 MambaByte 实现,其推测解码方案实现 2.6× 推理加速,解码效率接近子词 Mamba。摘要未提供数据集、模型规模、性能指标、硬件、批量大小及序列长度,因此这些效果与速度结论的适用范围,以及实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,固定大小状态的序列处理机制可能缓解长时程 EEG 建模的计算与内存压力,但原任务依赖离散字节及自回归监督,并不等价于连续、多通道 EEG。可考察复用 SSM 序列模块,输入表示、通道融合与任务输出需改造;字节级验证方案不能直接照搬。低信噪比、跨被试差异、通道变化与小数据训练可能削弱收益。一个可证伪的小实验是在同一 EEG 数据划分与匹配训练预算下,对比 SSM 与 Transformer 随输入时长变化的任务性能、峰值内存及推理耗时;仅降低资源消耗不能证明解码效果改善。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其以固定大小状态处理长字节序列、并结合 tokenized drafting 与 byte-level verification 加速解码的机制,但语言建模效果与效率结论仍需核对全文实验协议。