跳到正文

研究类型与证据

潜在迁移 最新动态

潜在迁移 研究索引;按可核对的标签归档,不以热度评价质量。

77 条精选近 30 天 43 条共收录 93 条

更新

精选归档 · 第 3 页

9月18日周五第 41–60 条
  1. OpenReview · State space models79

    输入变异性对选择性状态空间模型中长期依赖的影响

    基于摘要分析。研究考察选择性状态空间模型 S6 中,输入变异性如何影响长期依赖,并据此提出基于 Gumbel-Softmax trick 的初始化方法,在不修改模型架构的前提下改善长期信息保持。 核心机制:Mamba 通过输入依赖的 S6 机制建模时变动态,同时保留并行计算能力。作者指出,相比输入无关的 S4、S5,Mamba 在需要不受后续输入影响、持续保留先前信息的长序列任务上可能表现较弱。作者的分析表明,较大的输入方差可能使先前信息更难长期保留,因此离散化状态矩阵在初始化时应包含接近 1 的值。作者进一步指出,在标准 Mamba 初始化下,增大状态维度会使该矩阵的取值分布向接近 0 的区域偏移,却不增加接近 1 的值所占比例。所提方案针对这一分布问题调整初始化,而非增加网络结构;具体参数化、推导假设及训练设置尚未验证。 结果与证据边界:作者报告,在合成任务和 LRA 任务上验证了推导出的初始化性质;新初始化改善了需要跨越长序列、独立于后续输入保留先前信息的任务表现,同时在上下文依赖任务上保持相当表现。摘要未提供具体任务配置、数据划分、对照设置或指标数值,实验协议、消融及统计信息尚未验证,不能据此认定其在所有长序列任务上均优于标准 Mamba。 平台推测(待验证):迁移假设是,EEG 中随时间变化的输入方差可能影响选择性状态更新对早期信息的保留,但原领域结果不等于 BCI 效果。可复用初始化策略,需适配 EEG 输入编码、归一化和序列长度;低信噪比、通道尺度差异及跨被试变化可能改变机制表现,增强记忆也可能保留无关噪声。可在固定被试内划分、相同 Mamba 架构与训练配置下,对比标准初始化和所提初始化,并改变早期任务相关片段之后的噪声强度,检验性能退化与状态保持是否同步变化。已有 EEG 相关工作尚未检索确认。

    阅读价值:该研究将 Mamba 的长期信息保持问题具体关联到输入方差与离散化状态矩阵的初始化分布,并提出无需修改架构的初始化方案,值得核对其理论适用条件及长序列任务上的复现效果。

  2. OpenReview · Representation learning74

    SpecMRL:在参数谱空间中重新设计 Matryoshka Representation Learning

    基于摘要分析。该研究针对 Matryoshka Representation Learning(MRL)联合优化嵌套前缀、却缺乏显式约束确保前部特征形成有效紧凑编码的问题,提出 SpecMRL:引入由参数导出、按特征重要性组织的谱基,在学习到的谱空间中读取前缀,以改善可变维度表示的压缩效果。 机制上,SpecMRL 的主要变化是重组表示空间,而非替换 MRL 的整体训练框架。摘要称其余部分沿用标准 MRL,但未说明谱基由哪些参数构造、重要性如何度量,以及谱基的学习与更新方式;具体损失、训练开销和推理成本尚未验证。因此,其可核对的创新点是前缀读取坐标系与信息排序机制,而不是摘要未提供的网络结构。 作者报告,在 MTEB 上,SpecMRL 在所有已评估的降维设置中均优于 MRL,且压缩越强,收益越大;作者还报告,仅使用一半嵌入维度即可超过全维 MRL。摘要未提供具体任务、指标、分数、原始维度及数据划分,不能据此判断收益幅度或各任务的一致性。实验协议、消融及统计信息尚未验证,复现需进一步核对模型、训练数据、维度设置和基线条件。 平台推测(待验证):若 EEG 表示需要按存储或推理预算截取维度,按重要性组织谱方向可能缓解直接截取前缀时的信息损失。该假设依赖可学习的向量表示、参数谱结构及足以稳定估计重要性的训练数据;可复用谱空间重组与前缀读取思路,但需适配 EEG 编码器、任务监督和跨被试分布变化。低信噪比、小数据及通道差异可能使重要方向不稳定,或优先保留被试特异信息。一个可检验的小实验是在固定 EEG 编码器、数据划分和训练预算下,对比标准 MRL 与谱空间前缀读取在多个压缩维度下的表现,并分别评估被试内与跨被试协议。已有 EEG 相关工作尚未检索确认,以上并非已验证的 BCI 效果。

    阅读价值:值得核对参数导出的谱基如何改善嵌套前缀的信息排序,以及作者报告的半维嵌入优于全维 MRL 是否在相同训练与评估条件下成立。

9月17日周四
  1. OpenReview · Representation learning76

    面向无监督域适应的联合对比—对抗表征学习

    基于摘要分析。本文研究无监督域适应如何同时利用有标签源域与无标签目标域中的可迁移结构,提出 Joint Contrastive-Adversarial Representation Learning(JCAR),通过两阶段训练将共同表征学习与下游监督预测分离,并分析其非渐近超额风险。 机制上,第一阶段合并源域与目标域样本,在不使用标签的表征学习中结合对比学习和对抗式域对齐;第二阶段冻结表征,仅以源域标签拟合预测器。摘要未说明对比样本构造、具体损失、网络架构或训练调度,这些实现细节尚未验证。 理论上,作者给出的风险界耦合表征与域判别器的估计误差,同时将下游预测误差分离,并显式纳入神经网络逼近误差。在论文所述假设、共同 Hölder 平滑度 β≥1 且无标签样本足够多的条件下,作者报告下游收敛率为 Õ(m^{-β/(2β+d)}),其中 m 为有标签源域样本数,d 为潜在维度,省略对数因子;环境维度 p 则进入预训练成本。该结论是条件性理论结果,不能直接等同于任意域偏移下的泛化保证。 实验方面,作者报告在 Office-31、Office-Home 和 DomainNet 上获得迁移收益,尤其是在从零学习表征时表现较强。具体迁移方向、数据划分、对照基线、指标数值、消融及统计信息尚未验证,尚不能量化收益或比较不同协议。 平台推测(待验证):其潜在 EEG 迁移路径是假设跨被试或跨会话数据存在共同低维任务结构,以目标域无标签 EEG 辅助学习表征,再冻结表征训练源域预测器。两阶段流程与域判别器思路可能复用,但 EEG 编码器、对比增强及正负样本构造需适配时序和通道结构。低信噪比、通道差异、小数据及任务相关的被试差异可能导致错误对齐。可在固定 Cross-subject 划分下,比较源域监督、仅对比学习与联合对比—对抗学习,确保目标测试标签不参与训练,并观察收益是否随目标域无标签样本量变化。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的具体原因是 JCAR 将联合无标签表征学习与源域监督预测分开,并给出关联表征及域判别器估计误差的风险界,可用于核对无标签数据规模与潜在维度如何影响域适应的样本效率。

9月8日周二
  1. OpenReview · State space models73

    视觉状态空间模型的选择性操作量化

    基于摘要分析。该研究面向视觉 State Space Models(SSMs)在资源受限边缘设备上的部署,提出训练后量化(Post-Training Quantization,PTQ)方法 SELective Operation Quantization(SELOQ),重点解决选择性操作中特殊激活分布造成的量化困难。 核心机制是针对不同量化对象分别处理:作者分析指出,离散参数的分布具有长尾偏斜,隐藏状态序列则具有高度动态的变化;据此设计 Long-tailed Skewness Quantization(LtSQ)量化离散参数,以及 Temporal Scale Quantization(TSQ)量化隐藏状态,以降低量化误差。摘要未提供具体量化公式、位宽、尺度计算方式或校准数据要求,不能据此判断其实现开销与适用边界。 作者报告,在多个视觉任务、模型规模与架构上,SELOQ 对量化视觉 SSMs 的表现显著优于现有方法。摘要未列出任务与数据集名称、评估指标、具体数值及对照基线,因此尚不能量化收益,也不能将任务表现直接等同于真实设备上的加速或能耗改善;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若用于 EEG 的 SSM 同样出现离散参数长尾偏斜与隐藏状态尺度随时间变化,SELOQ 的分对象量化思路可能有助于边缘部署,但视觉模型中的有效性不等于 EEG/BCI 有效性。可复用的是 LtSQ 与 TSQ 的设计思路,需改造和核对的是 EEG 模型中的选择性操作实现、时间维度及校准数据覆盖。低信噪比、跨被试或通道变化可能使校准分布失配,小数据条件也可能难以覆盖隐藏状态变化。一个可检验的小实验是:在已有 EEG SSM 上固定数据划分、量化位宽与校准样本,对比常规 PTQ、分别加入 LtSQ 或 TSQ、以及两者组合,检查量化误差与原任务指标,并独立测量设备延迟。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其针对离散参数长尾偏斜与隐藏状态时序变化分别设计量化策略的机制,但性能收益、部署成本及向 EEG 模型迁移的有效性仍需核对。

1月26日周一
  1. OpenReview · Representation learning73

    通过调制表征学习提升开放集识别性能

    基于摘要分析。研究针对开放集识别(OSR)中识别训练类别之外新语义类别的问题,提出以动态温度调度替代固定 logits 温度,使表征学习在实例级特征与类别特异性特征之间逐步转换;其中包括作者提出的 negative cosine schedule。 机制上,作者描述调度在训练初期侧重较少邻居以形成粗略决策边界,随后逐渐关注更多邻居以平滑边界,期望获得更丰富、泛化能力更强的表征。摘要未给出温度函数、取值范围、邻居定义及其与各损失的具体作用关系,这些实现细节尚未验证。与引入正则化或 mix-up 等辅助负样本的路径相比,作者称该调度可并入现有 OSR 损失且不增加计算开销;开销核算范围仍需正文确认。 作者报告,在采用 cross-entropy、contrastive 和 ARPL 损失的多个基线上,新调度在多数情况下同时改善开放集与闭集性能,尤其在更困难的 semantic shift benchmarks 上。摘要未提供数据集、已知类与未知类划分、评价指标或具体数值,因此不能判断提升幅度,也不能比较不同协议下的效果;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 任务需要拒识训练中未覆盖的语义类别,动态温度可能用于调节表征的局部区分与类内聚合。可复用的是温度调度,需改造的是 EEG 编码器、邻居构造及未知类评估协议;低信噪比、小样本和跨被试差异可能使邻居关系不可靠,并将被试偏移误判为新类别。一个可检验的小实验是在固定 EEG 编码器、损失和类别留出划分下比较固定温度与该调度,分别评估已知类分类和未知类拒识,并核对训练开销。该迁移假设尚无材料内的 EEG 证据,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对温度调度能否作为不同 OSR 损失的低成本改造提升未知类识别,尤其需复现作者报告的语义偏移场景收益及闭集性能变化。

12月31日周三
  1. OpenReview · State space models75

    基于状态空间的语言模型的可控性分析

    基于摘要分析。该研究针对 Mamba 等状态空间模型(SSMs)内部动态难以解释的问题,提出基于可控性的 Influence Score,用于衡量位置 k 的 token 对后续状态和输出的影响,并通过不同 Mamba 变体的诊断实验考察其表现。 机制上,Influence Score 由 Mamba 的离散状态空间参数导出,通过类似系统可观测性分析的反向递推计算。它提供的是内部影响强度的诊断视角,而非摘要中已证明的任务性能或因果贡献指标;具体定义、计算代价及状态影响与输出影响的关系尚需全文核对。 作者在 mamba-130m、mamba-2.8b 和 mamba-2.8b-slimpj 上开展六类实验,分别考察温度、提示复杂度、token 类型、层深、token 位置和输入扰动。作者报告:在这些模型与实验条件下,Influence Score 随模型规模和训练数据增加而提高;模型呈现近因偏置,影响集中于中后层;在所比较变体中,mamba-2.8b-slimpj 特有地更重视内容词,并在噪声存在时降低内部影响。摘要未提供定量分数、样本构成及统计不确定性,规模与训练数据效应是否被独立区分,以及实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 序列模型采用可访问离散状态空间参数的 Mamba,该递推诊断机制或可用于分析不同时间片对后续状态与任务输出的影响。可复用部分是参数驱动的影响计算;需改造部分包括 EEG 时间片或通道的 token 化方式、输出定义及跨被试比较中的尺度校准。低信噪比可能使内部影响反映伪迹而非有效神经信息,被试差异、通道配置和小数据训练也可能削弱解释稳定性。一个可证伪的小实验是在固定被试内划分的 EEG Mamba 模型上,比较高、低 Influence Score 时间片受等强度扰动后的输出变化,检验分数能否预测扰动敏感性;这不等同于验证生理因果性。已有 EEG 相关工作尚未检索确认。复现语言模型结果仍需核对分数公式、层间汇总方式、提示与扰动设置及实现材料。

    阅读价值:值得阅读的具体原因是作者提出了可从 Mamba 离散状态空间参数计算的 token 影响诊断指标,可用于核查位置与层深相关的内部动态,但其解释效度及向 EEG 的迁移价值尚未验证。

11月6日周四
  1. OpenReview · State space models70

    RPCASSM:用于红外小目标检测的鲁棒主成分分析状态空间模型

    基于摘要分析。该研究针对远距离红外成像中小目标占比低、主流视觉状态空间模型难以准确建模目标边缘的问题,提出基于鲁棒主成分分析(RPCA)范式的 RPCASSM,分别设计背景状态空间模块(BSSM)与目标状态空间模块(TSSM)。核心贡献是依据红外小目标的空间结构特性定制扫描机制,而非直接沿用主流视觉状态空间框架。 机制方面,BSSM 利用空间异质信号的显著性,通过空间探针扫描机制(SPCM)建模背景信息;TSSM 利用目标的稀疏性与局部高亮特征,通过可变形提示扫描机制(DPCM)聚焦目标的可变形空间。摘要将该设计与 RPCA 范式关联,但具体分解形式、模块耦合方式、损失函数及训练和推理流程尚未验证,不能据此认定网络显式求解了某种 RPCA 优化目标。 作者报告,在现有基准数据集上的实验支持 RPCASSM 设计的有效性,并称其改善了红外小目标边缘结构的建模。摘要未提供数据集名称、划分协议、对照基线或定量指标,因此目前无法判断收益幅度及适用范围;实验协议、消融及统计信息尚未验证。 平台推测(待验证):其背景与稀疏局部目标分开建模的机制,可能启发 EEG 中背景活动与短暂事件的分离,但这是迁移假设,不是已证实的 BCI 效果。该方法依赖图像中的空间异质性、目标稀疏性和局部高亮,而 EEG 事件未必稀疏或高幅,电极邻接结构也不同于图像网格。可复用的是分模块建模思路,扫描路径与可变形提示机制则需适配时间轴及通道拓扑;低信噪比、伪迹高幅响应、跨被试差异和小数据训练均可能导致失败。一个可证伪的小实验是在固定 EEG 数据划分和相同训练条件下,比较通用状态空间模型与适配后的双模块模型,检验事件检出及时间定位是否改善,并核对是否增加伪迹误检。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其依据背景与稀疏目标结构分别设计状态空间扫描机制的思路,但边缘建模收益及相对基线的有效性仍需核对全文实验。

9月19日周五
  1. OpenReview · Representation learning75

    基于测度论的反因果表示学习

    基于摘要分析。本文研究标签导致特征、而非特征导致标签的反因果表示学习问题,提出测度论框架 Anti-Causal Invariant Abstractions(ACIA),旨在学习能跨环境变化保持稳定的表示,并为分布外泛化提供理论保证。 核心机制是两级表示:低层表示刻画标签如何生成观测,高层表示学习环境特异变化下的稳定因果模式。作者称,ACIA 通过干预核容纳完美与不完美干预,不依赖显式因果结构,并可处理高维数据。摘要未给出两级表示的具体实现、优化目标、训练流程,以及干预核所需的监督和环境信息,这些条件尚未验证。 作者报告,在合成数据和真实医学数据上的实验中,ACIA 在 Accuracy 与不变性指标方面优于其所比较的方法;但摘要未提供数据集名称、划分协议、基线、指标定义或具体数值,无法判断优势大小及适用范围。作者还报告训练环境与未见环境之间性能差距的紧界,其成立假设、界的形式及与实验的对应关系需查阅全文。实验协议、消融及统计信息尚未验证。摘要提供了代码地址,但代码内容、运行条件和结果可复现性尚未核验。 平台推测(待验证):若 EEG 任务可合理建模为任务标签影响观测信号,而被试或会话引入环境变化,ACIA 的低层生成关系与高层不变性设计可能对应跨被试、跨会话分布偏移。该迁移依赖反因果假设及环境信息是否成立;可研究复用两级抽象和干预核思想,但 EEG 时序编码、通道对齐及环境定义需改造。低信噪比、小样本和被试生理差异可能使稳定因素难以识别,或使不变性约束压制有效判别信息。一个可检验的小实验是在同一 EEG 数据集固定跨被试划分与编码器,比较加入 ACIA 机制前后的留出被试 Accuracy 及预先定义的不变性指标,所有模型选择仅使用训练被试。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 ACIA 如何通过干预核与两级表示定义跨环境不变性,以及其泛化界的适用假设;这些机制为 EEG 域泛化提供了可研究的思路,但迁移有效性尚未验证。

9月15日周一
  1. OpenReview · State space models75

    SF-Mamba:重新思考面向视觉的状态空间模型

    基于摘要分析。该研究针对视觉 Mamba 中单向递归扫描限制图像 patch 非因果交互、多扫描策略引入数据重排开销,以及短 token 序列下计算速度较慢的问题,提出视觉编码器 SF-Mamba,试图同时改善信息交互与计算效率。 核心机制包括两项设计:通过辅助 patch 交换,在单向扫描下编码双向信息流;通过 batch folding 与周期性状态重置,提升 GPU 并行性。摘要未给出 patch 交换规则、batch folding 的具体张量组织、状态重置周期及其对上下文保留的影响,因此这些实现细节尚未验证。其创新重点是重新设计扫描与执行方式,而非仅增加扫描方向。 作者报告,在图像分类、目标检测、实例分割和语义分割实验中,SF-Mamba 相比作者所称的最先进基线取得更好的任务表现,并在不同模型规模下提高吞吐量。摘要未提供数据集、指标数值、基线名称、硬件、batch size 或吞吐量测量条件,无法据此量化收益或判断公平比较;实验协议、消融及统计信息尚未验证。材料称代码将在发表后发布,当前代码可用性与论文发表状态不能由此推定。 平台推测(待验证):该方法原本依赖图像 patch 序列及 GPU 批处理结构,其扫描效率设计可能为短序列 EEG 编码提供参考,但不构成已验证的 BCI 效果。迁移假设是,辅助 token 交换能够改善 EEG 时间窗或通道 token 的信息交互;需改造 patch/token 构造与交换规则,并检查周期性状态重置是否损失跨窗依赖。低信噪比、跨被试差异、通道排列变化及小数据训练可能削弱收益。可在固定 EEG 数据划分与同一硬件、batch size 下,对照普通单向扫描,分别加入交换和状态重置,比较任务指标与吞吐量;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 SF-Mamba 如何以辅助 patch 交换和周期性状态重置兼顾信息交互与 GPU 吞吐量,但其相对基线的效果及迁移至 EEG 的适用性尚未验证。

7月8日周二
  1. OpenReview · State space models71

    MS-SSM:用于高效序列建模的多尺度状态空间模型

    基于摘要分析。MS-SSM 针对传统状态空间模型(SSM)有效记忆受限、难以同时捕获多尺度依赖的问题,将序列动态表示在多个分辨率上,并为各分辨率配置专门的状态空间动力学;同时引入输入依赖的 scale-mixer,动态融合不同分辨率的信息。 核心机制是同时建模细粒度高频模式与粗粒度全局趋势,以改善记忆效率和长程建模。相较于摘要所述依赖扩大状态尺寸来提升召回能力的传统 SSM,本文侧重多分辨率处理与动态跨尺度融合。分辨率如何构造、各尺度状态如何更新、scale-mixer 的具体形式,以及训练目标、稳定性约束和复杂度尚未验证。 作者报告,在包括 Long Range Arena、hierarchical reasoning、time series classification 和 image recognition 的基准实验中,MS-SSM 持续优于此前的 SSM 模型,并保持计算效率。摘要未提供具体分数、数据划分、对照模型配置或效率测量条件,因此无法判断提升幅度及性能与成本的权衡;实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设多尺度机制能区分 EEG 的局部快速变化与较慢的时序背景,其可能缓解长序列建模中的记忆压缩瓶颈,但原领域结果不等于 EEG/BCI 有效。可尝试复用多尺度状态动态与 scale-mixer,需按采样率和目标信号调整分辨率构造,并适配多通道输入。低信噪比可能使动态融合追随伪迹,降采样可能损失任务相关信息,跨被试差异与小数据也可能限制泛化。一个可检验的小实验是在固定 EEG 任务和相同 Cross-subject 划分下,对比单尺度 SSM、多尺度但固定融合、完整 MS-SSM,并控制参数量与训练预算,联合检查任务指标、推理成本和噪声扰动下的稳定性。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对多分辨率状态空间动力学与输入依赖 scale-mixer 能否在计算成本可比时改善长程记忆,以及各模块对性能的独立贡献;其 EEG 迁移价值尚未验证。

5月1日周四
  1. OpenReview · State space models72

    状态空间模型的参数高效微调

    基于摘要分析。本文研究 Mamba 等深度状态空间模型(SSMs)的参数高效微调(PEFT),重点考察既有方法的表现及应调节的参数位置,并提出面向 SSM 模块的 Sparse Dimension Tuning(SDT),与用于线性投影矩阵的 LoRA 组合。 作者报告,LoRA 及其变体在所开展的比较中持续优于其他 PEFT 方法,但效果依赖于目标参数:LoRA 对线性投影矩阵有效,在 SSM 模块上则未奏效,尽管仍优于其他适用于 SSM 的方法。这里的关键研究问题是不同模块是否需要不同的微调机制,而非将同一种低秩更新统一施加到所有参数。摘要未说明 SDT 如何选择稀疏维度、更新哪些参数,以及其训练目标与参数预算。 作者报告,SDT 与 LoRA 的组合在广泛实验中达到最先进性能;但摘要未提供任务、数据集、模型规模、数据划分、对照基线或指标数值,因此尚不能判断优势的适用范围。实验协议、消融及统计信息尚未验证,复现还需核对 SDT 的实现、训练配置与各方法的可训练参数预算。 平台推测(待验证):若 EEG 任务采用预训练 SSM,该模块分工式微调可能对应小数据条件下全量微调成本高、易过拟合的问题。可复用的是 SSM 模块使用 SDT、线性投影使用 LoRA 的适配思路;EEG 的通道输入、时间采样与任务输出仍需改造。原研究面向语言建模背景,具体预训练数据结构、监督方式与规模尚未验证,不能据此推定 EEG 效果。低信噪比、跨被试差异及通道变化可能使稀疏维度选择不稳定。一个可检验的小实验是在固定 EEG 预训练 SSM 和 Cross-subject 划分下,以匹配的可训练参数预算比较 LoRA 与 SDT+LoRA,并检查多次运行的性能与稳定性。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其针对 SSM 模块与线性投影矩阵分别选择微调方法的分析,但 SDT 的具体机制及其相对 LoRA 的收益仍需全文核对。

1月23日周四
  1. OpenReview · State space models81

    振荡状态空间模型

    基于摘要分析。研究针对长序列学习中的计算效率、动力学稳定性与长程依赖建模问题,提出 Linear Oscillatory State-Space models(LinOSS),以受迫谐振子系统构建状态空间模型,并通过稳定离散化及快速关联并行扫描实现序列计算。 核心机制与理论:作者以生物神经网络的皮层动力学为启发,报告证明 LinOSS 在对角状态矩阵非负的条件下可产生稳定动力学,并将这一条件与既有状态空间模型的限制性参数化作对照。作者还报告其通用逼近能力,即可按所需精度逼近时变函数之间的连续因果算子;一种隐式—显式离散化则保持底层动力学的时间可逆对称性。上述结论的完整假设、适用范围及证明细节尚未验证,不能直接等同于任意任务上的预测准确性保证。 实验结果:作者报告在中等至超长序列分类、回归及长时域预测任务上优于所比较的先进序列模型;其中,在序列长度为 50k 的一项序列建模任务中,相对 Mamba 和 LRU 的表现接近两倍。摘要未明确该倍数对应的指标、数据集、划分与训练预算,因此不能解释为 Accuracy 翻倍或计算加速。实验协议、消融及统计信息尚未验证;模型规模、预处理与复现资源也需查阅全文。 平台推测(待验证):迁移假设是,振荡状态与稳定长程演化可能有助于 EEG 的节律及长时间上下文建模,但原领域有效不等于 BCI 有效。可考虑复用状态更新与并行扫描,需改造多通道输入及任务读出;低信噪比、非平稳性、被试差异、通道变化和小数据规模均可能削弱收益。可检验的小实验是在固定 EEG 数据划分、预处理及训练预算下,对比 LinOSS、Mamba 与 LRU,分别报告被试内和跨被试的同一任务指标,并考察序列长度变化是否带来稳定收益。已有 EEG 相关工作尚未检索确认。

    阅读价值:LinOSS 将受迫谐振子、稳定离散化与并行扫描结合,值得核对其稳定性条件及长序列建模收益,但摘要中的性能倍数尚需结合具体指标与评估协议验证。

  2. OpenReview · State space models78

    HOPE:长记忆状态空间模型的稳健参数化

    基于摘要分析。本文研究基于线性时不变(LTI)系统的状态空间模型(SSM)为何依赖专门设计的初始化,以及状态矩阵在对数尺度上以很小学习率训练的做法,并提出基于 Hankel operator 理论的参数化方案 HOPE,旨在改善初始化与训练稳定性。 机制上,HOPE 利用 Hankel operators 中的 Markov parameters 对 LTI 系统进行参数化,并通过对 LTI 系统传递函数进行非均匀采样实现高效计算。作者报告,该方案相较于常规 SSM 使用更少参数,并改善训练稳定性。摘要未给出具体参数化公式、采样策略、损失形式或参数量,相关实现条件尚未验证。 实验方面,作者报告,在 Long-Range Arena(LRA)任务上,基于 Hankel operators 参数化的 SSM 相较于采用 HiPPO 初始化的 S4、S4D 表现更好;摘要未提供具体任务分项、指标、数据划分及数值。作者还报告,该参数化具有固定时间窗内不衰减的记忆,并以加入填充噪声的 sequential CIFAR-10 任务提供经验支持。这不等同于无限时长记忆,也不能直接外推为生理信号中的抗噪能力。实验协议、消融及统计信息尚未验证。 平台推测(待验证):其迁移假设是,若 EEG 任务依赖较长时间跨度的有效信息,HOPE 的记忆参数化可能有助于降低长序列训练对初始化的敏感性。原方法依赖时序输入与 LTI 动态建模;迁移时可复用参数化及传递函数采样机制,但需适配多通道 EEG 输入与任务输出。低信噪比可能使长记忆同时保留无关噪声,跨被试差异、通道变化和小数据条件也可能削弱收益。可在一个固定的 EEG 任务与数据划分下,以相同输入处理和训练预算比较 HOPE 与 S4D,并改变有效片段后的噪声填充长度,检验任务指标与训练稳定性是否更稳健。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是 HOPE 将长记忆 SSM 的初始化与训练稳定性问题统一到 Hankel operator 参数化视角;作者报告的固定时间窗内不衰减记忆,为评估噪声背景下的长时依赖提供了具体切入点,但 EEG 适用性尚未验证。

  3. OpenReview · State space models78

    面向不规则时间序列的连续状态空间 Feynman-Kac 模型摊销控制

    基于摘要分析。本文研究不规则、离散观测下的连续时间序列建模,提出 Amortized Control of continuous State Space Model(ACSSM),以观测条件化的连续潜在动力学统一支持分类、回归、插值和外推任务。 核心机制是先通过多边缘 Doob's h-transform 构造以不规则观测为条件的连续动力系统,再借助随机最优控制(SOC)理论进行变分推断,近似难以直接求解的 Doob's h-transform 并模拟条件化动力学。作者提出具有紧致证据下界(ELBO)的推断算法,但该下界的具体形式、成立条件及紧致性论证尚未验证。 在计算实现上,ACSSM 使用辅助变量灵活参数化潜在动力学与摊销控制,并结合 simulation-free 潜在动力学框架和基于 transformer 的数据同化方案,使潜在状态推断与 ELBO 计算能够并行进行。这里的关键阅读点是条件化动力学、控制近似与并行推断如何衔接;摘要不足以确定 simulation-free 的具体实现及其与动力学模拟之间的关系。 作者报告,在多种真实世界数据集上的分类、回归、插值和外推评估中,ACSSM 获得更优性能并保持计算效率。摘要未给出数据集名称、划分、对照基线、指标数值或运行资源,故不能判断优势幅度及适用范围;实验协议、消融及统计信息尚未验证。 平台推测(待验证):该机制可能适用于存在缺测或异步采样的 EEG 多模态记录,但原领域结果不等于 BCI 有效。迁移假设依赖可用时间戳和足够观测信息,可复用连续动力学及摊销推断思路,需改造观测模型与通道表示;低信噪比、跨被试差异和小数据可能导致潜在动力学估计不稳定。可在固定被试内划分下,对同一 EEG 数据施加受控缺测,比较 ACSSM 与规则重采样后的基线在插值误差及下游任务指标上的变化。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读的是其将多边缘 Doob's h-transform、随机最优控制与摊销推断结合,用于不规则观测下的连续潜在动力学建模;性能优势与计算效率仍需结合全文中的评估协议核对。

  4. OpenReview · State space models72

    从层到状态:深度神经网络层动态的状态空间模型视角

    基于摘要分析。本文研究深层神经网络如何复用先前层的信息以增强当前层的特征表示,将各层输出视为连续过程的状态,并提出 Selective State Space Model Layer Aggregation(S6LA),利用 Selective State Space Models(S6)设计层间聚合模块。 核心机制是把状态空间模型(SSM)的建模对象从通常的序列位置转向网络深度方向的层输出。作者认为,既有层聚合方法主要采用离散状态视角,在网络层数增大时存在适用性限制;S6LA 则尝试以序列框架结合传统 CNN 或 transformer 架构。这里的“序列”主要对应层间信息演化,不能直接等同于输入信号的时间序列。连续状态的具体参数化、不同层特征的维度对齐、选择性机制及训练方式均需全文核对。 作者报告,S6LA 在图像分类与检测任务中带来显著改进,但摘要未提供数据集、划分、对照基线、指标或具体数值,因此无法判断改进幅度、计算代价及其对网络深度的依赖。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型存在跨层特征复用不足的问题,可考虑复用 S6LA 的沿深度聚合思路,而非直接把它当作 EEG 时间建模模块。该迁移假设依赖可组织为层序列的中间表示,需要改造不同层的通道数、时间分辨率与特征对齐方式;低信噪比可能使聚合传播噪声,跨被试差异和小数据也可能使选择性机制过拟合。一个可检验的小实验是在固定 EEG 骨干和 Cross-subject 划分下,比较原模型、简单层聚合与 S6LA,并同时记录任务指标、参数量及推理开销。上述仅为验证建议,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 S6LA 如何将沿网络深度的层间聚合建模为状态演化,以及其相对既有层聚合方法的收益与开销;摘要支持视觉任务中的作者报告,尚不能据此确认 EEG 适用性。

1月1日周三
  1. OpenReview · State space models70

    用于降雨—径流模拟的深度状态空间模型

    该研究针对降雨—径流模拟中 LSTM 仍占优势的问题,提出采用 Frequency Tuned Diagonal State Space Sequence(S4D-FT)模型作为替代序列建模方法。基于摘要分析,贡献主要是将该状态空间模型用于水文模拟,并与深度学习及物理模型进行对照。 方法与评估:作者在美国本土连续地区(CONUS)的 531 个流域上,将 S4D-FT 与 LSTM、基于物理机制的 Sacramento Soil Moisture Accounting 模型进行比较。作者报告,S4D-FT 在不同地区能够优于 LSTM;摘要未提供具体指标、提升幅度或相对物理模型的结果,因此不能量化优势或判断其适用边界。这里的 531 指流域数量,不代表独立测试流域数量,训练与测试划分尚未验证。 技术核对重点:摘要明确了状态空间序列建模及频率调谐的方法名称,但未展开频率调谐如何实现、输入变量、状态更新、损失函数与训练配置。需进一步核对性能是否来自模型机制,以及对序列长度、流域差异和训练预算的敏感性;实验协议、消融及统计信息尚未验证,代码与复现条件也尚未验证。 平台推测(待验证):可迁移假设是利用状态空间模型处理 EEG 时间序列,并检验频率调谐是否适合任务相关的频谱结构,而非把水文优势直接视为 BCI 优势。原任务依赖降雨—径流时序数据,具体输入结构、监督方式及样本规模尚未验证;迁移时可考虑复用序列建模模块,但需改造多通道输入和任务输出。EEG 的低信噪比、跨被试频谱差异及小数据条件可能使调谐失效或过拟合。一个可证伪的小实验是在固定 EEG 数据划分与训练预算下,对照 S4D-FT、未调谐的 S4D 和 LSTM,检验频率调谐能否稳定带来增益。相关 EEG 工作尚未检索确认。

    阅读价值:值得关注其以 S4D-FT 对照 LSTM 与物理水文模型的序列建模评估,但频率调谐机制、数据划分及性能差异的统计证据仍需全文核对,不能据此推断 EEG 效果。

  2. OpenReview · State space models70

    DSSM:用于人体动作生成的双状态空间模型

    基于摘要分析。该研究面向文本驱动的人体动作生成,针对词级文本描述与关节级动作表示之间特征信息量不均衡、影响潜在空间特征融合的问题,提出 Dual State Space Model(DSSM),通过从粗到细重建融合特征缓解模态间失衡。 机制上,DSSM 包含 Masked State Space Model(MSSM)与 Hierarchical State Space Block(HSSB)两个单元,并引入状态空间模型(SSM)以利用时序信息、降低计算复杂度。摘要未说明掩码对象、层级组织、融合位置、损失函数及训练与推理流程,这些细节尚未验证。作者声称这是首次将 SSM 引入文本驱动的动作序列生成,该优先性尚未独立核实。 作者报告,在 HumanML3D 与 KITML 基准数据集上达到 SOTA 表现;但摘要未提供具体指标、数值、数据划分或对照基线,因此无法判断优势幅度,也无法核对计算复杂度收益。实验协议、消融及统计信息尚未验证。摘要提供了 GitHub 代码地址,但代码完整性、依赖环境及复现条件尚未核验。 平台推测(待验证):其原问题是文本与动作序列的信息量不平衡,机制依赖文本—关节序列的跨模态对应关系;具体监督形式和训练规模尚未明确。假设 EEG 与文本或运动学信号的融合也受到模态信息量失衡影响,可考察粗到细融合重建与 SSM 时序建模的复用价值,但需改造 EEG 输入表示、通道处理及模态对齐方式。低信噪比、跨被试差异、通道配置变化与小数据可能使重建过程偏向更强模态,削弱 EEG 信息。一个可检验的小实验是在固定划分的配对 EEG—运动学任务中,对比常规融合与该重建机制,并通过削弱或移除 EEG 输入检验是否真正利用 EEG;这不构成已验证的 BCI 效果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得关注其以 MSSM 与 HSSB 从粗到细重建文本—动作融合特征的机制,但作者报告的性能优势及其对 EEG 多模态融合的适用性尚需分别核对与验证。

  3. OpenReview · State space models72

    用于图像去模糊的高效视觉状态空间模型

    基于摘要分析。该研究针对高分辨率图像去模糊中长程依赖建模与计算成本之间的矛盾,提出高效视觉状态空间模型 EVSSM,以视觉扫描模块获取非局部信息,并用频域前馈网络 EDFFN 表征局部信息。 核心机制:摘要指出,ViTs 的计算复杂度随图像分辨率呈二次增长,而现有部分视觉 SSM 方法采用多个固定方向扫描,也会增加计算成本。EVSSM 在各 SSM 模块之前应用不同几何变换,以捕获有用的非局部信息并维持效率;EDFFN 则估计有助于恢复潜在清晰图像的频率信息。具体几何变换、扫描路径、频域运算、损失函数及训练配置尚未验证,不能据摘要确定其复杂度或参数规模。 结果与证据边界:作者报告,EVSSM 在基准数据集和真实图像上相较先进方法表现有利。摘要未提供数据集名称、划分、对照方法、评价指标、数值或运行硬件,因此尚不能量化质量与效率的权衡;实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,SSM 的长程建模与频率信息筛选可能用于 EEG 时序去噪,但图像去模糊的二维空间结构及清晰图像恢复目标不能直接等同于 EEG。可考虑复用 SSM 与频域处理思路;扫描和几何变换需依据时间轴、通道拓扑改造,并明确干净信号或其他监督来源。低信噪比下的频率筛选可能误抑制任务相关活动,跨被试差异、通道排列变化及小数据训练也可能削弱效果。一个可检验的小实验是,在固定被试划分和受控噪声条件下,对比 SSM 基线、加入 EDFFN 的版本及改造扫描的版本,同时检查信号恢复与下游任务指标,避免仅凭重建质量判断 BCI 价值。已有相关 EEG 工作尚未检索确认。

    阅读价值:值得关注其通过几何变换组织 SSM 扫描、结合频域前馈网络处理非局部与局部信息的机制,但效率优势、去模糊收益及 EEG 迁移价值仍需核对全文或实验验证。

  4. OpenReview · State space models71

    SSMLoRA:利用状态空间模型增强低秩适应

    基于摘要分析。SSMLoRA 针对语言模型参数高效微调中 LoRA 表现随插入位置变化、部分插入可能造成参数冗余的问题,引入状态空间模型(SSM)连接低秩矩阵,使适配过程能够利用前一低秩空间的计算,并支持更稀疏的插入。 机制上,摘要描述了输入到低秩空间的映射,以及低秩空间之间的计算复用;其目标不仅是减少可训练参数,还包括减少不必要的适配模块插入。SSM 状态如何传递、低秩矩阵如何连接、插入位置如何选择,以及训练损失与推理开销,均需全文核对,不能仅凭摘要确定具体结构。 作者报告,在 General Language Understanding Evaluation(GLUE)benchmark 上,SSMLoRA 使用 LoRA 一半的适配参数即可取得相当表现;这一结论限于摘要所述 GLUE 对照,基础模型、各任务指标、数据划分、低秩维度及参数统计口径尚未验证。作者还认为其结构有望处理更长输入序列,但摘要未提供长序列实验结果,因此不能视为已验证优势。实验协议、消融及统计信息尚未验证。摘要提供了代码仓库链接,代码完整性与可复现性仍待检查。 平台推测(待验证):若 EEG 预训练模型采用多处 LoRA 适配,可假设低秩空间之间的状态传递有助于减少插入点。可复用的是低秩适配与状态连接思路,需改造的是 EEG 骨干接口、跨模块状态定义及通道布局适配。该假设依赖可适配的预训练骨干和足够的任务监督;低信噪比、跨被试差异、通道变化及小样本可能使共享状态传播噪声或产生过拟合。一个可证伪的小实验是在固定跨被试划分与同一 EEG 骨干上,对比常规 LoRA、稀疏 LoRA 和 SSMLoRA,同时控制可训练参数预算与训练条件,检验收益是否来自状态连接而非参数配置。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 SSM 连接低秩空间是否能降低 LoRA 对插入位置的敏感性:作者报告在 GLUE 上以一半适配参数取得相当表现,但具体参数口径、插入方案与评估协议尚未验证。

10月10日周四
  1. OpenReview · State space models77

    状态空间模型的参数高效微调

    基于摘要分析。本文研究深度状态空间模型(SSMs,如 Mamba)中的参数高效微调(PEFT),比较既有方法的适用性,并分析哪些模块适合微调;在此基础上提出 LoRA with Selective Dimension tuning(SDLoRA),将线性投影矩阵上的 LoRA 与 SSM 模块内的选择性维度更新结合。 作者对四种基础 PEFT 方法进行了经验评估,报告 prompt-based 方法(如 prefix-tuning)在所研究的 SSM 模型与实验条件下不再有效,并提供理论分析支持;相比之下,LoRA 仍然有效。进一步的理论与实验分析表明,在其比较设置中,将 LoRA 应用于线性投影矩阵、而不修改 SSM 模块,效果最佳;作者同时报告,直接用 LoRA 调整 SSM 模块并不有效。这一结论针对具体微调方式,不等于 SSM 内部参数完全不值得更新。 SDLoRA 的机制是在 SSM 模块中选择性更新部分通道和状态,同时对线性投影矩阵应用 LoRA。作者报告该方法优于标准 LoRA,但摘要未给出数据集、任务组成、模型规模、可训练参数预算、指标或提升幅度;维度选择规则、训练配置、实验协议、消融及统计信息尚未验证。复现时需核对各方法的参数预算与训练条件,以及理论结论适用的模型假设。 平台推测(待验证):若 EEG 任务已有可用的预训练 SSM,该方法可能为小数据微调提供候选方案;但原研究针对语言建模背景下的 SSM,不能据此认定其对 EEG 有效。迁移假设是选择性更新状态维度能够适应 EEG 时序差异,同时限制可训练参数规模。可复用部分是投影矩阵上的 LoRA 与选择性维度更新,需改造 EEG 输入表征及任务输出模块;低信噪比、跨被试差异和通道配置变化可能使所选维度失效。可在固定跨被试划分与匹配可训练参数预算的条件下,小规模比较标准 LoRA 与 SDLoRA,并检查多次运行的稳定性。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其关于 LoRA 在 SSM 内部模块与线性投影矩阵上效果差异的理论和实验分析,为选择参数高效微调的位置提供依据,但具体评估协议与效果幅度尚未验证。