跳到正文
12月31日周三
  1. OpenReview · State space models83

    通过结构化稀疏转移矩阵实现状态空间模型中的状态跟踪

    基于摘要分析。本文研究状态空间模型(SSMs)中转移矩阵的计算效率与有限状态自动机(FSA)状态跟踪表达能力之间的权衡,提出 PD-SSM,以结构化稀疏参数化降低非结构化转移矩阵的计算与存储成本,同时保留较强的状态跟踪能力;主要研究对象是通用序列建模,并非 EEG 或 BCI。 核心机制是将转移矩阵表示为列 one-hot 矩阵 P 与复数对角矩阵 D 的乘积。作者报告,这一结构使并行扫描的计算成本随状态维度线性增长,递推成本与对角 SSM 相当。理论上,作者报告模型满足有界输入有界输出(BIBO)稳定性,并可用一个维度为 N 的层及大小为 N × N 的线性读出模拟任意 N 状态 FSA;作者称该结果改善了现有结构化 SSM 的表达能力保证。稳定性条件、矩阵参数的学习方式与证明适用范围尚需核对全文。 实验方面,作者报告 PD-SSM 在多种 FSA 状态跟踪任务上显著优于多种现代 SSM 变体;在多类别时间序列分类上,表现与 neural controlled differential equations 相当。作者还将其整合进 Transformer-SSM 混合架构,报告模型能够跟踪由变长英文句子编码转移规则的复杂 FSA。摘要未提供具体数据集、划分、指标、基线名称或统计结果,实验协议、消融及统计信息尚未验证。材料提供了代码地址,但实现细节与复现条件尚未核查。 平台推测(待验证):若 EEG 任务需要持续保留离散事件或任务阶段信息,PD-SSM 的状态跟踪机制可能成为可测试的序列模块;这一假设依赖信号中存在可识别的状态转移结构及相应监督。可复用其稀疏递推模块,但需改造 EEG 输入编码与任务读出。低信噪比、跨被试差异、通道变化及小数据可能使输入无法可靠对应离散状态,从而削弱理论表达能力的实际价值。一个小规模可证伪实验是:在固定被试内划分、相同输入编码与训练预算下,比较 PD-SSM 和对角 SSM 对 EEG 任务阶段标签序列的状态跟踪表现,并检验噪声扰动下的稳定性。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 PD-SSM 如何以结构化稀疏转移矩阵兼顾有限状态自动机的状态跟踪表达能力与递推效率,但其对 EEG 长时序建模的价值尚未验证。

  2. OpenReview · State space models73

    融合 LLM 的贝叶斯状态空间模型用于多模态时间序列预测

    基于摘要分析。本文研究结构化时间序列与非结构化文本的联合预测,提出 LLM-integrated Bayesian State space models(LBS),以概率状态空间模型连接数值预测、文本预测与不确定性量化。主要研究对象是通用多模态时间序列,而非 EEG 或 BCI。 核心机制包含两个部分:状态空间模型(SSM)骨干刻画潜在状态的时间演化,并由潜在状态生成数值与文本观测;预训练 LLM 经适配后编码文本输入,参与状态后验估计,同时解码与潜在轨迹一致的文本预测。作者认为,这一设计支持灵活的历史观测窗口与预测窗口,并利用 SSM 对动力系统的归纳偏置改善时间泛化。具体状态转移形式、观测分布、LLM 适配方式、训练目标及推理算法尚未验证。 作者报告,在 TextTimeCorpus benchmark 上,LBS 相较此前最先进方法提升 13.20%,并提供每次预测的人类可读摘要。摘要未明确该数值对应的指标、计算口径、数据划分、预测窗口和对照方法,因此不能将其解释为 Accuracy 提升或百分点变化。实验协议、消融及统计信息尚未验证;不确定性校准与文本预测一致性的评估也需查阅全文。 平台推测(待验证):可检验的迁移假设是,在具有时间对齐数值信号与文本事件描述的数据中,共享潜在状态可能帮助利用文本上下文进行 EEG 特征序列预测,但这不等于已验证的 BCI 解码收益。可复用的是状态估计与文本条件化机制;需改造的是 EEG 观测模型、通道表示及文本对齐方式,并核对原方法对文本监督、预训练规模和数据量的依赖。低信噪比、跨被试差异、通道变化及小数据可能使文本条件化失效或产生表面合理但不准确的解释。一个小规模检验是固定被试内数据划分与预测窗口,比较纯数值 SSM 和加入对齐文本的版本,再以打乱文本作为对照,检查预测误差与不确定性校准是否改善。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是其通过共享潜在状态联合建模数值与文本观测,并将预训练 LLM 接入状态后验估计与文本预测的机制;不确定性量化的实际校准质量及其对 EEG 的适用性尚未验证。

  3. OpenReview · State space models68

    CodeSSM:面向代码理解的状态空间模型探索

    基于摘要分析。本文研究状态空间模型(SSMs)能否替代 transformers 完成代码理解任务,提出在代码语料上训练的 CodeSSM,覆盖 retrieval、classification 和 clone detection。主要贡献是评估 SSMs 在代码任务中的样本效率、长上下文外推能力与内存使用,而非提出 EEG 或 BCI 方法。 机制与对照:研究以 SSMs 为核心建模框架,并与 transformers 比较。作者称 CodeSSM 是首个在代码语料上训练的 SSM 模型,该优先性主张尚未独立核实。摘要未提供具体状态更新机制、模型规模、训练目标、代码语料及任务划分;样本效率的定义、上下文外推的测试长度与对照模型配置也尚未验证。 结果:作者报告,SSMs 具有更高的样本效率,并能外推至超过预训练长度的上下文;在上下文长度为 2048 的对照条件下,CodeSSM 相比 transformers 的内存使用最多减少 64%,且上下文增长时节省更多。摘要未说明硬件、批量大小、数值精度及测量属于训练还是推理阶段,因此不能将该数值推广为所有设置下的固定收益。各任务指标、消融及统计信息尚未验证。摘要称代码可用,但所给材料未包含可核对的代码地址与复现配置。 平台推测(待验证):若其长上下文与内存优势来自可复用的 SSM 序列建模机制,则可能对应长时 EEG 建模的资源瓶颈;这是迁移假设,不是已验证的 BCI 效果。原研究依赖代码序列与代码任务监督,迁移时可考察序列建模模块,但需改造连续多通道信号输入、时间编码和任务输出。低信噪比、通道差异、跨被试分布变化及小数据可能使代码领域的优势失效。可检验的小实验是在固定 EEG 数据划分、输入长度、训练预算与参数规模的条件下,对比 SSM 和 transformer 的任务表现及内存使用,再测试超过训练长度的序列;不能直接复用摘要中的 64% 收益。已有 EEG 相关 SSM 工作尚未检索确认。

  4. OpenReview · State space models71

    TransXSSM:采用统一旋转位置嵌入的 Transformer 与状态空间模型混合架构

    基于摘要分析。本文研究语言建模中 Transformer 与状态空间模型(SSM)混合时的位置表示兼容问题,提出 Unified RoPE,并据此构建 TransXSSM,以在统一的位置编码框架下结合自注意力与状态空间组件。 作者将问题归因于 Transformer 的显式 Rotary Position Embedding(RoPE)与 SSM 通过卷积形成的隐式位置表示不一致,认为这种差异会导致混合架构中的位置表示不连续和性能损失。核心贡献是位置编码统一,而非仅将两类层组合;但 Unified RoPE 如何作用于状态空间组件、层间如何衔接,以及训练目标和推理实现,摘要未提供足够细节,尚未验证。 作者报告:在摘要写作“4 sequenceK”的序列长度下,相对标准 Transformer,训练和推理速度分别提高 42.3% 和 29.5%;该长度表述需核对原文。在可比设置的语言建模基准上,作者报告准确率提升超过 4%。作者还报告,TransXSSM-1.3B 相对其 320M 版本的平均准确率增益为 7.22%,而相应 Transformer 或 SSM 的增益约为 6%。摘要未明确这些准确率增益是相对百分比还是百分点,不宜转换或直接比较。具体基准、数据划分、硬件、速度测量口径、对照匹配、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 长序列混合模型确实存在注意力与 SSM 时间位置表示不一致,Unified RoPE 可能提供可复用的时间编码机制;这是假设,不是本文已验证的 BCI 结果。迁移需改造多通道输入及采样时间表示,且低信噪比、跨被试差异与小数据可能使收益不稳定。可在固定数据划分和训练预算下,对同一 EEG 混合骨干比较统一与非统一位置编码,并核对任务指标及运行成本。其对数据规模和监督的依赖尚不清楚,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 Unified RoPE 如何对齐自注意力与 SSM 的位置表示,以及其相对混合架构对照的独立收益;摘要中的效率与准确率结果尚不足以确认 EEG/BCI 适用性。

  5. OpenReview · State space models75

    基于状态空间的语言模型的可控性分析

    基于摘要分析。该研究针对 Mamba 等状态空间模型(SSMs)内部动态难以解释的问题,提出基于可控性的 Influence Score,用于衡量位置 k 的 token 对后续状态和输出的影响,并通过不同 Mamba 变体的诊断实验考察其表现。 机制上,Influence Score 由 Mamba 的离散状态空间参数导出,通过类似系统可观测性分析的反向递推计算。它提供的是内部影响强度的诊断视角,而非摘要中已证明的任务性能或因果贡献指标;具体定义、计算代价及状态影响与输出影响的关系尚需全文核对。 作者在 mamba-130m、mamba-2.8b 和 mamba-2.8b-slimpj 上开展六类实验,分别考察温度、提示复杂度、token 类型、层深、token 位置和输入扰动。作者报告:在这些模型与实验条件下,Influence Score 随模型规模和训练数据增加而提高;模型呈现近因偏置,影响集中于中后层;在所比较变体中,mamba-2.8b-slimpj 特有地更重视内容词,并在噪声存在时降低内部影响。摘要未提供定量分数、样本构成及统计不确定性,规模与训练数据效应是否被独立区分,以及实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 序列模型采用可访问离散状态空间参数的 Mamba,该递推诊断机制或可用于分析不同时间片对后续状态与任务输出的影响。可复用部分是参数驱动的影响计算;需改造部分包括 EEG 时间片或通道的 token 化方式、输出定义及跨被试比较中的尺度校准。低信噪比可能使内部影响反映伪迹而非有效神经信息,被试差异、通道配置和小数据训练也可能削弱解释稳定性。一个可证伪的小实验是在固定被试内划分的 EEG Mamba 模型上,比较高、低 Influence Score 时间片受等强度扰动后的输出变化,检验分数能否预测扰动敏感性;这不等同于验证生理因果性。已有 EEG 相关工作尚未检索确认。复现语言模型结果仍需核对分数公式、层间汇总方式、提示与扰动设置及实现材料。

    阅读价值:值得阅读的具体原因是作者提出了可从 Mamba 离散状态空间参数计算的 token 影响诊断指标,可用于核查位置与层深相关的内部动态,但其解释效度及向 EEG 的迁移价值尚未验证。

  6. OpenReview · State space models73

    SeRpEnt:通过选择性重采样增强状态空间模型的表达能力

    基于摘要分析。本文研究序列建模中状态空间模型(SSMs)的选择性机制为何有效,并提出 SeRpEnt,通过按信息内容聚合序列元素的重采样机制实现信息感知的序列压缩。主要研究对象是通用长序列建模与语言建模,而非 EEG 或 BCI。 机制上,作者分析 Mamba 的选择性与序列处理之间的关系,认为其选择性时间间隔可充当信息的线性近似器;SeRpEnt 则进一步利用选择性,通过重采样聚合序列元素。相较于摘要所描述的 Mamba 状态参数选择机制,本文的重点是把选择性用于序列压缩。信息含量的具体定义、重采样规则、训练目标及推理实现尚未验证,不能据此推断其压缩率或计算复杂度。 作者报告,在 Long Range Arena benchmark 及其他语言建模任务中,SeRpEnt 的重采样机制带来收益。摘要未给出具体语言任务、指标、结果数值或对照设置,因此尚不能判断收益幅度及精度与计算开销之间的权衡;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若重采样能保留任务相关的短暂变化,同时压缩冗余时间片段,这一机制可能适用于 EEG 长时间序列处理。该假设依赖时间顺序、局部信息估计及训练监督方式;可考虑复用选择性聚合思路,但需改造输入表示和重采样规则,使其适配多通道 EEG 的时间与空间关系。低信噪比可能使信息估计偏向伪迹,压缩也可能抹去短暂 ERP 或任务相关节律;跨被试差异、通道配置变化和小数据条件均可能削弱稳定性。一个可检验的小实验是在固定 EEG 数据划分与训练预算下,对比不重采样、均匀重采样和选择性重采样,联合评估任务指标、计算开销及不同压缩程度下的性能变化。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其对 Mamba 选择性时间间隔的机制分析,以及按信息内容重采样压缩序列的方法,但摘要未提供量化收益,EEG/BCI 适用性尚未验证。

10月20日周一
  1. OpenReview · State space models75

    Bi-Mamba:迈向高精度的 1-bit 状态空间模型

    基于摘要分析。该研究面向大语言模型训练与部署的资源开销,提出 1-bit Mamba 架构 Bi-Mamba,探索在低比特表示下保留选择性状态空间模型的语言建模能力;原论文研究对象是语言模型,并非 EEG 或 BCI。 方法上,Bi-Mamba 使用自回归蒸馏损失从零训练,提供 780M、1.3B 和 2.7B 三种模型规模。摘要称训练数据量与常规大语言模型预训练相当,但未给出具体语料及规模。哪些权重、激活或状态被二值化,蒸馏教师与损失形式,以及训练和推理中的数值精度安排,尚未验证。作者将其定位为低比特表示下具有线性计算复杂度的大语言模型框架,但复杂度与实际运行收益仍需结合实现核对。 结果方面,作者报告:在语言建模实验中,Bi-Mamba 的性能接近 FP16 或 BF16 全精度对应模型,并优于训练后二值化(PTB)Mamba 与二值化感知训练(BAT)Transformer 基线;相较原始 Mamba,内存占用和计算消耗显著降低。摘要未提供评估数据集、指标数值、数据划分、硬件条件及基线配置,因此无法量化性能差距或资源收益;实验协议、消融及统计信息尚未验证。作者称代码位于补充材料,并提供匿名预训练权重,但当前未核验其完整性和可复现性。 平台推测(待验证):可迁移的假设是,低比特状态空间序列建模可能缓解长时 EEG 解码的存储与部署开销,而不是直接复用语言模型权重。可考察其二值化与蒸馏训练机制,但需改造 EEG 输入编码、任务输出及监督目标;语言模型规模下的效果不能保证在低信噪比、跨被试差异、通道变化和小数据条件下成立。一个可证伪的小实验是在固定 EEG 数据划分与同一解码任务下,对照全精度 Mamba 与相应二值化版本,同时记录任务指标、峰值内存和同一硬件上的推理延迟,检验压缩收益是否以明显性能下降为代价。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其从零训练结合自回归蒸馏的 1-bit Mamba 路线能否兼顾语言建模性能与部署成本,但摘要不足以验证实际量化范围、硬件收益及 EEG 迁移价值。

10月11日周六
  1. OpenReview · Representation learning74

    用于视觉—语言表征学习的双曲空间乘积

    基于摘要分析。本文研究视觉—语言表征中如何同时表达概念族内部的层级关系与不同概念族之间的组合关系,提出 PHyCLIP:在多个双曲空间因子的笛卡尔积上使用 ℓ₁ 乘积度量,以统一建模这两类语义结构。 核心机制是分工式几何表示:每个双曲因子承载概念族内部的树状层级,跨因子的 ℓ₁ 乘积度量则用于表达跨概念族的组合性。作者将后者与 Boolean algebra 类比;摘要未给出这一类比的具体数学构造,因此不能据此认定模型实现了完整的逻辑运算。相较于单一空间表示,本文的主要创新是将层级性与组合性放在乘积空间的不同结构中处理,而不是仅依赖一个双曲空间。 作者报告,在 zero-shot classification、retrieval tasks 和 hierarchical classification 实验中,PHyCLIP 优于现有单空间方法,并对视觉场景和语言描述中的组合性提供更可解释的表征。摘要未提供数据集、具体基线、评估划分、指标数值或可解释性评估方式,无法量化优势或判断其适用范围。因子数量与分配方式、编码器、损失函数、训练配置、实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 任务同时具有明确的标签层级和可组合的语义属性,这种几何分工可能用于结构化表征;该假设依赖可靠的层级与组合监督,原视觉—语言结果不等于 BCI 有效性。可复用的是乘积空间与距离设计,需改造的是 EEG 编码器及语义监督。低信噪比、跨被试差异和小数据可能使因子学习不稳定,通道配置变化也可能削弱表示一致性。一个可检验的小实验是:在具有真实层级与组合标签的 EEG 数据上,固定编码器、训练预算及跨被试划分,比较欧氏、单一双曲和双曲乘积表示,并单独评估未见属性组合。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的具体原因是 PHyCLIP 将概念族内部的层级结构与跨概念族的组合关系分别交给双曲因子和 ℓ₁ 乘积度量建模,但其相对单空间方法的优势及可解释性证据仍需核对全文。

10月7日周二
  1. OpenReview · State space models79

    Chimera:超越序列的状态空间模型

    基于摘要分析。本文研究如何统一建模语言、图像和图数据,将状态空间模型推广到一般图拓扑,提出直接利用数据拓扑的 Chimera。核心贡献是以拓扑结构组织建模,并针对不同图结构提出计算优化;论文的主要研究对象是通用多模态建模,而非 EEG 或 BCI。 机制与创新:作者认为,自注意力本身将输入视为无序元素集合,通常需要位置嵌入或图随机游走等手段补充结构信息;Chimera 则将拓扑直接纳入模型。作者提出,有向无环图上的 Chimera 可实现为线性时间递推;对于一般图,通过数学近似达到与 Transformer 相同的二次复杂度。摘要未给出状态更新方程、近似形式、复杂度所对应的具体规模变量及误差条件,尚不能据此判断其实际速度、内存占用或对不同图结构的适用边界。“不需要领域特定偏置”是作者的主张,不等于无需构造输入拓扑。 结果:作者报告,在各自任务评估中,Chimera 在 GLUE 上超过 BERT 0.7 分,在 ImageNet-1k 上超过 ViT 2.6%,并在 Long Range Graph Benchmark 上超过所比较的全部基线。摘要未说明 ImageNet-1k 的具体指标及 2.6% 是相对提升还是百分点差,也未列出图基准的逐任务数值。这些结果涉及不同任务,不能直接横向比较;模型规模、训练预算、数据划分、实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,若 EEG 电极关系能提供有效的图拓扑,Chimera 的图状态空间机制可能帮助建模跨通道依赖;这不构成已证实的 BCI 效果。可尝试复用图建模模块,但需改造 EEG 输入编码、时间维度处理和拓扑构造。原方法的训练监督与规模要求尚未验证;低信噪比、跨被试差异、通道缺失和小数据可能削弱固定拓扑的作用,一般 EEG 通道图也不能直接套用有向无环图的线性递推结论。一个可证伪的小实验是在固定跨被试划分与相同训练预算下,比较电极空间拓扑、随机拓扑和序列拓扑,检验性能变化是否确实来自有意义的通道关系。已有 EEG 相关工作尚未检索确认;复现所需实现与配置尚未验证。

    阅读价值:值得阅读的是 Chimera 将状态空间模型扩展到一般图拓扑的机制,以及有向无环图与一般图两类计算方案;其对 EEG 通道关系建模的价值仍是假设,尚未验证。

9月23日周二
  1. OpenReview · State space models74

    融合 LLM 的贝叶斯状态空间模型:多模态时间序列预测

    基于摘要分析。本文研究结构化时间序列与非结构化文本的联合预测,提出 LLM-integrated Bayesian State Space Model(LBS),通过共享潜在状态连接两类观测,同时生成数值预测与文本预测,并提供不确定性量化。 核心机制包含两个组件:状态空间模型(SSM)主干描述潜在状态的时间动态,数值与文本观测均由这些状态生成;预训练 LLM 经适配后,将输入文本编码为用于后验状态估计的信息,并解码与潜在轨迹一致的文本预测。作者称,该设计支持灵活的历史窗口与预测窗口,并借助 SSM 对动态系统的归纳偏置改善时间泛化。具体状态转移与观测分布、LLM 适配方式、训练目标、后验推断和不确定性校准方法尚未验证。 作者报告,在 TimeText Corpus benchmark 上,LBS 相比此前最佳方法提升 13.20%,并能提供可读的文本摘要;摘要未说明该提升对应的指标、计算口径、数据划分或对照方法,因此不能将其解读为 Accuracy 提升或百分点差异。作者声称这是首次统一 LLM 与 SSM 进行数值和文本联合预测,该优先性尚未独立核实。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 时间序列具有可对齐的任务说明、事件记录或其他文本上下文,共享潜在状态机制可能用于检验文本是否能辅助神经信号预测;这不是已证实的 BCI 解码效果。其依赖数值与文本的时间对应关系及可用监督,可复用概率状态估计框架,但需改造 EEG 观测模型、文本对齐与输出任务。低信噪比、跨被试差异、通道配置变化和小数据条件可能使模型偏向文本先验而忽略信号。一个可检验的小实验是:在固定跨被试划分下,比较纯数值 SSM、加入真实对齐文本的 LBS 和加入打乱文本的 LBS,核对预测误差及不确定性校准是否改善。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以共享潜在状态连接数值序列与文本观测的概率建模机制,但摘要所述性能提升的指标和对照协议尚未验证,也不能据此认定其对 EEG/BCI 有效。

9月20日周六
  1. OpenReview · State space models78

    Mixture-of-Mamba:通过模态感知稀疏性增强多模态状态空间模型

    基于摘要分析。研究针对状态空间模型(SSMs)在多模态预训练中利用模态特定特征能力受限的问题,提出 Mixture-of-Mamba,通过 Mamba block 的模态专属参数化引入模态感知稀疏性。核心贡献是探索这种设计能否以更少训练计算量达到相近的各模态损失,而非验证 EEG 或 BCI 任务效果。 作者在三类多模态预训练设置中评估该方法:Transfusion 使用交错文本与连续图像 token,并包含扩散损失;Chameleon 使用交错文本与离散图像 token;第三类扩展框架进一步纳入语音。摘要未说明具体参数分配、稀疏激活规则或完整损失组合。作者报告,投影组件联合解耦比单独修改带来更大收益,提示不同组件的模态专属化存在协同作用,但具体组件和消融数值尚未验证。 在摘要所述 1.4B 规模下,作者报告:Transfusion 设置达到等效图像损失所需训练 FLOPs 为对照的 34.76%;Chameleon 设置达到相近图像损失和文本损失所需 FLOPs 分别为对照的 42.50% 和 65.40%;三模态设置达到匹配语音损失所需 FLOPs 为对照的 24.80%。这些比例对应不同预训练设置和损失目标,不能直接横向比较,也不等于下游任务性能提升。对照模型配置、数据规模与划分、计算量核算、实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,在 EEG 与文本或其他信号联合建模时,模态专属参数化可能缓解共享序列模型对不同输入统计特征的混合处理问题。可复用的是 Mamba 序列建模及参数解耦思路;需要改造 EEG 输入编码、模态标识和训练目标,并依赖可用的多模态配对或交错序列数据。低信噪比、通道差异、跨被试分布变化及小数据可能使专属参数过拟合,原文大规模预训练收益不保证迁移成立。可在固定 EEG—文本数据划分下,以同等训练 FLOPs 比较共享参数 Mamba 与模态专属版本,并分别检查预训练损失和跨被试任务指标;相关 EEG 工作尚未检索确认。

  2. OpenReview · State space models77

    StateX:通过后训练状态扩展增强 RNN 的召回能力

    基于摘要分析。StateX 针对 RNN 将上下文压缩到固定大小循环状态、因而难以准确召回长上下文信息的问题,提出通过后训练扩展预训练 RNN 状态的训练流程,旨在避免直接训练大状态模型的高成本。 核心机制:研究覆盖 linear attention 与 state space models 两类 RNN,分别设计后训练架构修改,在不增加或仅少量增加模型参数的情况下扩大循环状态。摘要将状态容量与模型参数量区分开来,但未说明具体扩展操作、初始化方式、损失函数及训练数据。其背景依据是既有研究发现召回能力与循环状态大小正相关;这一关系不应视为所有任务上的普遍保证。 作者报告:在参数规模最高达 1.3B 的模型上,StateX 改善了召回与上下文学习能力,且未带来高额后训练成本或损害其他能力。摘要未提供任务、数据集、划分、基线、指标数值或成本计量口径,因此无法判断提升幅度及适用边界。实验协议、消融及统计信息尚未验证;复现需核对状态扩展结构、训练预算,以及扩展前后的内存占用、推理吞吐与能力保持情况。 平台推测(待验证):假设 EEG 序列模型的长时信息保持确受循环状态容量限制,后训练扩展状态可能成为复用预训练模型的一条路径,但语言上下文召回不等同于 EEG 解码。可考虑复用状态扩展流程,需改造 EEG 输入表征与任务监督,并核对通道结构和序列长度依赖;低信噪比、跨被试差异及小数据可能使扩展状态更多保留噪声或产生过拟合。一个可证伪的小实验是在固定 EEG 数据划分、任务监督和后训练预算下,对比原状态与扩展状态模型,观察长窗口任务表现及内存开销,并检查收益是否随窗口长度变化。已有 EEG 相关工作尚未检索确认。

9月19日周五
  1. OpenReview · State space models71

    PUM-Net:面向长上下文状态空间模型、具有联想交互的可塑性统一记忆网络

    基于摘要分析。该研究面向长上下文建模,试图同时解决 Mamba-family State Space Models(SSMs)的远距离信息遗忘,以及外部知识接入成本高、内外记忆整合不足的问题。作者提出 Plastic Unified Memory Network(PUM-Net),将动态内部记忆与静态、预编码外部知识纳入统一双记忆架构并联合预训练。 核心机制方面,作者将长期遗忘归因于线性递归动态中的指数衰减核,并借鉴 Native Sparse Attention(NSA)的内部块记忆思路,为 Mamba 引入分块内部长期记忆,以改善超出训练序列长度范围后的远距离上下文检索。在此基础上,PUM-Net 允许外部记忆在训练期间调整内部状态,实现双向交互,而不通过追加检索文档来增加序列长度。摘要未说明联想检索、记忆更新、外部知识编码及联合训练损失的具体实现;作者关于“首次”实现此类联合预训练的表述亦需文献核对。 作者报告在具有挑战性的长程基准上取得显著改进,但摘要未提供基准名称、评价指标、数值、序列长度或对照配置,因此无法判断改进幅度与适用边界。实验协议、消融及统计信息尚未验证;复现还需核对外部知识库规模、编码成本、训练与推理资源,以及内部记忆和外部记忆各自的贡献。 平台推测(待验证):其可迁移机制假设是用分块记忆保留长时程 EEG 信息,并用预编码记忆提供辅助表征,而非直接移植语言领域的外部知识。可复用候选是记忆检索与状态交互模块,需改造 EEG 编码和外部记忆构建方式;低信噪比、通道差异、跨被试分布变化及小数据条件可能使检索返回不匹配模式。一个可证伪的小实验是在固定 Cross-subject 划分下,仅用训练被试构建外部记忆,对比基础 SSM、仅内部记忆和双记忆版本,并同时记录任务指标与计算开销。该假设不代表已证实的 BCI 效果,已有 EEG 相关工作尚未检索确认。

  2. OpenReview · State space models83

    利用结构化稀疏转移矩阵实现状态空间模型中的状态追踪

    基于摘要分析。本文研究状态空间模型(SSMs)中结构化转移矩阵的计算效率与有限状态自动机(FSA)模拟能力之间的权衡,提出 PD-SSM:用列 one-hot 矩阵 P 与复数对角矩阵 D 的乘积参数化转移矩阵,以低成本递推支持更强的状态追踪。主要研究对象是通用序列建模与 FSA 状态追踪,并非 EEG/BCI。 核心机制是通过 P 表达稀疏状态路由、通过 D 提供对角变换,避免使用高成本的非结构化转移矩阵。作者报告,平行扫描的计算成本随状态维度线性增长,递推成本与对角 SSMs 相当。理论上,作者报告模型具有 BIBO(有界输入—有界输出)稳定性,并可用一个维度为 N 的单层模型及 N×N 线性读出模拟任意 N 状态 FSA,达到其所述的最优状态维度与深度。需注意,递推的线性成本不等于读出及完整模型的全部成本均为线性;具体理论条件与证明尚需全文核对。 实验方面,作者报告 PD-SSM 在多种 FSA 状态追踪任务中显著优于多种现代 SSM 变体,在多变量时间序列分类中优于 neural controlled differential equations;将其嵌入混合 Transformer-SSM 架构后,还能追踪转移由变长英文句子集合编码的复杂 FSA。摘要未提供数据集、划分、具体基线、指标或分数,实验协议、消融及统计信息尚未验证,不能据此判断真实时序任务中的优势幅度或稳定性。作者提供了代码链接,但实现、运行配置与复现结果尚未核验。 平台推测(待验证):假设 EEG 任务包含可由序列转移描述的潜在状态,PD-SSM 的状态路由机制可能用于检验时序记忆瓶颈,而非直接解决信号去噪或跨被试域偏移。可复用其递推模块,但需改造 EEG 输入编码与任务读出;FSA 理论保证不能直接覆盖连续、低信噪比的神经信号,通道变化、被试差异和小数据训练也可能削弱收益。一个可证伪的小实验是在固定 EEG 编码器、匹配状态维度与训练预算的条件下,对比 PD-SSM 与对角 SSM,并分别报告被试内和跨被试表现、计算开销及噪声敏感性。已有相关 EEG 工作尚未检索确认。

    阅读价值:值得核对 PD-SSM 如何以结构化稀疏转移兼顾 FSA 状态追踪表达能力与递推效率,以及其理论保证能否转化为真实多变量时序任务的收益;EEG/BCI 适用性尚未验证。

  3. OpenReview · State space models76

    DeltaFormer:解锁 Transformer 的状态空间

    基于摘要分析。本文研究 Transformer 在状态追踪任务中的表达能力限制,从带核函数的状态空间视角重新审视 Transformer,并提出改进架构 DeltaFormer,目标是在保留语言建模能力的同时增强模型表达能力。 原论文的主要对象是语言模型架构及计算表达能力,而非 EEG 或 BCI。摘要指出,在对数精度等条件下,Transformer 可解决的问题受 TC^0 限制,并将 Python 代码求值、实体追踪、国际象棋等列为通常被认为超出该复杂度类的状态追踪问题。这里的限制依赖具体计算模型与精度假设,不能直接扩大为所有 Transformer 均无法完成这些任务。 机制与对照方面,作者将基于 Delta Rule 的近期状态空间方法作为背景:此类方法可突破上述表达能力限制,但固定大小状态空间可能制约任务表现。DeltaFormer 的切入点是以带核函数的状态空间重新解释并改进 Transformer;摘要未给出具体状态更新方程、核函数形式、状态容量如何随序列变化,以及训练与推理实现,因此不能据此确定其结构或计算成本。 作者报告,理论与实践结果支持 DeltaFormer 突破 Transformer 固有的 TC^0 表达能力限制,并在语言建模任务上不弱于标准 Transformer。摘要未提供数据集、模型规模、评价指标、数值结果或对照设置;理论结论的条件、实验协议、消融及统计信息尚未验证,“不弱于”也不能扩展为所有任务或算力预算下均更优。 平台推测(待验证):增强状态追踪能力可能与长时程 EEG 序列中的动态状态建模有关,但摘要不足以建立具体迁移路径。现阶段不能将语言建模结论视为低信噪比、跨被试或小数据 EEG 场景的有效性证据;已有 EEG 相关工作尚未检索确认。复现前需取得全文,核对理论假设、架构定义及实验配置,代码与权重可用性尚未验证。

    阅读价值:值得阅读其关于 Transformer 状态空间与状态追踪表达能力的理论论证,并核对 DeltaFormer 突破 TC^0 限制的适用条件及语言建模对照;其 EEG/BCI 价值尚未验证。

  4. OpenReview · Representation learning78

    论跨模态错配在多模态表征学习中的价值

    基于摘要分析。本文研究图像—文本多模态对比学习(MMCL)中的跨模态错配:配对样本并不总是表达完全相同的概念,因此“缓解错配”与“利用错配”可能各有适用条件。作者通过潜变量模型刻画错配机制,尝试统一这两种观点,并为实际系统设计提供理论依据。 核心机制是区分两类偏差:选择偏差(Selection bias),即部分语义变量在文本中缺失;扰动偏差(perturbation bias),即语义变量被改变。作者报告,理论分析表明,在一定温和假设下,MMCL 学到的表征恰好捕获对这两类偏差保持不变的语义变量子集所对应的信息。该结论的重点不是错配必然有益或有害,而是错配会影响哪些语义信息被保留;其实际价值需结合下游任务所需的信息判断。 作者报告使用合成数据和真实图像—文本数据集开展实证研究,以验证理论结论。摘要未提供具体数据集、指标、对照基线、样本规模或定量结果;理论假设、具体损失形式、实验协议、消融及统计信息尚未验证,不能据此断言对任意错配或其他模态均成立。 平台推测(待验证):若 EEG 与刺激、文本描述或行为标签配对时也存在语义缺失或扰动,该框架可能帮助分析对比学习究竟保留了任务相关信息,还是仅保留跨模态共同信息。这一假设依赖可解释的配对语义及相应监督结构;可复用的是潜变量偏差分析框架,需改造的是 EEG 编码与配对机制。低信噪比、跨被试差异、通道变化及小数据可能使任务相关信息被误作非共享因素而丢失。一个可检验的小实验是在固定 EEG 数据划分下,分别控制配对描述的语义删除与替换,比较表征对目标任务信息和扰动因素的保留情况。原领域结论不等于 BCI 有效性,已有 EEG 相关工作尚未检索确认。

    阅读价值:该研究通过区分语义缺失与语义扰动,给出理解跨模态错配应被缓解还是利用的统一理论视角,值得核对其假设及不变语义与下游任务目标是否一致。

9月17日周三
  1. OpenReview · Representation learning75

    利用语言模型进行程序化表征学习

    基于摘要分析。本文研究如何兼顾监督学习中的表征能力与预测器可解释性,提出 Learned Programmatic Representations(LeaPR):用代码表示从数据点到标量的特征函数,再将这些特征交给决策树预测,而不是直接用神经网络完成预测。 核心机制是利用 Large Language Models(LLMs)的领域先验及调用领域专用库编写代码的能力,合成特征函数。作者提出两条学习路径:一是改造 FunSearch,使搜索对象由直接生成预测器转为生成特征;二是提出 ID3 的变体,在决策树叶节点需要分裂时按需生成新特征。这将特征构造与预测器学习联系起来,且特征代码和树的预测路径可供检查;不过,可检查并不自动等于特征具有可靠的语义解释。 作者报告,在棋局局面评估、图像分类和文本分类实验中,方法得到高质量、不依赖神经网络的预测器,其表现常可与神经网络竞争。摘要未提供具体数据集、划分、指标、对照配置或数值,无法据此比较性能。这里的“不依赖神经网络”指所得预测器,不能据此推断特征学习阶段无需 LLM 或专用计算资源。实验协议、消融及统计信息尚未验证;复现还需核对 LLM 配置、特征搜索预算、代码执行环境及模型选择流程。 平台推测(待验证):迁移假设是,若 EEG 任务具有可由领域库计算的候选特征,LLM 生成标量特征与按需树分裂机制可能用于探索可检查的分类规则。可复用的是特征代码搜索和决策树学习框架,需改造的是 EEG 输入接口、通道与时间窗处理及允许调用的特征库。该路径依赖监督标签、可执行特征函数和足以评估候选特征的数据;低信噪比、跨被试差异、通道变化及小数据下的反复搜索均可能导致不稳定或过拟合。一个可检验的小实验是在固定 Cross-subject 划分下,仅用训练数据搜索特征,与预设 EEG 特征加决策树比较同一测试协议下的 Balanced Accuracy,并记录搜索成本与特征稳定性。上述 EEG 效果并非原文结果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是将 LLM 生成的可检查特征函数与决策树学习结合的两种机制,但其性能、可解释性及向 EEG 任务迁移的可行性仍需核对全文和实验。

5月1日周四
  1. OpenReview · State space models72

    状态空间模型的参数高效微调

    基于摘要分析。本文研究 Mamba 等深度状态空间模型(SSMs)的参数高效微调(PEFT),重点考察既有方法的表现及应调节的参数位置,并提出面向 SSM 模块的 Sparse Dimension Tuning(SDT),与用于线性投影矩阵的 LoRA 组合。 作者报告,LoRA 及其变体在所开展的比较中持续优于其他 PEFT 方法,但效果依赖于目标参数:LoRA 对线性投影矩阵有效,在 SSM 模块上则未奏效,尽管仍优于其他适用于 SSM 的方法。这里的关键研究问题是不同模块是否需要不同的微调机制,而非将同一种低秩更新统一施加到所有参数。摘要未说明 SDT 如何选择稀疏维度、更新哪些参数,以及其训练目标与参数预算。 作者报告,SDT 与 LoRA 的组合在广泛实验中达到最先进性能;但摘要未提供任务、数据集、模型规模、数据划分、对照基线或指标数值,因此尚不能判断优势的适用范围。实验协议、消融及统计信息尚未验证,复现还需核对 SDT 的实现、训练配置与各方法的可训练参数预算。 平台推测(待验证):若 EEG 任务采用预训练 SSM,该模块分工式微调可能对应小数据条件下全量微调成本高、易过拟合的问题。可复用的是 SSM 模块使用 SDT、线性投影使用 LoRA 的适配思路;EEG 的通道输入、时间采样与任务输出仍需改造。原研究面向语言建模背景,具体预训练数据结构、监督方式与规模尚未验证,不能据此推定 EEG 效果。低信噪比、跨被试差异及通道变化可能使稀疏维度选择不稳定。一个可检验的小实验是在固定 EEG 预训练 SSM 和 Cross-subject 划分下,以匹配的可训练参数预算比较 LoRA 与 SDT+LoRA,并检查多次运行的性能与稳定性。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其针对 SSM 模块与线性投影矩阵分别选择微调方法的分析,但 SDT 的具体机制及其相对 LoRA 的收益仍需全文核对。

4月1日周二
  1. OpenReview · Representation learning69

    知识图谱与预训练语言模型增强的对话推荐系统表示学习

    基于摘要分析。本文研究对话推荐系统(CRSs)中对话上下文和背景知识有限、现有知识图谱方法未充分利用实体内在信息的问题,提出知识增强实体表示学习框架 KERL。其核心贡献是结合预训练语言模型(PLM)编码的实体文本描述与知识图谱(KG)关系信息,为推荐和回复生成提供增强的实体表示。 机制上,PLM 负责提取实体描述的语义,KG 用于强化实体表示;位置编码用于捕捉实体在对话中的时序信息。推荐组件融合实体表示与上下文表示, dialog 组件则利用增强表示在回复中生成与实体相关的信息。摘要未说明具体融合算子、图编码结构、损失函数,以及 PLM 是否参与微调,相关实现尚未验证。 作者构建了实体描述对齐的 Wiki Movie Knowledge Graph(WikiMKG),并将其描述为高质量知识图谱。作者报告 KERL 在推荐与回复生成任务上取得 state-of-the-art 结果,但摘要未提供评估数据集、划分、对照基线、指标或具体数值,因而尚不能判断提升幅度及适用范围;实验协议、消融及统计信息尚未验证。摘要提供了公开代码入口,复现仍需核对 WikiMKG 的获取条件、实体描述对齐流程、模型配置与训练设置。 本文的主要研究对象是对话推荐,而非 EEG 解码或 BCI。其机制依赖可对齐的实体描述、知识图谱及对话实体序列;所给材料未提供这些结构与神经信号任务之间的具体对应关系,因此不据此推导 EEG/BCI 效果或提出迁移复现实验。相关 EEG 工作尚未检索确认。

3月8日周六
  1. OpenReview · State space models77

    状态空间模型能够表达 n-gram 语言

    基于摘要分析。本文研究状态空间模型(SSMs)如何编码自然语言下一词预测中的组合规则,构造能够对由 n-gram 规则生成的语言完成下一词预测的状态空间语言模型。作者据此主张,SSMs 能够表达这类规则语言,并以理论构造解释其相对于 n-gram 规则系统的表达能力。 核心机制是利用关于 SSM 记忆容量的新理论结果编码 n-gram 规则,同时通过约束状态转移矩阵的谱控制上下文窗口。该工作主要贡献是表达能力与记忆机制的理论分析,而非发布新的预训练模型;摘要提及 Mamba 作为 SSM 示例,但未说明理论构造是否直接对应其具体实现。表达能力结论也不等同于梯度训练一定能够找到相应解,或在真实语言任务中必然优于其他模型。 作者报告,在一个由 n-gram 规则生成的小型数据集上开展实验,展示该框架可用于通过梯度优化得到的 SSMs 和 RNNs。摘要未提供数据规模、规则生成与划分方式、模型配置、对照基线或定量指标,理论成立条件、实验协议、消融及统计信息尚未验证。 平台推测(待验证):谱约束控制记忆范围的机制,可能为 EEG 序列建模中的有效时间窗口选择提供分析思路。原问题依赖离散符号及有限历史规则,而 EEG 是低信噪比连续信号,不能直接等同于 n-gram 语言;可借鉴的是状态转移谱与记忆范围的关系,输入表征、监督目标及模型构造均需重新适配。假设过强的短记忆约束会丢失较长时间依赖,且被试、通道差异和小数据可能使理论构造难以通过训练实现。可检验的小实验是在固定 EEG 任务与被试内划分下,仅改变谱约束,与无约束的同结构 SSM 比较任务指标及对输入窗口长度的敏感性。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其将 n-gram 规则编码、SSM 记忆容量与状态转移矩阵谱约束联系起来的理论构造,但其对 EEG 序列建模的适用性尚未验证。

3月6日周四
  1. OpenReview · State space models77

    Mixture-of-Mamba:通过模态感知稀疏性增强多模态状态空间模型

    基于摘要分析。该研究面向文本、图像及语音的多模态预训练,提出 Mixture-of-Mamba(MoM):通过对 Mamba block 进行模态专属参数化,引入模态感知稀疏性,旨在利用不同模态的特征,同时保留状态空间模型(SSMs)的计算效率。 机制与对照:该方法沿用 Mixture-of-Transformers 的模态感知稀疏性思路,将其扩展至 SSMs。作者报告,投影组件的联合解耦比单独修改带来更大收益,提示不同组件之间可能存在协同作用;但具体解耦位置、参数共享方式、稀疏执行规则及参数量匹配条件尚未验证,不能将其直接等同于常规专家路由机制。 评估与结果:作者在三种预训练设置下评估:Transfusion 使用交错文本与连续图像 tokens,并包含扩散损失;Chameleon 使用交错文本与离散图像 tokens;第三种设置进一步纳入语音。作者报告,在 1.4B 规模的 Transfusion 设置中,达到等效图像损失所需训练 FLOPs 为对照的 34.76%;在同规模 Chameleon 设置中,达到相近图像损失和文本损失分别需要对照的 42.50% 和 65.40% FLOPs;在同规模三模态设置中,匹配语音损失需要对照的 24.80% FLOPs。这些数字衡量特定设置下的同损失训练计算成本,不代表生成质量或下游任务准确率的同等提升。具体对照配置、数据集、训练预算、损失匹配判据、消融及统计信息尚未验证。 平台推测(待验证):假设模态专属参数化也能缓解 EEG 与语音、图像等信号联合建模时的异质性,可复用的部分是按模态区分参数及投影组件解耦的思路;需改造信号编码、时间对齐和训练目标。该假设依赖可区分模态的序列输入及足够的多模态训练数据,低信噪比、跨被试差异、通道配置变化和小数据可能使专属参数过拟合。可用小规模 EEG—刺激联合建模,在固定数据划分、参数规模和训练 FLOPs 下比较共享与模态专属参数化,同时检查损失和下游任务指标。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其模态专属参数化及投影组件联合解耦如何降低多模态预训练的同损失计算成本,但摘要中的效率结果不等同于下游任务或 EEG/BCI 有效性。

  2. OpenReview · State space models78

    Chimera:超越序列的状态空间模型

    基于摘要分析。该研究面向语言、视觉与图数据,提出统一模型 Chimera,将状态空间模型从序列推广到一般图拓扑,直接利用数据的邻域关系,以减少对位置嵌入等领域特定归纳偏置的依赖。核心贡献是以数据拓扑组织状态空间建模,并提出适用于不同图结构的计算优化,而非针对 EEG 或 BCI 的专用方法。 机制上,作者指出自注意力本身将输入视为无序元素集合,通常需要额外机制引入拓扑;Chimera 则尝试将拓扑直接纳入模型。对于有向无环图,作者报告可采用线性时间递推实现;对于一般图,提出数学近似,使复杂度达到 Transformer 的二次复杂度量级。摘要未给出状态更新方程、近似条件、训练目标或复杂度所对应的具体规模变量,这些内容尚需正文核对。 结果方面,作者报告在 GLUE 上较 BERT 高 0.7 分,在 ImageNet-1k 上较 ViT 提升 2.6%(摘要未明确具体指标及相对百分比或百分点口径),并在 Long Range Graph Benchmark 上优于所比较的全部基线。作者据此认为模型能够捕捉节点间的短程与长程交互;具体数据划分、模型规模、训练预算、实验协议、消融及统计信息尚未验证,不能据此确认不同模态下的收益来源。 平台推测(待验证):若 EEG 通道及其关系可表示为有意义的图,拓扑驱动的状态空间建模可能用于探索跨通道交互。该假设依赖可靠的节点与边定义,可考虑复用图状态传播机制,但需改造时间信号输入、通道表示及图构建方式;电极布局差异、低信噪比、小数据和跨被试关系变化可能使固定拓扑失效。一个可证伪的小实验是在固定数据划分与训练预算下,比较真实电极邻接图、随机图及序列化输入,检验收益是否确实来自拓扑,并分别报告被试内与跨被试表现。已有 EEG 相关工作尚未检索确认,原领域结果不构成 BCI 有效性的证据。

    阅读价值:值得阅读的是将状态空间模型从序列推广到一般图拓扑的统一机制,以及针对有向无环图和一般图的不同计算方案;其对 EEG 空间关系建模的价值尚未验证。

  3. OpenReview · State space models76

    Mixture-of-Mamba:通过模态感知稀疏性增强多模态状态空间模型

    基于摘要分析。本文研究文本、图像及语音的多模态预训练,针对状态空间模型(SSMs)难以充分利用模态特有特征的问题,提出 Mixture-of-Mamba(MoM):通过 Mamba block 的模态专属参数化引入模态感知稀疏性,将 Mixture-of-Transformers 的设计思路扩展到 SSMs,同时旨在保持计算效率。 评估包含三种设置:Transfusion 使用交错文本与连续图像 token,并包含扩散损失;Chameleon 使用交错文本与离散图像 token;第三种设置进一步加入语音。作者报告,在 1.4B 规模下,Transfusion 达到等效图像损失所需训练 FLOPs 为比较对象的 34.76%;Chameleon 达到相近图像损失和文本损失分别需要 42.50% 和 65.40% 的 FLOPs;三模态设置达到相匹配的语音损失需要 24.80% 的 FLOPs。这些数字对应特定预训练损失的计算量比较,不代表下游任务性能提升,摘要也未明确各项比较的具体基线与损失匹配判据。 作者报告,投影组件的联合解耦比单独修改产生更大收益,支持模态专属参数化存在协同效应。具体解耦位置、参数分配、稀疏计算实现、训练数据及其配比、完整实验协议和统计信息尚未验证;复现时需核对参数规模、训练预算与 FLOPs 计量是否可比。 平台推测(待验证):其可迁移机制是让不同模态使用专属参数,可能缓解 EEG 与其他信号联合建模时的表征干扰,但依赖明确的模态标识及可共同训练的数据。可复用的是模态感知参数化思路,需改造的是 EEG token 化、通道与时间对齐,以及训练目标。低信噪比、跨被试差异、通道不一致和小数据可能使专属参数过拟合,抵消计算收益。一个可检验的小实验是在具有配对 EEG 与另一模态的数据上,固定 Cross-subject 划分、参数规模及训练预算,比较共享参数 Mamba 与模态专属参数化版本的下游任务指标和训练 FLOPs。原文结果不构成 BCI 有效性的证据,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其模态专属参数化如何改善 SSM 多模态预训练的损失—计算量关系,尤其是投影组件联合解耦的消融结果;这些收益能否迁移至 EEG 多模态建模尚未验证。

  4. OpenReview · State space models76

    Mixture-of-Mamba:通过模态感知稀疏性增强多模态状态空间模型

    基于摘要分析。本文研究文本、图像及语音的多模态预训练,提出 Mixture-of-Mamba,通过对 Mamba block 进行模态专属参数化,引入模态感知稀疏性,旨在利用不同模态的特征,同时保持状态空间模型(SSMs)的计算效率;研究并非 EEG 或 BCI 验证。 核心机制:作者将 Mixture-of-Transformers 的模态感知稀疏设计扩展至 SSMs,并研究投影组件解耦。作者报告,联合解耦比单独修改产生更大收益。摘要未说明具体解耦哪些投影、参数共享边界及稀疏计算的实现方式,不能据此将其解释为已明确的专家路由机制。 评估与结果:实验涵盖 Transfusion(交错文本与连续图像 token,包含扩散损失)、Chameleon(交错文本与离散图像 token)及加入语音的三模态框架。在 1.4B 规模下,作者报告:Transfusion 达到等效图像损失所需训练 FLOPs 为对照的 34.76%;Chameleon 达到相近图像损失和文本损失所需 FLOPs 分别为对照的 42.50% 和 65.40%;三模态设置匹配语音损失所需 FLOPs 为对照的 24.80%。这些数字对应各自设置中的损失匹配,不代表下游任务准确率,也不能直接跨设置比较。具体对照配置、数据集、训练预算、损失匹配标准及统计信息尚未验证。 平台推测(待验证):其可迁移假设是,模态专属参数化可能缓解 EEG 与文本、音频联合建模时的表征冲突;这一机制依赖可靠的模态标识及多模态训练数据。可考虑复用 SSM 序列建模模块和模态参数分离思路,但 EEG 的连续信号编码、通道组织和时间对齐需改造。低信噪比、跨被试差异、通道配置变化及小数据可能使专属参数过拟合。一个可检验的小实验是在同一配对 EEG—文本数据及固定跨被试划分下,对比共享参数 Mamba 与模态专属版本,统一训练预算,检验下游任务表现及损失匹配所需 FLOPs,并比较单独与联合解耦。此方案不是原论文结果,已有 EEG 相关工作尚未检索确认。 复现前需核对全文中的参数化细节、数据划分、FLOPs 计量范围和消融协议;代码与权重可用性尚未验证。

    阅读价值:值得核对其模态专属参数化及投影组件解耦如何降低多模态预训练成本;摘要给出了不同模态损失下的训练 FLOPs 对比,但对 EEG/BCI 的适用性尚未验证。

3月5日周三
  1. OpenReview · State space models77

    Mixture-of-Mamba:通过模态感知稀疏性增强多模态状态空间模型

    基于摘要分析。研究针对状态空间模型(SSMs)在多模态预训练中利用模态专属特征的能力受限问题,提出 Mixture-of-Mamba(MoM):通过 Mamba 模块的模态专属参数化引入模态感知稀疏性,在保留 SSM 计算效率的同时改善训练效率。主要研究对象是文本、图像与语音多模态预训练,并非 EEG 或 BCI。 机制上,该方法将 Mixture-of-Transformers 的模态感知稀疏设计扩展到 SSMs。作者报告,投影组件的联合解耦比单独修改带来更大收益,提示不同组件之间存在协同作用。具体解耦位置、参数共享方式、稀疏执行机制及参数量匹配条件尚未验证,不能据摘要将其等同于常规专家路由架构。 作者报告,在 1.4B 规模的 Transfusion 设置中,输入为交错文本与连续图像 token,并使用扩散损失,MoM 达到等效图像损失所需训练 FLOPs 为比较对象的 34.76%;在交错文本与离散图像 token 的 Chameleon 设置中,达到相近图像损失和文本损失分别需要 42.50% 和 65.40% 的 FLOPs;在加入语音的三模态设置中,匹配语音损失需要 24.80% 的 FLOPs。摘要未明确比较对象及完整训练预算,相关基线、数据划分与统计信息尚未验证。这些指标衡量达到相近预训练损失的计算成本,不等于下游准确率、推理加速或实际运行时间收益。 平台推测(待验证):若 EEG 与其他同步模态存在不同的输入统计和表征需求,模态专属参数化可能缓解完全共享模型中的模态干扰。可复用的是 SSM 序列建模与参数解耦思路;需改造信号分段、输入表征、跨模态对齐和训练目标。原方法依赖多模态 token 序列与大规模预训练,迁移到低信噪比、小数据 EEG 时,专属参数可能过拟合,跨被试及通道差异也可能削弱收益。一个可证伪的小实验是在同步 EEG 与另一模态的数据上,固定数据划分和训练预算,对照共享 Mamba 与模态专属参数化版本,分别检查预训练损失和跨被试下游表现,并核对参数量与 FLOPs。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对模态专属 Mamba 参数化如何降低多模态预训练中达到相近损失的计算成本,以及投影组件联合解耦的消融证据;这些结果尚不能证明 EEG/BCI 下游任务收益。

2月11日周二
  1. OpenReview · State space models75

    Bi-Mamba:面向高精度的 1-bit 状态空间模型

    基于摘要分析。该研究面向大语言模型训练与部署的存储及能耗问题,提出 1-bit Mamba 架构 Bi-Mamba,通过从头训练与自回归蒸馏,探索低比特表示下保持语言建模性能的路径;主要研究对象是语言模型,而非 EEG 或 BCI。 机制与训练:Mamba 的选择性状态空间模型避免了 Transformer 随序列长度增长的二次计算复杂度及推理时的 key-value cache 开销,但模型规模增长仍带来资源压力。Bi-Mamba 提供 780M、1.3B 和 2.7B 三种模型规模,摘要称其采用常规大语言模型预训练量级的数据,并使用自回归蒸馏损失从头训练。具体二值化对象、保留高精度的运算、蒸馏教师及损失形式尚未验证,不能据“1-bit”认定全部参数、激活和状态均采用一位表示。 结果与证据边界:在语言建模实验中,作者报告 Bi-Mamba 的性能接近 FP16 或 BF16 全精度对应模型,优于训练后二值化(PTB)Mamba 与二值化感知训练(BAT)Transformer 基线,并较原始 Mamba 显著降低内存占用和能耗。摘要未提供数据集、数据划分、具体指标、性能差值或资源测量环境,因此这些结论的适用范围及可比性尚需全文核对;实验协议、消融及统计信息尚未验证。作者称代码位于补充材料,并提供匿名预训练权重,但其内容与可运行性尚未验证。 平台推测(待验证):迁移假设是,低比特选择性状态空间计算可能缓解长时 EEG 建模的部署内存压力。可尝试复用状态空间骨干与蒸馏思路,但需改造 EEG 输入编码、任务输出和教师模型;其原始训练依赖大规模文本与自回归监督,不能直接等同于小数据 EEG 分类。低信噪比、通道差异和跨被试分布变化可能放大二值化误差。一个可证伪的小实验是在固定 EEG 数据划分、相同骨干规模及训练预算下,对照全精度模型与 1-bit 蒸馏模型,同时测量任务指标、峰值内存及固定硬件上的能耗,检验资源收益是否伴随不可接受的性能下降。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其从头训练与自回归蒸馏如何缓解 Mamba 的 1-bit 表示性能损失,但摘要中的语言建模表现与资源收益尚不足以证明其适用于 EEG/BCI。

  2. OpenReview · State space models76

    Mixture-of-Mamba:以模态感知稀疏性增强多模态状态空间模型

    Mixture-of-Mamba 面向多模态序列预训练,针对状态空间模型(SSMs)难以充分利用模态特有特征的问题,在 Mamba block 中引入模态专属参数化,以模态感知稀疏性改善训练效率。基于摘要分析,未取得论文全文;研究对象是文本、图像及语音多模态建模,并非 EEG/BCI。 机制与对照:该方法沿用 Mixture-of-Transformers 的模态感知稀疏性思路,将其扩展到 SSMs。摘要指出,投影组件解耦具有协同效应,联合解耦优于单独修改;但具体解耦位置、参数共享方式、稀疏计算实现与参数量匹配条件尚未验证,不能据此认定其采用特定专家路由结构。 作者报告:在 1.4B 规模的 Transfusion 设置下,即文本与连续图像 token 交错、图像采用 diffusion loss 的预训练中,达到等同图像损失所需训练 FLOPs 为对照的 34.76%;在文本与离散图像 token 交错的 Chameleon 设置下,达到相近图像损失和文本损失所需 FLOPs 分别为对照的 42.50% 和 65.40%;在加入语音的三模态设置下,匹配语音损失所需 FLOPs 为对照的 24.80%。这些数字描述各自协议内的等损失计算成本,不代表下游任务性能提升,也不能跨设置直接比较。具体对照配置、数据集、训练划分、FLOPs 核算范围、消融细节及统计信息尚未验证。 平台推测(待验证):迁移假设是,若 EEG 与文本或其他信号共同组成带明确模态标识的序列,模态专属投影可能缓解不同信号表征需求之间的冲突。可复用的是按模态区分参数的设计;需改造 EEG 编码、时间对齐与训练目标。原实验处于大规模多模态预训练,EEG 的低信噪比、通道差异、跨被试分布变化及小数据条件可能使专属参数过拟合。一个可检验的小实验是在固定数据、目标与参数预算下,对比共享投影和模态专属投影的 EEG—文本 SSM,以严格跨被试划分同时观察任务指标与计算成本。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对模态专属参数化能否在保持 SSM 计算效率的同时降低多模态预训练成本;摘要提供了等损失下的 FLOPs 对照,但其对 EEG/BCI 的适用性尚未验证。

1月23日周四
  1. OpenReview · State space models78

    Longhorn:状态空间模型是摊销在线学习器

    基于摘要分析。本文研究长序列建模中状态空间模型(SSMs)的设计问题,提出将 SSM 理解为特定在线学习问题的元模块,并从在线学习目标的优化过程推导状态转移规则。基于这一视角,作者提出 Longhorn,其核心是利用在线回归目标的隐式更新构建深层 SSM 架构。 机制与贡献:原论文主要面向通用序列建模与语言建模,而非 EEG 或 BCI。摘要以 Transformer 随序列长度增长的二次计算成本为背景,强调 SSM 在线性解码效率和训练并行化方面的潜力。其方法贡献不是单纯提出一种递推形式,而是尝试以明确的在线学习目标解释和设计递推规则。在线回归目标的具体形式、隐式更新的求解方式、状态参数化及训练细节尚未验证;这里的“在线学习”是模型设计视角,不能直接等同于部署阶段的测试时自适应。 结果与证据边界:作者报告,在标准序列建模基准和语言建模任务上,所提模型优于包括 Mamba 在内的先进 SSM。摘要未提供具体数据集、指标、分数、模型规模或对照配置,因此无法判断优势幅度与适用条件。实验协议、消融及统计信息尚未验证,复现还需核对完整算法、训练配置与实现可得性。 平台推测(待验证):假设在线回归驱动的状态更新能够用于 EEG 长时序表征,其潜在对应点是以递推状态压缩历史信息,而非直接解决跨被试差异。可考虑复用状态更新机制,但需改造 EEG 通道或时间片的输入表征及任务输出;原方法依赖的回归监督构造、序列规模与数据结构仍需全文确认。低信噪比、通道变化和小数据条件可能使状态更新受噪声干扰或学习不足。一个可证伪的小实验是在固定跨被试划分、相同预处理和相近训练预算下,对比 Longhorn 与 Mamba 在同一 EEG 解码任务上的任务指标、运行开销及噪声敏感性,检验其优势能否迁移。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的具体原因是将 SSM 状态递推设计与在线学习目标及隐式更新联系起来,为理解和复现递推机制提供了可核对的理论路径;其 EEG/BCI 适用性尚未验证。

1月1日周三
  1. OpenReview · State space models75

    MemMamba:重新审视状态空间模型中的记忆模式

    基于摘要分析。该研究针对选择性状态空间模型 Mamba 在长序列建模中的记忆衰减问题,提出 MemMamba,将状态摘要机制与跨层、跨 token 注意力结合,旨在保留关键信息并维持线性复杂度。 机制与贡献:作者通过数学推导和信息论分析研究 Mamba 的长程记忆如何衰减及保留信息,并提出横向—纵向记忆保真度指标,用于刻画层内及跨层的信息退化。MemMamba 的设计受到长文阅读中提炼和保留显著信息的启发。摘要未给出保真度指标的定义、状态摘要的更新规则、注意力范围或复杂度推导,因此尚不能确认具体实现及其适用条件。 结果与证据:作者报告,在 PG19、Passkey Retrieval 等长序列基准上,MemMamba 相比既有 Mamba 变体和 Transformers 有显著改善,并报告推理效率提速 48%。但摘要未说明该提速对应的基线、硬件、序列长度、批量及计时口径,也未提供各任务指标或具体分数,不能据此判断收益范围。实验协议、消融及统计信息尚未验证;作者关于复杂度与记忆权衡取得突破的结论仍需结合全文核对。 平台推测(待验证):迁移假设是,状态摘要可能帮助长时 EEG 建模保留稀疏但重要的事件信息,跨层和跨 token 交互可能缓解长程信息丢失。原方法面向文本类长序列任务,其训练监督、规模及对序列结构的依赖尚未明确;用于 EEG 时需改造输入表示,并验证通道与时间结构如何进入摘要机制。低信噪比可能使摘要保留伪迹而丢失弱事件,跨被试差异和小数据训练也可能限制收益。一个可证伪的小实验是在固定跨被试划分、输入时长和训练预算下,比较 Mamba 与 MemMamba 对间隔逐渐增大的 EEG 事件的识别表现,同时记录任务指标、延迟和显存,检验收益是否随依赖距离增加而保持。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其对 Mamba 长程记忆衰减的理论分析与记忆保真度度量,并核对状态摘要及注意力机制如何兼顾信息保留和线性复杂度;摘要报告的性能与推理提速仍需全文协议验证。

  2. OpenReview · State space models73

    DocMamba:基于状态空间模型的高效文档预训练

    基于摘要分析。该研究针对视觉丰富文档理解中 Transformer 自注意力计算复杂度随序列长度呈二次增长的问题,提出基于状态空间模型的文档预训练框架 DocMamba,目标是在保留全局建模能力的同时将计算复杂度降低为线性。 核心机制是引入 Segment-First Bidirectional Scan(SFBS),用于捕获连续语义信息。摘要未说明文档片段如何划分、扫描顺序如何确定,以及文本、视觉和布局信息如何编码或融合;预训练目标、损失形式和训练规模也尚未验证。因此,目前可确认的贡献是状态空间模型与面向文档语义连续性的扫描策略相结合,不能据此补写具体网络结构。 作者报告,DocMamba 在 FUNSD、CORD 和 SORIE 下游数据集上取得新的最佳结果,并显著提升速度、降低内存使用;作者还报告,HRDoc 实验显示其具有长度外推潜力。摘要未提供具体指标、数值、数据划分、对照模型、运行硬件或外推长度范围,上述结论需在相应协议下核对,实验协议、消融及统计信息尚未验证。 平台推测(待验证):其迁移假设是,线性复杂度的序列建模与分段双向扫描可能帮助处理长时程 EEG,但文档的语义片段结构不能直接等同于 EEG 时间窗或生理事件。可考虑复用状态空间序列模块,并改造时间分段、通道表示及扫描方式;这一路径依赖合理的 EEG 分段结构和足够的训练数据。低信噪比、跨被试差异、通道配置变化及小数据规模都可能使分段或双向扫描收益失效。一个可证伪的小实验是在固定 EEG 数据划分、训练预算和通道配置下,对比普通扫描与改造后的 SFBS,检验长序列任务表现及速度、内存变化;双向扫描还需区分离线分析与实时因果推理的适用性。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是 DocMamba 如何通过 Segment-First Bidirectional Scan 在降低长文档计算成本的同时保留连续语义与全局建模能力,但其效率对照、长度外推协议及向 EEG 的迁移价值尚未验证。

  3. OpenReview · State space models61

    结构化状态空间序列(S4)模型综述

    基于摘要分析。本文综述结构化状态空间模型(SSMs)如何应对通用序列建模中的长程依赖与计算效率问题,梳理从 S4 到 Mamba、Simplified Structured State Space Sequence Model(S5)和 Jamba 的发展,并讨论计算、内存与推理效率方面的权衡;研究对象并非专门的 EEG 或 BCI 方法。 机制方面,摘要将 SSMs 的优势归于结构化递推与状态空间表示,并以 RNNs 的梯度消失及顺序计算限制、Transformers 的二次复杂度作为对照。作者报告,所综述的 SSM 架构可通过线性或近线性复杂度处理长序列,在 NLP、语音识别、视觉和时间序列预测等领域兼顾长程依赖建模与计算开销。摘要未提供这些结论对应的模型配置、数据集、序列长度、硬件条件或定量指标,因此不能将其理解为所有 SSM 架构均优于所有 RNN 或 Transformer。 综述还讨论训练优化、混合建模与可解释性等挑战。各模型的具体结构、监督方式与数据规模依赖,以及比较协议、消融及统计信息尚未验证;评估效率结论时需核对训练与推理是否分别计量,以及不同架构是否采用可比设置。 平台推测(待验证):假设状态空间递推能够保留 EEG 中与任务相关的长时程信息,其序列处理模块可能用于缓解长时间窗建模的计算瓶颈。可复用的是时序编码机制,需改造的是多通道输入表示、通道间交互及任务输出层;低信噪比、跨被试分布差异、通道配置变化和小数据训练可能削弱收益。一个可检验的小实验是在固定 EEG 任务、输入时间窗与跨被试划分下,对比 SSM 与 RNN、Transformer 编码器,同时记录任务指标、推理时间和峰值显存,再改变时间窗长度检验效率与性能权衡。该方案不属于论文已验证结果,已有 EEG 相关工作尚未检索确认。

  4. OpenReview · Representation learning71

    DALR:用于多模态句子表征学习的双层对齐学习

    基于摘要分析。该研究针对图像与文本参与的多模态句子表征学习,提出 DALR(Dual-level Alignment Learning),旨在缓解粗粒度对齐中的跨模态错位偏差与模态内语义分歧。其贡献是将细粒度跨模态一致性学习与全局模态内排序关系学习结合,而非仅依赖二元正负样本关系。 跨模态层面,DALR 使用一致性学习模块软化负样本,并引入辅助任务提供的语义相似度指导对齐。模态内层面,作者认为句子间关系具有超出二元正负标签的排序结构,因此将排序蒸馏与全局模态内对齐学习结合。摘要未说明辅助任务、负样本软化方式、排序信号来源及具体损失形式,这些实现细节尚未验证。 作者报告,在语义文本相似度(STS)和迁移(TR)任务上的实验中,DALR 持续优于其所比较的先进基线。摘要未提供数据集、划分协议、指标、具体数值或基线名称,因而无法判断优势幅度与适用范围;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 与文本或刺激信息之间存在可用的配对关系及可信语义排序监督,负样本软化和排序蒸馏可能帮助减少语义相近样本被强行推离的问题。可考虑复用对齐目标,但需改造 EEG 编码器,并重新定义辅助相似度与排序监督;原研究依赖的监督来源和数据规模尚不明确。低信噪比、跨被试差异、通道不一致及小数据可能使语义排序失真,不能由文本任务结果推断 BCI 效果。一个可检验的小实验是在固定 EEG—刺激配对数据及跨被试划分下,对比二元对比学习与加入负样本软化、排序蒸馏后的表征检索表现,并检查语义近邻是否改善。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其利用辅助语义相似度软化负样本、结合排序蒸馏处理双层对齐的机制,但摘要不足以核实性能优势,其向 EEG 表征学习迁移的有效性尚未验证。

  5. OpenReview · EEG66

    利用预训练语言模型进行基于 EEG 的癫痫检测

    基于摘要分析。该研究面向基于 EEG 的癫痫检测,提出 PLM2EEG,将预训练语言模型用于 EEG 分析,以应对 EEG 自监督预训练的计算成本、低信噪比及高质量训练数据有限等问题。其核心贡献是结合 EEG Tokenization 与预训练语言模型,探索复用语言预训练表示处理生理信号的可行性。 机制上,EEG Tokenization 将每个通道的固定长度 EEG 片段作为 token,承载局部特征并与预训练语言模型的输入维度对齐;随后加入通道嵌入和位置嵌入,以保留信号的时空信息。第二个组件被称为 Frozen Pretrained Model,保留预训练语言模型的自注意力层和前馈层。摘要同时提到针对 EEG 任务进行微调,但哪些参数冻结、哪些参数更新,以及输入对齐方式、任务输出头和训练损失,尚未验证,不能据此认定整个语言模型均参与微调或均被冻结。 作者报告,在两个大型数据集的 EEG 任务上,PLM2EEG 显著优于已有自监督预训练模型,并改善跨数据集学习表现。摘要未提供数据集名称、被试数量、数值指标、对照模型和统计检验细节,因此目前无法判断优势幅度,也不能将跨数据集学习直接等同于无目标域训练的跨数据集泛化。 复现时需核对预训练语言模型及其规模、EEG 分段与预处理、通道配置、冻结与微调策略,以及被试和数据集划分。实验协议、消融及统计信息尚未验证;尤其需要确认性能提升与语言预训练、时空嵌入及任务适配各自的关系。该材料支持 EEG 癫痫检测方法研究,不足以推断其在其他 BCI 任务中的有效性或临床诊断价值。

  6. OpenReview · State space models70

    DSSM:用于人体动作生成的双状态空间模型

    基于摘要分析。该研究面向文本驱动的人体动作生成,针对词级文本描述与关节级动作表示之间特征信息量不均衡、影响潜在空间特征融合的问题,提出 Dual State Space Model(DSSM),通过从粗到细重建融合特征缓解模态间失衡。 机制上,DSSM 包含 Masked State Space Model(MSSM)与 Hierarchical State Space Block(HSSB)两个单元,并引入状态空间模型(SSM)以利用时序信息、降低计算复杂度。摘要未说明掩码对象、层级组织、融合位置、损失函数及训练与推理流程,这些细节尚未验证。作者声称这是首次将 SSM 引入文本驱动的动作序列生成,该优先性尚未独立核实。 作者报告,在 HumanML3D 与 KITML 基准数据集上达到 SOTA 表现;但摘要未提供具体指标、数值、数据划分或对照基线,因此无法判断优势幅度,也无法核对计算复杂度收益。实验协议、消融及统计信息尚未验证。摘要提供了 GitHub 代码地址,但代码完整性、依赖环境及复现条件尚未核验。 平台推测(待验证):其原问题是文本与动作序列的信息量不平衡,机制依赖文本—关节序列的跨模态对应关系;具体监督形式和训练规模尚未明确。假设 EEG 与文本或运动学信号的融合也受到模态信息量失衡影响,可考察粗到细融合重建与 SSM 时序建模的复用价值,但需改造 EEG 输入表示、通道处理及模态对齐方式。低信噪比、跨被试差异、通道配置变化与小数据可能使重建过程偏向更强模态,削弱 EEG 信息。一个可检验的小实验是在固定划分的配对 EEG—运动学任务中,对比常规融合与该重建机制,并通过削弱或移除 EEG 输入检验是否真正利用 EEG;这不构成已验证的 BCI 效果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得关注其以 MSSM 与 HSSB 从粗到细重建文本—动作融合特征的机制,但作者报告的性能优势及其对 EEG 多模态融合的适用性尚需分别核对与验证。

  7. OpenReview · Representation learning69

    DALR:用于多模态句子表征学习的双层对齐学习

    基于摘要分析。本文研究图像与文本参与的多模态句子表征学习,针对粗粒度对齐中的跨模态错位偏差与模态内语义分歧,提出 DALR,以跨模态一致性学习和模态内排序关系建模改善句子表征。 跨模态层面,DALR 的一致性学习模块对负样本进行软化,并利用辅助任务提供的语义相似度实现细粒度对齐。摘要未说明辅助任务类型、相似度计算方式及负样本软化的具体损失形式。模态内层面,作者认为句子关系不应仅由二元正负标签描述,因此将排序蒸馏与全局模态内对齐学习结合,以保留更细致的语义排序结构。其方法重点是同时处理跨模态对应关系和模态内关系,而非只强化图文配对。 作者报告,在 semantic textual similarity(STS)和 transfer(TR)任务上,DALR 持续优于所比较的先进基线。摘要未提供数据集、划分协议、基线名称、指标或具体数值,不能据此量化优势;实验协议、消融及统计信息尚未验证,也无法确认两个对齐层面的独立贡献。复现需进一步核对辅助任务监督来源、排序教师或排序目标的构造方式,以及训练数据和实现细节。 平台推测(待验证):若 EEG 与刺激文本具有明确配对关系,并能获得可靠的语义相似度监督,可检验负样本软化是否缓解语义相近刺激被当作负例的问题,以及排序蒸馏是否有助于保留 EEG—文本表征中的语义关系。可复用的是关系软化与排序约束思路;需改造 EEG 编码器、时间窗与配对规则,并核对文本语义排序是否适用于 EEG。低信噪比、跨被试差异、通道配置变化及小样本均可能使排序监督不可靠。一个可检验的小实验是在固定跨被试划分下,对同一 EEG—文本对齐基线分别加入负样本软化、排序蒸馏及两者组合,比较配对检索表现;这不是本文已验证的结果,已有 EEG 相关工作尚未检索确认。

  8. OpenReview · State space models71

    SSMLoRA:利用状态空间模型增强低秩适应

    基于摘要分析。SSMLoRA 针对语言模型参数高效微调中 LoRA 表现随插入位置变化、部分插入可能造成参数冗余的问题,引入状态空间模型(SSM)连接低秩矩阵,使适配过程能够利用前一低秩空间的计算,并支持更稀疏的插入。 机制上,摘要描述了输入到低秩空间的映射,以及低秩空间之间的计算复用;其目标不仅是减少可训练参数,还包括减少不必要的适配模块插入。SSM 状态如何传递、低秩矩阵如何连接、插入位置如何选择,以及训练损失与推理开销,均需全文核对,不能仅凭摘要确定具体结构。 作者报告,在 General Language Understanding Evaluation(GLUE)benchmark 上,SSMLoRA 使用 LoRA 一半的适配参数即可取得相当表现;这一结论限于摘要所述 GLUE 对照,基础模型、各任务指标、数据划分、低秩维度及参数统计口径尚未验证。作者还认为其结构有望处理更长输入序列,但摘要未提供长序列实验结果,因此不能视为已验证优势。实验协议、消融及统计信息尚未验证。摘要提供了代码仓库链接,代码完整性与可复现性仍待检查。 平台推测(待验证):若 EEG 预训练模型采用多处 LoRA 适配,可假设低秩空间之间的状态传递有助于减少插入点。可复用的是低秩适配与状态连接思路,需改造的是 EEG 骨干接口、跨模块状态定义及通道布局适配。该假设依赖可适配的预训练骨干和足够的任务监督;低信噪比、跨被试差异、通道变化及小样本可能使共享状态传播噪声或产生过拟合。一个可证伪的小实验是在固定跨被试划分与同一 EEG 骨干上,对比常规 LoRA、稀疏 LoRA 和 SSMLoRA,同时控制可训练参数预算与训练条件,检验收益是否来自状态连接而非参数配置。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 SSM 连接低秩空间是否能降低 LoRA 对插入位置的敏感性:作者报告在 GLUE 上以一半适配参数取得相当表现,但具体参数口径、插入方案与评估协议尚未验证。

  9. OpenReview · State space models67

    RRG-Mamba:基于状态空间模型的高效放射学报告生成

    基于摘要分析。该研究面向放射学报告生成,试图兼顾视觉特征的全局依赖建模与计算效率,提出基于 Mamba 的 RRG-Mamba 框架;主要贡献是在视觉特征序列建模中引入 rotary position encoding(RoPE),并设计全局依赖学习模块。 机制方面,作者将原版 Mamba 的位置编码对复杂空间依赖的表达限制作为改进动机,利用 RoPE 动态建模视觉特征序列中的相对位置信息,再通过全局依赖学习模块加强长程视觉依赖建模。摘要以状态空间模型的线性复杂度为效率动机,但没有提供完整框架的复杂度推导、模块结构、训练目标或推理流程,不能据此断言整个报告生成系统具有线性复杂度。 结果方面,作者报告在 IU X-Ray 和 MIMIC-CXR 等公开数据集上,相比现有模型,BLEU-4 提升 3.7%,并获得计算与内存效率收益。摘要未说明该提升对应哪个数据集、具体基线、数据划分,也未明确 3.7% 是相对增幅还是绝对百分点;效率收益同样缺少数值和硬件条件,因此不能用于跨协议比较。实验协议、消融及统计信息尚未验证。作者提供了代码链接,但代码完整性、运行环境与复现结果尚未核对。 平台推测(待验证):可迁移的机制假设是,相对位置建模与全局依赖学习可能帮助 EEG 长序列建模,但原任务依赖具有空间排列的影像特征及配套报告监督,不等于已验证的 EEG/BCI 方法。迁移时可考察 RoPE 与全局依赖模块,需重新定义时间位置和通道空间关系,并改造影像编码及报告生成部分;低信噪比、跨被试差异、通道布局变化和小数据可能削弱收益。一个可证伪的小实验是在同一 EEG 任务、固定被试划分和训练预算下,对比原版 Mamba、加入 RoPE 及加入完整改进模块的版本,同时记录任务指标、推理耗时与峰值内存。已有 EEG 相关工作尚未检索确认。

12月31日周二
  1. OpenReview · State space models84

    状态空间模型中状态的幻象

    基于摘要分析。本文研究面向 LLM 的状态空间模型(SSMs)是否比 transformer 更擅长表达顺序计算与状态跟踪;核心贡献是给出表达能力的复杂性分析,并以 Mamba-style SSMs 的状态跟踪实验作为补充。原论文的主要对象是语言模型架构及离散状态跟踪任务,并非 EEG 或 BCI。 SSMs 的递归形式与 RNNs 相近,容易让人将其内部状态理解为能够支持一般性的状态更新。作者的分析指出,所研究 SSMs 的表达能力仍受复杂性类 TC^0 限制,与 transformer 存在相似边界。作者据此认为,这类模型无法表达置换复合等状态跟踪计算,并将结论联系到特定记谱方式下的国际象棋走子跟踪、代码求值及长篇叙事中的实体跟踪。摘要未交代模型定义、精度、深度及序列长度等定理条件,不能将这一结论无条件推广到所有 SSM 变体或所有有限长度任务。 作者报告,Mamba-style SSMs 在状态跟踪实验中表现困难;摘要未提供数据集、划分、对照基线或量化指标,因此尚不能评估理论边界与实际误差之间的对应程度。实验协议、消融及统计信息尚未验证。 平台推测(待验证):该理论视角可用于审视 EEG 序列模型是否真正保留了任务所需的历史状态,但离散置换复合与连续、低信噪比 EEG 建模之间的对应关系尚未建立,不能据此判断 SSM 在 EEG 解码中的优劣。已有 EEG 相关工作尚未检索确认。

    阅读价值:该研究通过计算复杂性分析检验 SSM 的递归形式是否带来更强的状态跟踪能力,值得用于审视架构能力边界,但具体定理假设与实验适用范围仍需全文核对。

  2. OpenReview · State space models82

    状态空间模型中的状态幻象

    基于摘要分析。本文研究面向 LLMs 的状态空间模型(SSMs)是否比 transformer 更擅长表达序列计算与状态追踪;核心贡献是通过形式化分析挑战这一假设,并以 Mamba-style SSMs 的状态追踪实验补充理论论证。 SSMs 的递归形式与 RNNs 接近,但递归形式本身不必然意味着更强的计算表达能力。作者报告,其分析所覆盖的 SSMs 的表达能力受复杂度类 TC⁰ 限制,与 transformer 存在相似的限制,因此不能表达超出该类的计算。作者据此指出,这些模型不能解决排列复合等状态追踪问题,并进一步讨论特定记谱方式下的棋步追踪、代码求值及长篇叙事中的实体追踪。摘要未给出定理涉及的精度、序列长度、模型规模或其他假设,不能将结论无条件推广到所有 SSM 变体。 作者报告,Mamba-style SSMs 在状态追踪实验中确实表现困难;摘要未提供任务构造、数据划分、对照基线或量化指标,实验协议、消融及统计信息尚未验证。需区分理论上的表达能力限制与具体训练条件下的性能困难,二者不能直接等同。 平台推测(待验证):若 EEG 任务确实依赖多步离散状态更新,而非主要依赖局部波形或统计特征,该分析可用于提出“递归结构是否足以支持所需状态追踪”的假设。可复用的是状态追踪测试思路,需改造的是 EEG 输入编码、状态定义及监督目标;低信噪比、跨被试差异、通道变化和小数据可能使输入表征或训练问题掩盖表达能力限制。一个可检验的小实验是在同一 EEG 数据划分中构造明确的多步状态更新目标,对比 Mamba-style SSM 与 transformer,并分别检查单步识别及随序列长度变化的状态追踪表现。此实验仅检验特定设置下的行为,不能直接验证复杂度定理;已有 EEG 相关工作尚未检索确认。

    阅读价值:该文以计算复杂度分析和 Mamba-style SSMs 的实验检验,审视递归形式是否带来状态追踪表达能力优势,值得用于辨析架构中的“状态”与可实现的序列计算能力,但理论适用条件及 EEG 迁移价值尚未验证。

  3. OpenReview · State space models73

    VL-Mamba:探索状态空间模型在多模态学习中的应用

    基于摘要分析。本文研究状态空间模型(SSMs)能否作为 Transformer 的替代方案用于视觉—语言多模态学习,提出以预训练 Mamba 语言模型为核心的 VL-Mamba,并通过 MultiModal Connector(MMC)增强视觉序列建模。主要研究对象是视觉与文本信息的整合及模态对齐,而非神经信号或 BCI。 方法上,MMC 引入 Vision Selective Scan(VSS)模块;作者探索二维视觉选择性扫描机制在多模态学习中的应用,以及不同视觉编码器与预训练 Mamba 语言模型变体的组合。摘要未给出连接器的具体结构、扫描路径、损失函数、训练阶段或参数规模,这些实现细节尚未验证。作者将该工作称为首次探索 SSMs 在多模态学习中的应用,此优先性声明尚未独立核实。 结果方面,作者报告,在多个多模态基准上,VL-Mamba 与规模相近的小型 MLLMs 表现具有竞争力,并在部分评估中超过 LLaVA-1.5 的 7B 和 13B 版本。摘要未列出基准名称、指标、具体分数、数据划分或训练资源,因而不能据此判断整体优势,也不能将局部结果推广至所有任务。实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可供 EEG 多模态建模参考的机制是利用 SSM 建模序列,并以连接器对接异构模态表征;但原方法依赖视觉编码器、二维视觉结构和预训练语言模型,不能直接视为 EEG 方法。若用于 EEG—文本配对任务,可复用 Mamba 核心与连接器思路,但需改造 EEG 编码器及通道—时间扫描方式,并核对配对监督和训练数据规模。EEG 的低信噪比、通道布局差异、跨被试分布偏移及小样本条件均可能使迁移失败。一个可检验的小实验是在固定 EEG 编码器、训练数据及跨被试划分下,对比简单投影连接器与适配通道—时间结构的扫描连接器,检验扫描机制是否带来稳定增益。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以预训练 Mamba 与视觉选择性扫描连接器实现视觉—语言建模的机制及对照,但摘要中的性能结论仍需结合完整评估协议核对,尚无 EEG/BCI 有效性证据。