跳到正文

算法、任务与模态

SSM 最新动态

SSM 研究索引;按可核对的标签归档,不以热度评价质量。

566 条精选近 30 天 44 条共收录 715 条

更新

精选归档 · 第 27 页

1月1日周日第 521–540 条
  1. OpenReview · State space models78

    学习稳定且鲁棒的线性参数变化状态空间模型

    基于摘要分析。本文研究如何学习具有预先稳定性或鲁棒性保证的线性参数变化状态空间模型(LPV-SS),提出两种直接参数化,使模型在训练中任意参数取值下满足收缩意义上的稳定性,或使 Lipschitz 常数不超过用户指定的 γ。 核心机制是通过参数化限定可学习模型的性质,而非依赖训练后检查;摘要分别描述了收缩稳定性与 Lipschitz 上界保证,不能据此认为每个模型同时满足两者。直接参数化允许使用无约束优化,训练后的模型仍属于 LPV-SS 类,可用于后续凸分析或控制器设计。具体参数映射、保证成立的假设、损失函数及优化设置尚未验证。 作者报告在一个 LPV 系统辨识问题上展示了方法的有效性,但摘要未给出数据来源、划分、对照基线或定量指标,因此无法判断辨识精度、鲁棒性收益及其与表达能力之间的权衡;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 动态建模能够明确构造状态、输入与时变调度变量,并获得用于系统辨识的观测序列,这类受约束参数化可能帮助控制长时预测的不稳定性。可复用部分是稳定性或 Lipschitz 受限的状态空间参数化,需改造的部分是 EEG 观测映射、调度变量定义与训练目标。低信噪比、跨被试与通道差异可能破坏建模假设,小数据下也可能出现约束过强导致欠拟合。一个可检验的小实验是在固定通道配置、按时间段隔离训练与测试的 EEG 预测任务上,对照相同状态维度的无约束 LPV-SS,比较多步预测误差及扰动下的输出敏感性;该实验仅检验建模假设,不代表已证实的 BCI 收益。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是将收缩稳定性或用户指定的 Lipschitz 上界直接纳入 LPV-SS 参数化、同时允许无约束优化的机制;其用于 EEG 动态建模的价值尚未验证。

  2. OpenReview · State space models73

    用于多视图强化学习的信息论状态空间模型

    基于摘要分析。本文研究 Multi-View Reinforcement Learning(MVRL):智能体如何利用多个来源的观测学习最优控制,尤其关注观测之间的时间依赖,以及部分视图间歇性缺失的问题。作者提出 Fuse2Control(F2C),以信息论方法从多视图观测序列中捕获底层状态空间模型,为控制任务聚合相关信息。 机制与贡献:原问题并非一般的多视图表示学习,而是面向控制的时序状态建模。其核心思路是从多来源序列中提取与任务相关的潜在状态,处理单纯提取多视图表示难以直接适用于控制的问题。摘要未提供信息论目标的具体形式、状态转移与观测模型的参数化方式、训练损失或推理流程,不能据此将 F2C 等同于某类具体状态空间网络。 结果与证据边界:作者报告,在多种控制任务的实验中,F2C 能有效聚合多个视图中的任务相关信息,随视图数量线性扩展,并对任意视图缺失情形保持鲁棒性。摘要未列明任务名称、数据规模、对照基线、指标或数值,也未说明线性扩展对应计算量、内存还是其他量;缺失模式、实验协议、消融及统计信息尚未验证。 平台推测(待验证):若将多来源神经信号或辅助传感器表示为时间对齐的观测视图,该方法可能对应 BCI 中多模态融合与输入缺失的瓶颈。可考察复用状态建模与视图聚合思路,但观测编码、时序对齐及控制反馈需针对 EEG 改造;低信噪比、跨被试差异和小样本可能使潜在状态捕获非任务因素。一个可检验的假设是:在固定数据划分和训练预算下,加入控制相关状态建模能否比简单融合更好地抵抗视图缺失;可先在具备控制反馈的多视图小规模任务中,对照完整输入与预设缺失模式测试。原文未报告 EEG/BCI 验证,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得关注其将多视图时序观测融合为控制相关潜在状态、并处理间歇性视图缺失的机制,但具体信息论目标、线性扩展的计量对象及缺失协议仍需全文核对。

  3. OpenReview · State space models81

    用于长程时空建模的卷积状态空间模型

    基于摘要分析。本文研究长时空序列中复杂空间相关性与长程时间依赖的联合建模,提出卷积状态空间模型(ConvSSM),并据此构建高效变体 ConvS5;主要研究对象是时空序列预测与生成,而非 EEG 或 BCI。 核心机制是结合 ConvLSTM 的张量状态建模思路与 S4、S5 等状态空间方法的长序列建模能力。作者将并行扫描用于卷积递推,以实现次二次复杂度的并行化与快速自回归生成,并建立 ConvSSM 与 SSM 动力学之间的等价关系,用于指导长程依赖建模的参数化和初始化。摘要未提供具体状态结构、损失、训练流程或复杂度推导细节。 作者报告,在长预测时域的 Moving-MNIST 实验中,ConvS5 的表现显著优于 Transformers 和 ConvLSTM,训练速度为 ConvLSTM 的 3 倍,样本生成速度为 Transformers 的 400 倍;这些倍率仅对应所述实验背景,硬件、序列长度、模型规模及计时口径尚未验证。作者还报告,在 DMLab、Minecraft 和 Habitat 预测基准上,其表现达到或超过当时先进方法;具体指标、数据划分、实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设 EEG 通道间关系能够表示为适合卷积的空间结构,张量状态与长程递推可能用于联合建模通道相关性和长时间上下文。可考虑复用卷积状态递推与并行扫描,但需改造通道空间表示、输入编码及任务输出;不规则电极布局、跨被试差异、低信噪比和小数据可能削弱其优势。一个可检验的小实验是在固定 Cross-subject 划分与训练预算下,对比 ConvS5、ConvLSTM 和 Transformer 在不同 EEG 窗口长度上的同一任务指标、训练耗时及推理耗时,并核对空间卷积是否带来稳定增益。此为迁移假设,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其卷积递推的并行扫描及与 SSM 动力学的等价关系,这为兼顾空间结构与长程依赖提供了具体方法路径,但摘要中的效率优势及其 EEG 适用性仍需分别验证。

  4. OpenReview · State space models77

    使用状态空间 Transformer 进行高效电影场景检测

    基于摘要分析。研究针对电影场景检测需要跨越长视频片段进行推理、而常见视频识别模型侧重短时分析的问题,提出可端到端训练的 TranS4mer,以分层的局部与长程建模捕获电影场景线索。原论文研究对象是电影视频,并非 EEG 或 BCI。 核心模块 S4A 结合 structured state-space sequence(S4)与自注意力(A)。输入为已划分为镜头的帧序列:模块先通过自注意力捕获镜头内部的短程依赖,再用状态空间运算聚合镜头之间的长程线索;多个 S4A 模块堆叠构成 TranS4mer。其机制依赖帧—镜头的层级结构,区别于仅对短视频片段建模的方案。具体监督信号、损失函数、模块数量、训练规模与镜头划分方式尚未验证。 作者报告,TranS4mer 在 MovieNet、BBC 和 OVSD 三个电影场景检测数据集上优于此前方法;相较标准 Transformer,速度为其 2 倍,所需 GPU 显存约为其三分之一。摘要未给出检测指标、数据划分、基线配置及测速硬件、序列长度等条件,因此这些结果不能脱离原评估协议比较。实验协议、消融及统计信息尚未验证。作者表示将发布代码和模型,材料不能确认其已公开。 平台推测(待验证):迁移假设是,将 EEG 长记录划为局部时间窗,以自注意力处理窗内关系、以 S4 聚合跨窗依赖,可能缓解长序列全局注意力的计算负担。可复用的是局部—长程分工,需改造视频特征输入、分段策略及任务输出,并重新设计监督目标。EEG 缺少天然镜头边界,低信噪比、跨被试差异、通道配置变化及小数据训练均可能使该结构失效。可检验的小实验是在同一 EEG 数据划分与训练预算下,对比该结构、纯自注意力及纯 S4,检验长上下文是否带来任务指标收益,并记录显存与运行时间;这不是原论文已证实的结论,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得关注其以镜头内自注意力与镜头间状态空间运算分工处理长视频的机制;作者报告了效率优势,但能否迁移到 EEG 长序列建模尚未验证。

  5. OpenReview · State space models74

    基于 Gaussian process 的深度状态空间模型的序贯估计

    基于摘要分析。本文研究状态空间模型及深度状态空间模型中未知函数与潜在过程的序贯估计,提出结合随机特征 Gaussian process 与粒子过滤的方法,并给出使用不同特征集的集成版本。 核心机制是区分两类未知量:潜在过程取值属于高度非线性未知量,随机特征 Gaussian process 的固定参数则属于条件线性未知量。方法在计算状态预测密度时将后者积分消去,因此不需要用粒子表示这些参数;非线性潜在状态仍通过粒子过滤估计。集成版本为每个成员配置各自的特征集。摘要未说明具体随机特征构造、集成组合规则,以及深度 Gaussian process 的结构。 作者报告,在若干实验中,该方法能够跟踪潜在过程,但恢复结果存在尺度与旋转不确定性,因此不能据此认定其恢复了潜在状态的绝对坐标或具有直接生理可解释性。实验任务、数据集、粒子数、对照基线、评价指标、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 时序可由非线性潜在动力学与观测过程描述,这种参数积分消去机制可能用于在线潜在状态估计,减少需要粒子采样的未知量。可复用模块是随机特征函数表示及条件参数边缘化;需改造的是 EEG 观测模型、噪声模型和通道映射。该假设依赖状态空间建模假设及条件线性结构成立,低信噪比、跨被试动力学差异、通道变化和小数据下的参数不确定性均可能使跟踪失效。一个可检验的小实验是使用具有已知潜在状态的模拟 EEG,在相同数据和计算预算下比较参数积分消去与参数粒子采样,分别评价经尺度与旋转对齐后的状态误差、预测误差和运行开销。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的具体机制是利用条件线性结构将随机特征 Gaussian process 参数积分消去,使粒子过滤不必对这些参数采样;其计算收益及 EEG 潜在状态估计价值尚未验证。

  6. OpenReview · State space models76

    用于第一视角三维手部轨迹预测的不确定性感知状态空间 Transformer

    研究针对第一视角 RGB 视频中的手部轨迹预测,提出从早期观测预测三维空间轨迹的任务,并设计不确定性感知状态空间 Transformer(USST),以回应仅在二维图像空间预测难以满足三维应用需求的问题。基于摘要分析,未取得论文全文。 USST 在经典状态空间模型框架下结合注意力机制与偶然不确定性(aleatoric uncertainty);摘要还提出利用速度约束和大型视觉 Transformer 上的 visual prompt tuning(VPT)进一步增强模型。状态变量、状态转移与观测关系、不确定性的参数化方式、损失函数及训练与推理流程尚未验证,不能据此将其等同于其他现代序列状态空间架构。 作者开发了用于采集高质量三维手部轨迹的标注流程。作者报告,在 H2O 和 EgoPAT3D 数据集的二维与三维轨迹预测评估中,USST 优于所比较的方法;摘要未提供具体指标、数值、数据划分或对照配置,实验协议、消融及统计信息尚未验证。作者称代码与数据已公开发布,但本次未核验其完整性及复现条件。 平台推测(待验证):其潜在方法联系在于,将动态状态建模与观测不确定性结合,可能为 EEG 驱动的连续运动轨迹解码提供思路。假设是注意力与不确定性建模能帮助区分运动动态和噪声观测,而非原论文已证明 BCI 效果。原任务依赖视频观测与三维轨迹标注;迁移时需替换视觉编码及 VPT 模块,并处理 EEG 与运动轨迹的时间对齐。低信噪比、跨被试差异、通道变化与小数据可能导致状态估计或不确定性校准失效。一个可检验的小实验是在固定被试内划分的配对 EEG—轨迹数据上,比较相同解码骨干加入或不加入不确定性建模后的轨迹误差与校准表现。已有相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读的是 USST 将注意力机制与偶然不确定性纳入经典状态空间框架来预测三维手部轨迹的思路,但其具体实现、对照效果及 EEG/BCI 迁移价值尚未验证。

  7. OpenReview · State space models76

    用于上下文强化学习的结构化状态空间模型

    基于摘要分析。该研究面向上下文强化学习,改造 S4 的一个变体,使隐藏状态能够并行初始化与重置,以兼顾强化学习中的状态管理、长序列记忆和计算效率。主要研究对象是部分可观测环境与连续控制元学习任务,而非 EEG 或 BCI。 机制上,作者利用结构化状态空间序列模型的长程建模能力、快速推理与可并行训练特性,将隐藏状态的初始化和重置纳入并行处理。摘要未说明具体状态更新方程、改造方式、训练目标或上下文组织方式,这些实现细节尚未验证。 作者报告,改造后的架构在序列长度维度上的渐近运行效率优于 Transformers,并在一个简单的记忆任务上表现优于 RNN。在所评估的一组部分可观测环境中,作者报告模型表现优于 RNN,同时运行速度超过其五倍;摘要未给出环境名称、性能指标、硬件、计时口径及匹配的模型规模,因此该速度结论不能直接外推到其他任务。元学习评估中,智能体面对随机采样的连续控制环境,且环境观测与动作经过随机采样的线性投影;作者报告模型在该任务上取得较强表现,并能适应分布外留出任务,但具体分数、划分方式与适应过程尚未验证。 平台推测(待验证):若 EEG 任务需要保留长时间上下文,同时在试次或会话边界显式重置状态,该并行状态管理机制可能提供可复用思路。原研究依赖连续交互轨迹及强化学习训练信号,不能直接等同于 EEG 分类;可考虑复用序列骨干与重置机制,但输入编码、训练目标和边界定义需改造。低信噪比、通道差异、跨被试分布变化及小数据规模可能削弱长程记忆收益。一个可检验的小实验是在固定被试内 EEG 划分、相同输入与训练预算下,对比该状态空间实现与 RNN,随上下文长度变化测量任务指标、推理延迟及边界重置后的表现,不预设其优势。已有 EEG 相关工作尚未检索确认。 摘要提供代码仓库 s5rl。实验协议、消融及统计信息尚未验证,复现前需核对状态重置实现、环境配置、基线匹配和速度测量条件。

    阅读价值:值得核对其并行初始化与重置隐藏状态的实现,以及部分可观测强化学习中的速度—性能权衡;该机制对跨回合长序列建模有参考价值,但 EEG/BCI 适用性尚未验证。

  8. OpenReview · State space models75

    使用结构化状态空间模型增强用于在线语音识别的 Conformer

    基于摘要分析。该研究针对只能访问左侧上下文的在线语音识别,将结构化状态空间序列模型 S4 引入神经编码器,以参数高效的方式利用任意长的历史上下文,并研究其与卷积的组合方式。主要研究对象是在线 ASR,而非 EEG 或 BCI。 机制与对照:作者通过系统消融比较 S4 变体,并提出两种与卷积结合的新方案。作者报告,最有效的设计是将使用实值循环权重的小型 S4 与局部卷积堆叠,使长历史建模与局部特征提取互补。摘要未提供具体堆叠位置、状态维度、训练损失及推理实现,相关细节尚未验证。 结果:在仅访问左侧上下文的在线 ASR 设置下,作者报告最佳模型在 Librispeech 测试集上的 WER 分别为 4.01% 和 8.53%,优于对卷积进行了充分调优的 Conformer。摘要未标明两个数值对应的测试子集名称,不能自行补全;训练数据划分、模型规模匹配、延迟与计算开销,以及消融细节和统计信息尚未验证。 平台推测(待验证):迁移假设是,S4 的历史状态建模与局部卷积的互补机制可能适用于需要因果处理的连续 EEG 解码,缓解有限窗口难以保留长时信息的问题。原方法依赖有序语音序列及 ASR 任务监督,摘要未明确监督形式和训练规模;迁移时可复用因果序列模块,但需改造多通道 EEG 输入映射、采样率适配和任务输出。低信噪比可能使历史状态积累噪声,跨被试分布变化、通道配置差异和小数据也可能削弱收益。 一个可检验的小实验是在同一连续 EEG 任务、相同因果输入和数据划分下,对比局部卷积编码器与加入小型 S4 的编码器,并控制参数量、历史长度和推理延迟,检验增益是否来自更长历史。该建议不是论文已验证结果;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其 S4 与局部卷积的互补设计及变体消融,以评估长历史建模对在线识别的贡献;对流式 EEG 的适用性尚未验证。

  9. OpenReview · State space models72

    非线性状态空间模型的变分系统辨识

    基于摘要分析。本文研究非线性状态空间模型的参数估计,采用变分推断(VI)构建与最大似然估计密切相关的系统辨识方法,核心贡献是将模型估计表述为确定性、可处理且可由标准优化工具求解的优化问题。 技术机制:原问题涉及具有隐状态的非线性动态系统,作者通过 VI 获得模型参数估计,并进一步给出适用于加性高斯噪声系统的特化方法。摘要未说明变分分布的形式、状态后验近似、优化目标的具体表达及求解流程,因而尚不能判断其计算成本、近似误差或对非线性形式的限制。 评估证据:作者报告在多种模拟与真实实例上进行数值检验,重点考察对参数初始化的鲁棒性,并报告相较于先进替代方法的有利比较。摘要未提供实例名称、数据规模、对照方法或量化指标;实验协议、消融及统计信息尚未验证,不能据此认定方法普遍优于现有系统辨识算法。 平台推测(待验证):假设 EEG 时间序列可由合适的隐状态动态模型描述,该变分系统辨识路径可能用于估计潜在动态过程及观测参数,但这不等于已验证的 BCI 解码收益。可复用的是变分参数估计与优化框架;需要改造的是 EEG 的状态与观测模型、噪声假设及通道映射。低信噪比、伪迹导致的非高斯噪声、跨被试差异、通道变化和小数据条件可能造成模型失配或参数不可辨识。一个可检验的小实验是在固定数据划分、模型结构和计算预算下,对同一 EEG 状态空间模型使用多组参数初始化,比较该方法与可复现基线的留出序列预测误差及参数估计稳定性。已有 EEG 相关工作尚未检索确认;复现仍需核对全文中的目标函数、优化设置、模型定义与实现条件。

    阅读价值:值得关注其将非线性状态空间模型参数估计转化为确定性、可处理的变分优化问题的路径,以及对参数初始化鲁棒性的评估;具体比较优势与 EEG 适用性尚未验证。

  10. OpenReview · State space models81

    通过近似对角化增强长序列状态空间模型的鲁棒性

    基于摘要分析。本文研究长序列状态空间模型(SSMs)中 HiPPO 初始化的对角化病态问题,提出基于非正规算子伪谱理论的“先扰动再对角化”(perturb-then-diagonalize,PTD)方法,并据此构建 S4-PTD 和 S5-PTD,旨在兼顾简化实现与输入扰动鲁棒性。 原问题与机制:S4 使用 HiPPO 初始化的对角加低秩结构;S4D 和 S5 则采用纯对角结构,以简化实现、提高计算效率并允许通道通信。摘要指出,对 HiPPO 框架进行对角化本身是病态问题。PTD 通过扰动后再对角化实现非正规矩阵的近似对角化,作者将其描述为具有后向稳定性的通用方法;后向稳定性不应直接等同于对任意输入噪声均稳健。 理论与结果:作者报告,通过分析不同初始化方案的传递函数,S4-PTD/S5-PTD 初始化强收敛于 HiPPO 框架,而 S4D/S5 初始化仅实现弱收敛。作者进一步报告,新模型对 Fourier-mode 噪声扰动输入具有鲁棒性,而所比较的 S4D/S5 未表现出这一性质。在 Long-Range Arena 基准上,作者报告 S5-PTD 的平均 Accuracy 为 87.6%;摘要未提供各任务分数、数据划分、平均方式及对照数值,不能据此量化相对提升。扰动构造、收敛条件、训练配置、实验协议、消融及统计信息尚未验证。 平台推测(待验证):其潜在 EEG 对应点是长时序建模中的数值稳定性与频率结构噪声敏感性,而非已证实的 BCI 性能提升。可复用模块是 SSM 初始化及 PTD 处理;需改造的是 EEG 多通道输入映射、采样尺度和任务输出。摘要未给出原任务监督方式与训练规模,迁移时需核对这些依赖。低信噪比、跨被试分布变化、通道变化及小数据训练可能使初始化收益被其他误差掩盖,Fourier-mode 扰动也不能代表全部 EEG 伪迹。一个可检验的假设是:在固定 EEG 数据划分、模型规模与训练预算下,对比 S5 与 S5-PTD,测试干净输入及不同强度频率扰动下的 Accuracy 变化,判断鲁棒性收益是否成立。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其如何将非正规矩阵的近似对角化稳定性转化为长序列模型的输入扰动鲁棒性;摘要提供了理论与基准结果线索,但其对 EEG 的适用性尚未验证。

  11. OpenReview · State space models72

    无需采样的概率深度状态空间模型

    基于摘要分析。本文研究未知参数形式的动态系统建模,提出用于概率深度状态空间模型(ProDSSM)的确定性推断算法,以支持训练和测试阶段的高效近似计算。作者报告,该方法可用于多种任务,并在预测性能与计算预算之间取得更优的平衡,但摘要未提供具体任务、对照方法或量化结果。 核心机制:状态空间模型(SSM)以潜在状态描述系统演化,潜在状态遵循一阶马尔可夫动态,每个观测由相应潜在状态生成。ProDSSM 使用具有不确定权重的神经网络描述状态转移与观测生成模型,从而表达未知形式的动态规律及模型不确定性。本文的贡献集中于这类模型的确定性近似推断;“首次”属于作者声明,尚未独立核实。摘要未说明不确定性分布、近似传播方法、训练目标及推理细节,不能据此判断具体实现。 证据边界:数据集、样本规模、训练与测试划分、计算预算的计量方式、对照基线、实验协议、消融及统计信息尚未验证。复现需取得正文及实现信息,核对近似误差、计算开销与预测性能是否在相同协议下评估。 平台推测(待验证):若 EEG 任务可表述为潜在状态驱动的时序预测,确定性近似推断可能有助于降低不确定性建模的计算成本。可考虑复用状态转移与不确定性推断机制,但需改造观测模型以适配多通道 EEG,并核对其对时序连续性、监督形式与数据规模的要求。低信噪比、跨被试差异、通道变化及小数据可能使状态估计或不确定性近似失准。一个可检验的小实验是在固定被试内 EEG 时序划分下,以相同模型和训练预算比较该方法与采样推断的预测误差、不确定性校准及运行时间;这只是迁移假设,并非本文已验证的 EEG 结果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其如何在神经网络权重不确定的状态空间模型中实现无需采样的近似推断,以及作者报告的预测性能与计算预算权衡;其 EEG 适用性尚未验证。

  12. OpenReview · State space models75

    ODE-RSSM:从不规则采样数据中学习随机循环状态空间模型

    基于摘要分析。该研究针对具有非线性和随机性的输入—输出系统,提出连续时间随机循环状态空间模型 ODE-RSSM,以解决多数离散时间 SSM 难以处理不规则采样观测的问题。其主要贡献是用 ODE-Net 描述相邻观测时点之间的潜状态演化,并通过重参数化支持不同时间跨度的 ODE 批量并行求解。 机制上,ODE-RSSM 将连续时间演化引入潜状态建模;批量求解方法受到积分上下限等价线性变换的启发,旨在提高不规则采样序列的训练效率。摘要未说明随机状态的具体分布、观测模型、损失函数及 ODE 求解器配置,这些实现条件尚未验证。 作者报告,在三个输入—输出数据集的开环预测评估中,ODE-RSSM 优于所比较的基线,包括预测时点间隔不均匀、间隔长度分布变化的情形。其中一个数据集为具有较强长期延迟和随机性的私有工业数据集 rollout。摘要未提供具体指标、数值、数据划分或基线名称,实验协议、消融及统计信息尚未验证。材料提供了代码仓库,但代码可运行性及私有数据实验的可复现性尚未验证。 平台推测(待验证):若 EEG 任务存在采样缺失、异步多模态观测或不规则事件间隔,连续时间潜状态演化和非均匀时间跨度批量求解可能具有方法参考价值;原领域有效不等于 BCI 有效。可复用部分是时间演化与求解机制,需改造观测编码、输入—输出定义和随机状态建模以适配 EEG 通道及任务监督。低信噪比、跨被试差异、通道缺失和小数据可能使潜状态估计不稳定,连续轨迹也可能难以描述短暂事件。一个可检验的小实验是在固定被试内划分下,对同一 EEG 预测任务施加不同程度的时间点删除,比较 ODE-RSSM 与离散时间模型在相同可见观测及预测时点上的误差和运行成本。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是其面向不规则时间间隔的连续时间潜状态建模,以及非均匀时间跨度下批量 ODE 求解的重参数化机制;这些机制对缺失或异步神经信号的适用性尚未验证。

12月31日周六
  1. OpenReview · State space models70

    使用状态空间模型建模歌词中的情绪动态

    基于摘要分析。该研究针对歌词内部情绪强度随时间变化、而相关标注稀缺的问题,将每首歌曲视为时间序列,结合句子级情绪预测器、State Space Model(SSM)与 Expectation-Maximization(EM)过程,预测完整的歌词情绪动态。其主要贡献是在不需要歌曲级监督的情况下,利用序列建模补充逐句预测。 机制与结果:句子级预测器提供情绪预测,SSM 与 EM 用于生成歌曲整体的情绪变化轨迹;摘要未说明具体状态定义、观测模型、转移假设或参数估计细节。作者报告,在其歌词情绪动态实验中,该方法持续改善句子级基线的表现,且不需要已标注歌曲。这里“不需要歌曲级标注”不等于整个方法完全无监督,句子级预测器的训练数据与监督来源仍需核对。作者还通过案例分析展示方法的收益与局限,但摘要未给出具体案例结论。数据集、划分、指标、改进幅度、消融及统计信息尚未验证。 平台推测(待验证):假设 EEG 情绪解码的窗口级预测包含噪声,而真实情绪具有可建模的时间连续性,可探索复用“局部预测器+SSM+EM”的组合。原方法依赖按歌词句序排列的情绪预测,迁移时需改造为 EEG 时间窗及相应观测模型,并处理窗口重叠、通道差异和跨被试分布变化。低信噪比下,局部预测偏差可能被时序估计传播;过强的连续性假设也可能抹平真实的快速变化,小数据下参数估计可能不稳定。一个可检验的小实验是在固定被试与训练/测试划分下,对比同一窗口级预测器、简单时序平滑和 SSM+EM 后处理,使用相同指标评估,并检查快速情绪变化片段是否受损。原论文结果并非 EEG 或 BCI 有效性的证据,已有 EEG 相关工作尚未检索确认。

    阅读价值:该研究值得关注的具体原因是将句子级情绪预测与 SSM、EM 结合,在不依赖歌曲级标注的条件下建模情绪动态;作者报告其优于句子级基线,但具体评估协议和改进幅度尚未验证。

10月17日周一
  1. OpenReview · State space models78

    基于模型的强化学习中深度状态空间模型的不确定性研究

    基于摘要分析。本文研究基于模型的强化学习中 Recurrent State Space Models(RSSMs)的不确定性建模与推断机制,提出 Variational Recurrent Kalman Network(VRKN),以更明确地区分偶然不确定性与认知不确定性。原论文主要研究对象是强化学习中的环境动态模型,并非 EEG 解码或 BCI。 作者报告,RSSMs 使用的次优推断方案会使模型高估真实系统的偶然不确定性,而这种高估产生的隐式正则化有助于其在基于模型的强化学习中取得效果。作者进一步提出假说:该正则化可能发挥与显式建模认知不确定性相似的作用。这一功能解释应与作者报告的高估现象区分,不能视为已普遍证实的等价关系。 VRKN 在潜在空间中使用 Kalman 更新进行精确平滑推断,并通过 Monte Carlo Dropout 建模认知不确定性。作者指出,Kalman 更新使其能够自然处理缺失观测,以及每个时间步观测数量不同的传感器融合问题。具体潜在状态假设、训练目标与平滑推断实现尚未验证。 作者报告,在需要准确刻画偶然不确定性的任务中,以 VRKN 替代 RSSM 可改善性能,而在确定性的标准基准上表现相当。摘要未提供任务名称、数据规模、评价指标或具体数值;实验协议、消融及统计信息尚未验证,不能据此推断其在所有强化学习任务中均优于 RSSM。 平台推测(待验证):若将 EEG 建模为潜在动态过程的带噪观测,这种区分两类不确定性并处理缺失观测的机制,可能对应信号缺失或异步多模态融合问题。可考察复用潜在状态更新与不确定性建模组件,但需改造 EEG 观测编码、时间尺度及监督目标;低信噪比、跨被试分布变化、通道配置差异和小数据可能使潜在动态假设或不确定性估计失效。一个可检验的小实验是在固定被试内划分、训练数据和下游任务的条件下,比较 RSSM 与 VRKN 在逐步增加缺失时间窗时的预测误差与不确定性校准表现。原领域结果不等于 BCI 有效性,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是作者对 RSSMs 中偶然不确定性高估与隐式正则化关系的分析,以及用 VRKN 分开建模两类不确定性的替代方案;其对 EEG 缺失观测与多模态融合的价值尚未验证。

1月1日周六
  1. OpenReview · State space models75

    采用 Laplace 近似的 Gaussian process 状态空间模型

    基于摘要分析。本文研究 Gaussian process 状态空间模型的近似推断:这类模型以 Gaussian process 描述状态转移,提供概率化、非参数的时间序列建模,但其推断难以精确求解。核心贡献是结合 Gaussian process 后验的随机变分推断与时间状态的 Laplace 近似,在保留模型条件依赖的同时联合处理时间状态,避免逐时序学习。 机制与对照:摘要指出,既有变分方法或对近似后验引入简化的独立性假设,或按时间顺序迭代学习状态,后者使当前状态后验的学习依赖过去状态后验的收敛。本文通过 Laplace 近似联合处理时间状态,针对这一优化瓶颈提出替代推断方案。具体后验参数化、优化目标、计算复杂度及近似实现尚未验证。 结果与证据边界:作者报告,在合成数据及一系列基准数据集上,该方法具有计算效率优势,并较所比较的先进替代方法获得更好的预测校准。摘要未提供数据集名称、划分、对照方法、校准指标或数值,因此无法判断优势幅度及适用条件;实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,联合状态推断可能有助于 EEG 潜在动态建模中的优化与不确定性估计,而非直接构成 BCI 解码方法。该路径依赖有序时间观测和可用的观测模型;可复用的是推断框架,需改造的是 EEG 观测映射及噪声模型。低信噪比、跨被试与通道差异、小数据,以及潜在后验偏离 Laplace 局部近似条件,都可能限制效果。可先在固定被试内划分的 EEG 时间序列预测任务上,保持状态转移与观测模型一致,仅比较联合 Laplace 推断与顺序推断的预测校准和优化耗时,以检验该机制是否带来收益。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以 Laplace 近似联合处理时间状态、同时保留模型条件依赖的推断机制;作者报告预测校准优于对照方法,但具体评估协议及其对 EEG 的适用性尚未验证。

  2. OpenReview · State space models77

    使用状态空间 Transformer 的高效电影场景检测

    基于摘要分析。本文研究电影场景检测:场景理解需要跨越较长电影片段整合线索,而多数视频识别模型侧重短时分析。作者提出可端到端训练的 State-Space Transformer 模型 TranS4mer,通过结合局部自注意力与长程状态空间运算,建模电影中的短程和长程依赖。 核心模块 S4A 结合 structured state-space sequence(S4)与自注意力(A)。输入是已划分为电影镜头的帧序列;模块先用自注意力捕获镜头内短程依赖,再用状态空间运算聚合镜头间长程线索。TranS4mer 由多个 S4A 模块堆叠构成,具体堆叠数量、特征提取方式、损失函数及训练配置尚未验证。该设计的关键在于利用镜头这一层级结构,分别处理局部关系与跨镜头上下文。 作者报告,在 MovieNet、BBC 和 OVSD 三个电影场景检测数据集上,TranS4mer 优于此前方法;相较标准 Transformer,速度为其 2 倍,GPU 显存需求约为其三分之一。摘要未给出检测指标、划分协议、具体对照配置及效率测量条件,因此这些结果仅适用于作者所述电影场景检测评估,实验协议、消融及统计信息尚未验证。作者表示将发布代码和模型,材料不能确认其已公开。 平台推测(待验证):可检验的迁移假设是,将局部交互与长程状态聚合分离,可能缓解长时 EEG 建模的计算负担。可复用的是 S4A 的分工机制,但电影镜头结构不能直接等同于 EEG 时间窗;需要改造信号编码、时间分段与任务监督。摘要也不足以判断原方法的数据规模要求。低信噪比、跨被试差异、通道布局变化及小数据训练均可能使局部注意力学习到噪声,或使长程聚合混合不同生理状态。一个小规模可证伪实验是在同一 EEG 数据集、固定跨被试划分及相同输入长度和训练预算下,对比局部注意力加 S4、纯注意力和纯 S4,核对任务指标与速度、显存,并测试时间窗长度变化。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是 TranS4mer 将镜头内自注意力与镜头间 S4 状态空间聚合分工结合的长序列建模机制;其效率优势由作者报告,对 EEG 的迁移价值尚未验证。

  3. OpenReview · State space models74

    用于状态空间模型可扩展推断的两阶段贝叶斯优化

    基于摘要分析。本文研究状态空间模型(SSMs)在大参数空间中的高成本推断问题,提出两阶段贝叶斯优化(BO):先在由原参数线性组合构成的低维空间中搜索,再利用第一阶段的解限定原参数空间中的第二阶段搜索范围。主要研究对象是通用动力系统的模型推断,而非 EEG 或 BCI 专用模型。 核心机制是利用粒子滤波近似推断函数(例如对数似然或对数后验)的梯度,并对梯度协方差进行特征值分解,提取能捕获推断函数主要变化的低维方向。该方法压缩的是参数搜索空间,而不是直接压缩观测信号。第一阶段 BO 在低维空间寻找解,第二阶段 BO 回到原空间,在由该解确定的范围内进一步优化。 作者报告,该两阶段策略可使推断过程中的参数搜索空间获得指数级缩减,并通过多项实验展示准确性与速度,其中包括肠道微生物群落的真实宏基因组数据。摘要未提供具体指标、参数维度、运行时间、对照方法或数据划分,因此尚不能量化其优势;实验协议、消融及统计信息尚未验证。复现还需核对粒子滤波与梯度近似的实现、低维方向的选择标准、两阶段搜索范围的构造及 BO 配置。 平台推测(待验证):若 EEG 状态空间模型存在高维参数推断瓶颈,且目标函数主要沿少量参数方向变化,该机制可能用于降低模型拟合的搜索成本。可复用的是梯度协方差降维与两阶段 BO 流程,需改造的是 EEG 的状态转移、观测模型及似然计算。低信噪比可能使梯度估计不稳定,被试与通道差异可能改变重要方向,小数据则可能使降维方向难以可靠估计。一个可证伪的小实验是在固定 EEG 模型、训练/验证划分和计算预算下,对比原空间 BO 与两阶段 BO 的验证集对数似然、耗时及多次运行稳定性。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其基于推断函数梯度协方差构建低维搜索空间、再回到原参数空间优化的机制,以及降维是否能在保留推断精度的同时降低计算成本;其 EEG 适用性尚未验证。

  4. OpenReview · State space models71

    深度 Gaussian Process 状态空间模型的推断

    基于摘要分析。本文研究深度 Gaussian Process 状态空间模型下的观测序列处理问题,在状态转移函数与观测函数均未知的条件下,提出估计模型未知量的方法,并支持无需全部历史信息的增量学习。 核心机制是以随机特征构建模型中的 Gaussian Process,并据此处理潜在状态推断与未知模型的学习。作者还提出集成版本,每个集成成员使用各自的特征集合。摘要未说明深度结构、随机特征的具体构造、推断目标、更新公式,以及历史信息如何被保留或压缩,这些实现细节尚未验证。 作者报告,在计算机仿真中,该方法能够跟踪潜在状态,但存在尺度与旋转不确定性。因此,仿真结论不等于恢复具有唯一坐标或明确物理含义的潜在状态。仿真系统、序列长度、对照基线、误差指标、消融及统计信息尚未验证;摘要也未提供真实神经信号实验依据。 平台推测(待验证):若 EEG 可被近似描述为潜在动态经未知观测函数产生的序列,该方法可能为在线潜在状态估计提供思路。可复用部分是随机特征表示与增量更新机制;应用于 EEG 则需处理多通道观测、伪迹和噪声,并检验被试及会话变化下的稳定性。低信噪比、小数据和通道配置变化可能削弱可辨识性,尺度与旋转不确定性也会影响潜在状态的跨被试解释。一个可检验的小实验是在带已知潜在状态、非线性多通道观测和可控噪声的仿真序列上,对比该方法与标准状态空间基线的在线跟踪误差,并分别报告对齐前与尺度、旋转对齐后的结果。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得关注其以随机特征构建深度 Gaussian Process 状态空间模型并增量估计未知动态的机制,但潜在状态仅在尺度与旋转不确定性下得到跟踪,EEG 适用性尚未验证。

  5. OpenReview · State space models75

    基于扩散模型与结构化状态空间模型的时间序列插补与预测

    基于摘要分析。本文研究时间序列缺失值插补,并提出 SSSD,将条件扩散模型与结构化状态空间模型结合,也评估其时间序列预测能力。主要贡献是利用生成建模与长程依赖建模的组合,处理不同缺失情境,尤其是 blackout-missing 场景。 机制上,扩散模型承担生成建模,结构化状态空间模型作为内部架构,旨在捕获时间序列的长期依赖。摘要未提供条件信息如何输入、扩散训练目标、状态空间模块配置、采样流程,以及插补与预测任务如何组织,这些实现细节尚未验证。 作者报告:在多种数据集与不同缺失情境下,SSSD 的概率插补和预测表现达到或超过所比较的先进方法;在 blackout-missing 场景中,既有方法未能给出有意义的结果。该结论目前仅有摘要支持,具体数据集、缺失比例与模式、数据划分、对照基线、指标数值、消融及统计信息尚未验证,不能据此判断不同协议下的优势幅度。 平台推测(待验证):若 EEG 数据具有可利用的时间依赖,SSSD 的生成式插补机制可能用于连续信号缺失片段恢复,但通用时间序列结果不等于 BCI 有效性。可考虑复用扩散与状态空间模块,改造多通道条件输入、缺失掩码及信号预处理;其适用性依赖观测上下文和训练数据能否覆盖目标信号分布。低信噪比、跨被试差异、通道布局变化及小数据可能导致生成结果看似合理却不保留任务相关信息。一个可检验的小实验是在固定被试内划分下,仅对测试片段施加不同长度的连续遮挡,与简单插值及明确的时序插补基线比较,同时检查重建误差与下游任务表现,避免仅凭波形相似性判断有效。已有 EEG 相关工作尚未检索确认,复现所需代码、配置与计算条件尚未验证。

    阅读价值:值得阅读的具体原因是 SSSD 将条件扩散与结构化状态空间模型结合用于时序缺失值插补,并考察 blackout-missing 场景;其对 EEG 连续缺失片段的适用性尚未验证。

  6. OpenReview · State space models80

    使用状态空间视频模型进行长电影片段分类

    基于摘要分析。本文研究长电影片段分类中的长程时序推理问题,提出 ViS4mer,将 Transformer 的短程时空特征提取与结构化状态空间序列(S4)层的长程建模结合,以缓解长序列自注意力的二次计算成本。 核心机制是使用标准 Transformer encoder 提取短程时空特征,再交由多尺度时序 S4 decoder 进行长程推理。decoder 各层逐步降低时空特征分辨率与通道维度,在压缩表示的同时建模长程时空依赖。其方法价值在于局部特征提取和长程推理的模块分工,而非将整个视频处理流程完全替换为 S4。 作者报告,相对于对应的纯自注意力模型,ViS4mer 速度为其 2.63 倍,GPU 显存需求为其八分之一;硬件、输入长度、批量大小及计时口径尚未验证。作者报告,在 Long Video Understanding(LVU)benchmark 的 9 项长电影视频分类任务中,6 项达到当时的最先进结果,并在 Breakfast 和 COIN 程序性活动数据集上取得有竞争力的结果。具体任务指标、数据划分、对照配置、消融及统计信息尚未验证,不能据此比较不同评估协议。摘要提供了公开代码地址,但运行环境、预训练依赖及复现完整性尚未核对。 平台推测(待验证):这一机制可对应长时段 EEG 建模中全局注意力成本较高的瓶颈,但视频结果不等于 BCI 效果。迁移假设依赖于任务确有长程时序信息,以及局部 EEG 特征能保留该信息;可复用 S4 长程推理模块,需改造视频时空编码和多尺度降采样,使其适配 EEG 通道、采样率及任务监督。低信噪比、跨被试分布差异、通道配置变化和小数据可能使压缩过程丢失短暂 ERP 或其他判别线索。一个可检验的小实验是固定 EEG 局部编码器与数据划分,仅比较 S4 和自注意力长程模块,在不同输入时长下记录任务指标、推理时间及显存,并严格隔离训练与测试被试。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其将短程 Transformer 特征提取与多尺度 S4 长程推理结合的机制及效率对照,但作者报告的视频任务收益尚不能视为 EEG/BCI 有效性的证据。