跳到正文
OpenReview · State space models· Jiahuan Zhou; Kai Zhu; Zhenyu Cui; Zichen Liu; Xu Zou; Gang Hua·· 2025-12-31精选AI 评分71

通过聚合与传播时空信息实现视频理解的状态空间提示学习

State Space Prompting via Gathering and Spreading Spatio-Temporal Information for Video Understanding

AI 导读

基于摘要分析。本文研究预训练状态空间模型在视频理解中的参数高效适配:针对视觉提示 token 在顺序压缩过程中难以充分捕获时空上下文的问题,提出 State Space Prompting(SSP),结合帧内与帧间提示,聚合并传播具有判别性的时空信息。 核心机制:原研究对象是视频,而非 EEG 或 BCI。摘要指出,预训练状态空间模型以线性复杂度顺序压缩视频视觉 token,但这一过程可能限制帧内空间信息与帧间时间信息的有效传播。SSP 使用 Intra-Frame Gathering(IFG)聚合每帧中的关键空间信息,并使用 Inter-Frame Spreading(IFS)在不同帧之间传播判别性时空信息,通过自适应平衡与压缩形成互补。摘要未说明具体提示参数化方式、模块运算、损失函数、预训练骨干及冻结策略,尚不能据此重建实现。 结果与证据边界:作者报告,在四个视频基准数据集上,SSP 相比现有 SOTA 方法平均提升 2.76%,同时减少微调参数开销。摘要未提供数据集名称、任务划分、指标名称、对照方法及参数量;该数值应保留原文百分比表述,不能擅自解释为 Accuracy 提升或百分点差异。实验协议、消融及统计信息尚未验证,发表或接收状态也不能由来源推断。 平台推测(待验证):其机制可形成一个 EEG 迁移假设,即将通道与时间窗组织为时空 token,用类似 IFG 的模块汇聚窗内通道信息,再用类似 IFS 的模块传播跨窗判别信息,以缓解顺序压缩中的信息损失。可借鉴的是提示聚合与传播思路;需要改造的是视觉空间结构、通道位置编码及时间窗定义。该假设依赖适合 EEG 的预训练状态空间骨干与明确的下游监督,不能直接套用视频权重。低信噪比、跨被试差异、通道布局变化及小数据训练可能使传播模块放大噪声或过拟合。一个可检验的小实验是在固定 EEG 骨干、相同数据划分与匹配微调参数预算下,对比普通提示、仅窗内聚合及窗内聚合加跨窗传播,并分别报告被试内与跨被试结果。相关 EEG 工作尚未检索确认。

阅读价值

值得关注其通过帧内聚合与帧间传播改善状态空间模型提示学习的机制,但视频任务中的作者报告结果尚不能证明其对 EEG/BCI 的有效性。

来源:OpenReview · State space models · openreview.net