跳到正文
OpenReview · State space models· Jinyoung Park; Heeseon Kim; Kangwook Ko; Minbeom Kim; Changick Kim·· 2024-01-01精选AI 评分70

VideoMamba:时空选择性状态空间模型

VideoMamba: Spatio-Temporal Selective State Space Model

AI 导读

基于摘要分析。该研究面向视频识别,将纯 Mamba 架构改造为 VideoMamba,通过时空前向与后向 SSM 联合处理非顺序的空间信息和顺序的时间信息,旨在兼顾视频长程依赖建模与计算效率。 核心机制是利用 Mamba 的选择性状态空间模型,而非依赖自注意力。摘要以自注意力的二次复杂度与 Mamba 的线性复杂度作对照,但未给出视频输入的序列化方式、空间与时间扫描路径、双向信息融合方式或训练目标,因此不能据此推断具体网络结构。其方法关注点在于如何用状态空间计算协调视频中不同性质的时空关系,而不只是替换计算模块。 作者报告,VideoMamba 在多种视频理解基准上具有有竞争力的表现和较高效率,并能有效捕获长程依赖。摘要未列出基准名称、数据划分、对照模型、性能指标及资源测量条件,故这些结论目前只能按作者的定性报告理解;实验协议、消融及统计信息尚未验证。复现时需核对实现、训练配置,以及序列长度、输入分辨率和硬件条件下的实际效率。 平台推测(待验证):若 EEG 能被组织为具有明确时间顺序和通道空间关系的序列,时空双向选择性 SSM 可能为长时间窗建模提供可检验的机制假设。可复用的是选择性 SSM 与双向时序处理思路;需改造视频输入编码、通道空间组织和任务输出模块。EEG 的低信噪比、跨被试差异、通道布局变化及小数据规模可能使视频中的优势无法迁移,双向处理也不宜直接用于要求严格因果性的在线推理。一个小规模检验是在固定 EEG 任务与跨被试划分下,保持输入编码及训练预算一致,对比单向 SSM 与时空双向版本,并同时测量任务指标、显存和延迟。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其时空双向选择性 SSM 如何组织空间与时间信息,以及作者所称效率优势的评估条件;其对 EEG 长序列建模的价值尚未验证。

来源:OpenReview · State space models · openreview.net