MAMBA4D:基于解耦空间—时间状态空间模型的高效长序列点云视频理解
MAMBA4D: Efficient Long-Sequence Point Cloud Video Understanding with Disentangled Spatial-Temporal State Space Models
基于摘要分析。MAMBA4D 面向 4D 点云视频理解,针对点分布不规则、无序、跨帧不一致,以及 Transformer 长序列处理成本较高的问题,提出空间—时间解耦的状态空间模型(SSMs)骨干网络。其主要研究对象是动态三维点云,任务包括人体动作识别与 4D 语义分割,并非 EEG 或 BCI。 机制上,模型先解耦原始 4D 序列中的空间与时间,再通过 Intra-frame Spatial Mamba 和 Inter-frame Temporal Mamba 建立时空关联。前者在一定时间搜索步幅内编码局部相似或相关的几何结构,以捕获短期动态;后者接收局部关联 token,以线性复杂度整合整个视频的点特征,建模长程运动依赖。摘要未提供具体排序策略、状态更新形式、损失函数及训练设置。 作者报告,该方法在人类动作识别和 4D 语义分割任务上优于对照方法;其中,在 MSR-Action3D 的长视频序列设置下,相较基于 Transformer 的对照,GPU 显存占用减少 87.5%,速度达到 5.36 倍,并报告准确率提升最高为“+10.4%”。摘要未说明该准确率增幅是相对百分比还是百分点,也未给出序列长度、数据划分、具体基线和硬件条件,因此这些数值不能脱离原评估背景比较。实验协议、消融及统计信息尚未验证。 平台推测(待验证):可迁移的假设是,将局部空间关联与全局时间建模分离,可能有助于降低长时 EEG 建模的资源开销;但点云几何邻域与 EEG 通道关系并不等价。时间 SSM 模块可作为候选复用部分,空间模块则需根据电极拓扑与信号关系改造。低信噪比、跨被试差异、通道配置变化及小数据训练都可能使局部关联失效或导致过拟合。一个可证伪的小实验是在固定跨被试划分、输入时长与训练预算下,对比改造后的解耦 SSM 和 Transformer,同时测量 Accuracy、显存与推理时间,并消融空间模块。已有 EEG 相关工作尚未检索确认。
值得核对其空间—时间解耦机制及长序列效率对照,但摘要中的性能优势依赖尚未验证的序列长度、硬件和评估协议,不能直接视为 EEG/BCI 有效性的证据。
来源:OpenReview · State space models · openreview.net