跳到正文
OpenReview · State space models· Jiuming Liu; Jinru Han; Lihao Liu; Angelica I. Avilés-Rivero; Chaokang Jiang; Zhe Liu; Hesheng Wang·· 2025-01-01精选AI 评分76

Mamba4D:基于解耦空间—时间状态空间模型的高效 4D 点云视频理解

Mamba4D: Efficient 4D Point Cloud Video Understanding with Disentangled Spatial-Temporal State Space Models

AI 导读

基于摘要分析。Mamba4D 研究的是 4D 点云视频理解,针对点分布不规则、无序以及跨帧不一致的问题,提出完全基于状态空间模型(SSMs)的骨干网络,通过解耦空间与时间建模,处理局部几何结构和长时序动态,并降低长视频计算开销。 机制上,统一的空间—时间 Mamba 块包含 Intra-frame Spatial Mamba 与 Inter-frame Temporal Mamba:前者在一定时间步幅内编码局部相似的几何结构,再将局部相关 token 交给后者,以线性复杂度整合整个视频中的长期点特征。其设计意图是避免摘要所述 Transformer 类 4D 骨干的二次复杂度瓶颈;具体点排序、邻域构建、时序对应、损失与训练流程尚未验证。 作者报告,在 MSR-Action3D 动作识别、HOI4D 动作分割和 Synthia4D 语义分割上获得竞争性表现,分别给出“+10.4% accuracy”“+0.7 F1 Score”和“+0.19 mIoU”。摘要未明确这些增益对应的基线、划分及指标尺度,因此不将百分比改写为百分点,也不跨任务比较。作者另报告 GPU 显存减少 87.5%、速度提升 5.36 倍,尤其强调长视频场景,但对应序列长度、硬件、批量大小及比较对象尚未验证。摘要提供了代码发布地址;实现与论文的一致性、实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 任务具有可利用的电极空间关系和长时序结构,空间局部编码与时间 SSM 分工可能用于缓解长窗口建模开销;这是假设,而非本文验证的结果。可复用的是解耦建模思路,需改造点云几何邻域与 token 构建,使其适配电极布局和信号片段。点云局部几何相似性并不等同于 EEG 通道相关性,低信噪比、跨被试差异、通道缺失及小数据可能使该假设失效。可在固定 EEG 数据划分、训练预算和窗口长度下,对比空间—时间解耦 SSM 与仅时间 SSM,分别核对任务指标、显存和延迟。相关 EEG 工作尚未检索确认。

阅读价值

值得阅读其面向不规则点云的空间—时间解耦机制及长序列效率评估,但摘要中的性能增益与资源节省仍需结合对照基线和实验协议核对,不能直接视为 EEG/BCI 有效性的证据。

来源:OpenReview · State space models · openreview.net