跳到正文
OpenReview · State space models· Xiao Wang; Chao wang; Shiao Wang; Xixi Wang; Zhicheng Zhao; Lin Zhu; Bo Jiang·· 2024-01-01精选AI 评分70

MambaEVT:使用状态空间模型的基于事件流的视觉目标跟踪

MambaEVT: Event Stream based Visual Object Tracking using State Space Model

AI 导读

基于摘要分析。MambaEVT 研究事件相机视觉目标跟踪,针对现有方法使用 vision Transformer 与静态目标模板所面临的性能瓶颈,提出以 Mamba 状态空间模型为骨干、结合动态与静态模板的跟踪框架。其主要研究对象是视觉事件流,并非 EEG 或 BCI。 机制上,搜索区域与目标模板共同输入 vision Mamba,进行特征提取与交互;搜索区域的输出 tokens 再输入跟踪头完成目标定位。动态模板由 Memory Mamba 网络更新,更新过程考虑目标模板库中样本的多样性,并调整模板记忆模块。摘要未提供事件流表示方式、模板选择与更新条件、损失函数或训练流程,这些实现细节尚未验证。摘要所述线性复杂度针对状态空间模型骨干,不能直接等同于完整系统的端到端计算成本。 作者报告,该方法在 EventVOT、VisEvent 和 FE240hz 等大规模数据集上取得了准确性与计算成本之间的良好平衡,但摘要未给出具体指标、分数、数据划分、对照基线或运行成本测量条件,无法据此量化收益。实验协议、消融及统计信息尚未验证;尤其需核对动态模板相对静态模板的独立贡献,以及记忆更新在目标外观变化或遮挡时的稳定性。作者表示将发布源代码,当前材料不能确认其已公开或具备完整复现条件。 平台推测(待验证):可迁移的假设是,以状态空间模型处理长时序,并用动态模板记忆适应信号表征随时间变化,或可用于 EEG 跨会话漂移研究。但视觉方法依赖搜索区域、目标模板及定位任务结构,EEG 需重新设计通道与时间表示、模板含义及任务输出,不能直接复用视觉定位头。低信噪比、小样本与被试差异可能使记忆更新吸收噪声或错误预测。一个可证伪的小实验是在固定跨会话 EEG 任务与相同骨干下比较静态模板和动态记忆,明确更新可用信息,并同时记录任务指标与推理成本。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的是其以线性复杂度状态空间模型联合处理搜索区域与目标模板,并通过 Memory Mamba 更新模板记忆的机制;具体性能收益及向 EEG 时序任务迁移的有效性尚未验证。

来源:OpenReview · State space models · openreview.net