MambaLCT:通过长时上下文状态空间模型增强目标跟踪
MambaLCT: Boosting Tracking via Long-term Context State Space Model
基于摘要分析。研究面向视频目标跟踪,针对既有方法主要利用相邻帧或视频片段、难以充分利用长期上下文的问题,提出 MambaLCT,将首帧至当前帧的目标变化线索持续聚合,并用于模板帧与搜索帧之间的关系建模。 核心机制是单向 Context Mamba 模块:沿时间维扫描帧特征,通过选择性扫描机制将目标相关信息压缩到隐状态中,持续更新整个已观测视频序列的目标变化线索。随后,这些线索被注入注意力机制,为模板与搜索帧的匹配提供时间信息。其方法特点是通过状态聚合延伸上下文,而非仅依赖局部帧间信息;摘要尚未给出状态更新公式、注意力注入方式、训练目标或计算复杂度。 作者报告,长时上下文改善了复杂场景中的目标感知能力,MambaLCT 在六个基准上取得新的 SOTA 性能并保持实时运行速度。摘要未列出基准名称、评估指标、数值、对照方法及硬件条件,因此这些性能与速度声明尚不能独立核对;实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,持续更新的隐状态可能缓解 EEG 长时序建模中固定窗口难以覆盖缓慢变化的问题,但视频目标变化并不等同于神经信号状态变化。原方法依赖有序帧特征及模板—搜索帧关系,其具体监督与训练规模尚未验证;可考察复用单向状态聚合模块,输入特征和注意力接口则需针对 EEG 任务改造。低信噪比可能使状态累积伪迹,跨被试差异、通道配置变化及小数据训练也可能削弱其效果。一个可证伪的小实验是在固定 EEG 任务、划分和特征编码器条件下,对比重置状态的短窗口模型与连续状态模型,检查长上下文是否改善预先指定的任务指标,并核对在线状态更新仅使用当前及历史信号。已有 EEG 相关工作尚未检索确认;本摘要不构成 BCI 有效性的证据。
值得核对其将历史目标变化压缩为持续更新状态、再注入模板与搜索帧注意力的机制,但摘要中的实时性和六个基准最优性能声明,以及向 EEG 长时序建模的适用性,尚需验证。
来源:OpenReview · State space models · openreview.net