跳到正文
OpenReview · State space models·· 25 天前精选AI 评分79

TORUS:利用异质数据与状态空间模型扩展开放词汇跟踪

TORUS: Scaling Open-Vocabulary Tracking with Heterogeneous Data and State-Space Models

AI 导读

基于摘要分析。本文研究开放词汇多目标跟踪(OVMOT)的训练数据瓶颈:大词汇量检测图像丰富,但带标注的跟踪视频稀缺且时间标注稀疏。TORUS 联合利用检测图像、词汇集合不相交的视频和合成伪视频训练在线跟踪器,以结合图像的类别覆盖与视频的真实时序信息,而非仅依赖图像模拟运动或人工标注视频。 核心机制是冻结开放词汇检测器,添加选择性状态空间模型 Mamba 记忆以跨帧传播轨迹。类别无关置信度头将轨迹生命周期管理与分类解耦,避免预测类别变化直接导致轨迹终止;spatial-semantic federated loss 则对目标存在性监督施加掩码,避免标注不完整时把未标注对象作为背景惩罚。摘要未提供记忆状态更新、掩码构造及损失公式,具体实现尚未验证。 作者报告,在不使用任何 TAO 标注、采用 ResNet-50 骨干的条件下,TORUS 在 TAO OVMOT 上取得 Base TETA 42.5、Novel TETA 42.1,相比其所称的现有最佳方法分别提高 2.9 和 6.8 个点;对照方法及完整评估协议尚未验证。作者还报告,同一组未调优权重零样本泛化至 DanceTrack、YouTube-VIS 2021 和 VisDrone-MOT,分别达到 HOTA 57.7、mAP 42.9 和 TETA 42.3。这些属于不同任务与指标,不能直接横向比较。摘要报告完全在线运行速度为 14.7 FPS,但末句截断,硬件与完整提示词配置尚未验证。 复现需核对各训练数据来源与混合方式、合成伪视频生成流程、开放词汇检测器及冻结范围,并检查两项设计与 Mamba 记忆各自的消融贡献。实验协议、消融及统计信息尚未验证。 平台推测(待验证):可迁移的假设主要是不完整标签下的监督掩码,以及类别预测与状态持续性解耦,而非视觉跟踪效果本身。它们依赖可识别的对象轨迹与标注覆盖信息;对应 EEG 时,需重新定义时序状态、有效标签掩码和通道输入,不能直接复用检测头。低信噪比、跨被试分布变化与小数据可能造成错误状态持续积累。可在具有明确部分标签的 EEG 时序任务中,固定编码器和数据划分,对比掩码监督与将未标注片段视为负例的训练方式,并单独检验状态记忆贡献。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 TORUS 如何以类别无关置信度和不完整标注掩码统一异质训练数据,以及 Mamba 轨迹记忆对跨数据集泛化的实际贡献;其 EEG/BCI 适用性尚未验证。

来源:OpenReview · State space models · openreview.net