跳到正文
OpenReview · State space models· Rajeev Yasarla; Shizhong Han; Hong Cai; Fatih Porikli·· 2025-01-01精选AI 评分76

DySS:通过动态查询与状态空间学习实现高效多摄像头视频 3D 目标检测

DySS: Dynamic Queries and State-Space Learning for Efficient 3D Object Detection from Multi-Camera Videos

AI 导读

基于摘要分析。DySS 研究自动驾驶中的多摄像头视频鸟瞰图(BEV)3D 目标检测,针对稠密 BEV 特征构建成本高、稀疏查询方法仍需较多查询且随视频帧数增加而变贵的问题,结合状态空间学习与动态查询,压缩时序场景信息并精简检测查询。 核心机制是用状态空间模型(SSM)按时间步顺序处理采样特征,并通过未来预测和掩码重建辅助任务,促进模型学习运动及对应关系。SSM 状态作为场景摘要,再用于驱动查询的合并、移除与拆分,以维持紧凑且有效的查询集合。摘要未给出采样方式、SSM 具体结构、辅助损失定义与权重,以及查询操作的触发规则,这些实现细节尚未验证。 作者报告:在 nuScenes test split 上,DySS 获得 65.31 NDS 和 57.4 mAP,并称其超过当时最先进方法;在 val split 上,获得 56.2 NDS、46.2 mAP,并达到 33 FPS。两个划分的结果不能直接混作同一评估条件;摘要未提供具体对照方法、输入帧数、硬件及测速设置,因此领先幅度和实时性适用范围尚未验证。实验协议、消融及统计信息尚未验证。 平台推测(待验证):可迁移的假设是,SSM 的时序摘要与未来预测、掩码重建辅助训练可能有助于 EEG 长序列建模,但原研究依赖多摄像头空间特征、物体运动对应关系和检测监督,不能直接视为 BCI 有效性的证据。可考虑复用时序建模与辅助训练机制;输入编码及重建目标需按 EEG 通道和时间结构改造,动态查询的合并、移除、拆分则需要重新定义其语义。低信噪比、跨被试差异、通道变化和小数据可能使未来预测偏向噪声或使查询精简丢失弱任务信号。 一个可检验的小实验是在固定 EEG 任务、相同数据划分与输入长度下,对比同一 SSM 使用和不使用这两项辅助训练的结果,分别核对任务指标与推理成本,并确保预训练不接触测试数据;这仅检验辅助训练的迁移假设,不验证整套 DySS。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其时序状态压缩与动态查询精简如何共同平衡检测精度和推理成本,但摘要尚不足以确认各模块的独立贡献或其对 EEG 的适用性。

来源:OpenReview · State space models · openreview.net