DySS:面向多摄像头视频高效 3D 目标检测的动态查询与状态空间学习
DySS: Dynamic Queries and State-Space Learning for Efficient 3D Object Detection from Multi-Camera Videos
基于摘要分析。DySS 研究自动驾驶中基于多摄像头视频的鸟瞰图(BEV)3D 目标检测,旨在降低密集 BEV 特征构建以及多帧稀疏查询处理的计算成本。其核心贡献是结合状态空间模型(SSM)的时序摘要与动态查询更新,以维持精简且有效的检测查询集合。 机制上,DySS 使用 SSM 按时间步顺序处理采样特征,并通过未来预测和掩码重建辅助任务,促进模型学习运动及对应关系。SSM 状态用于提供紧凑的场景摘要;基于状态空间学习得到的特征,查询通过合并、移除和拆分操作动态更新。摘要未提供采样方式、查询操作判据、损失形式及权重,相关实现尚未验证。 作者报告,在 nuScenes test 划分上取得 65.31 NDS、57.4 mAP,并称优于最新方法,但摘要未列出具体对照及其协议。在 nuScenes val 划分上,作者报告 56.2 NDS、46.2 mAP,以及 33 FPS 的实时推理速度。上述结果属于不同划分,不宜直接比较;输入帧数、硬件、计时范围、实验协议、消融及统计信息尚未验证。 平台推测(待验证):可迁移的假设是利用 SSM 压缩时序信息,并按状态动态调整潜在查询,以缓解长时 EEG 序列的计算负担。但原方法依赖多摄像头时空特征和目标检测监督,EEG 并不存在天然对应的物体查询与空间拆分语义。SSM 时序汇总及辅助训练思路可供考察,查询初始化、合并与拆分规则、监督目标则需改造;低信噪比、跨被试差异、通道变化和小数据可能使查询更新不稳定,或丢弃弱而有用的信号。一个可检验的小实验是在固定跨被试划分、相同输入窗口及训练预算下,对比固定查询与动态查询的 SSM 解码器,同时报告同一任务指标、推理延迟和查询数量,检验是否存在效率收益而不损害解码性能。已有 EEG 相关工作尚未检索确认。
值得阅读的是以 SSM 时序状态驱动查询合并、移除与拆分的计算压缩机制;作者报告了 nuScenes 检测与推理速度结果,但其对 EEG 的适用性尚未验证。
来源:OpenReview · State space models · openreview.net