FreqLift:用于 LiDAR-Camera 三维目标检测的 BEV 融合与跨频状态空间建模
FreqLift: BEV Fusion and Cross-Frequency State Space Modeling for LiDAR-Camera 3D Object Detection
基于摘要分析。本文研究 LiDAR-Camera 三维目标检测中局部结构细节受损,以及相机深度估计和投影误差污染融合表示的问题,提出结合 BEV(鸟瞰图)融合与跨频状态空间建模的 FreqLift。其主要研究对象是空间感知与目标检测,而非 EEG 或 BCI。 机制上,CameraBEVRefiner 先修正相机 BEV,再与 LiDAR BEV 融合;WaveLift 通过多级小波分解和 Wavelet Cross-Gate 建模高、低频交互;Freq-Mamba 则利用低频结构差异和 BEV 位置坐标调制状态空间模型,以增强融合表示的结构建模。摘要未提供小波基、分解级数、门控公式、状态调制形式及训练损失,具体实现尚未验证。 作者报告,在 nuScenes 验证集上,FreqLift 达到 71.2% mAP 和 73.1% NDS,LiDAR-only 变体 FreqLift-L 达到 67.1% mAP 和 71.0% NDS。作者报告的消融将相对 LiDAR-only 变体的 4.1 个百分点 mAP 增益分解为直接相机融合贡献的 1.4 个百分点,以及 CameraBEVRefiner 贡献的 2.7 个百分点。这一分解不能单独确定 WaveLift 或 Freq-Mamba 的贡献;对应消融、训练配置及统计信息尚未验证。 平台推测(待验证):可迁移假设是,小波高低频交互与状态空间调制可能帮助 EEG 表征兼顾慢变结构与快速变化,但原方法依赖空间 BEV 表示、位置坐标和多模态对齐,不能直接等同于 EEG 的频带建模。可考虑复用小波交互思路,并将坐标调制改为时间或电极位置调制;相机 BEV 修正模块则需重新设计。低信噪比下的高频伪迹、跨被试频谱差异、通道布局变化及小数据过拟合均可能使迁移失败。一个可证伪的小实验是在固定 Cross-subject EEG 划分、匹配训练预算下,对比基础状态空间模型与增加小波交互的变体,并测试噪声扰动后的表现。已有 EEG 相关工作尚未检索确认,该实验仅用于检验迁移假设。
值得核对其相机 BEV 误差修正与跨频状态空间建模如何分别贡献检测性能;摘要提供了相机融合增益分解,但其对 EEG/BCI 的适用性尚未验证。
来源:OpenReview · State space models · openreview.net