S3M3D:用于三维目标检测的跨模态选择性状态空间调制
S3M3D: Cross-Modal Selective State Space Modulation for 3D Object Detection
基于摘要分析。该研究面向自动驾驶中的多模态三维目标检测,针对查询式方法对 LiDAR 与相机查询采用对称融合、未充分利用两者可靠性差异的问题,提出 S3M3D。其核心贡献是结合两个基于 Mamba 的组件,以 LiDAR 几何信息分别组织模态内交互和引导跨模态特征处理。 机制上,Spatially-Aware Mamba(SA-Mamba)替代 LiDAR 查询之间的自注意力:将查询投影到 BEV 坐标,采用递归 Z-order 序列化,再通过状态空间建模捕捉几何先验。LiDAR-Guided Mamba(LG-Mamba)则建立非对称引导关系,由较可靠的 LiDAR 查询动态调制相机查询的状态空间处理,使几何结构参与相机语义特征的细化。摘要未说明调制作用于哪些参数,也未提供损失、训练流程或计算开销,相关细节尚未验证。 作者报告,S3M3D 在 nuScenes 实验中达到 state-of-the-art 性能;摘要未给出具体指标、分数、数据划分和对照方法,因此不能量化其优势。实验协议、消融及统计信息尚未验证,复现还需核对序列化实现、查询构造、调制公式与训练配置。 平台推测(待验证):可迁移的假设是,在具有同步多模态输入、且辅助模态可靠性经过独立验证的 EEG 任务中,非对称状态空间调制可能比等权融合更能应对某一模态受噪声污染的情况。这不意味着 LiDAR 的几何优势可直接对应 EEG;BEV 与 Z-order 排序需替换为符合实际电极布局或时间结构的表示,辅助模态也不能预设为更可靠。低信噪比、跨被试可靠性变化、通道缺失和小数据可能使引导失效。一个可证伪的小实验是在同步 EEG 与辅助模态数据上,固定编码器和数据划分,对比对称融合与非对称调制,并分别向两种模态加入受控噪声,检验收益是否依赖可靠性方向。已有 EEG 相关工作尚未检索确认。
来源:OpenReview · State space models · openreview.net