状态空间模型与 Transformer 相结合:3D 目标检测的新范式
State Space Model Meets Transformer: A New Paradigm for 3D Object Detection
基于摘要分析。本文研究室内点云的 3D 目标检测,针对 DETR 类方法在多层解码过程中固定场景点特征、后续层贡献有限的问题,提出交互式状态空间模型检测范式 DEST,使场景点特征与检测查询特征能够共同更新。 核心机制是将查询建模为 SSM 的系统状态,将场景点建模为系统输入,并通过状态依赖的 SSM 参数化使系统状态承担检测查询的作用。面向点云与 SSM,作者进一步设计序列化、双向扫描、状态间注意力及门控前馈网络:分别支持场景点之间的双向特征交互、状态点关系建模及通道间关联增强。作者称这是首次以该状态—输入对应关系实现查询与场景特征的线性复杂度同步更新;该优先性及复杂度覆盖哪些模块尚未验证。 作者报告,相对 GroupFree 基线,DEST 方法在 ScanNet V2 与 SUN RGB-D 上的 AP50 增量分别为 +5.3 与 +3.2;摘要未明确增量单位、数据划分及其他评估条件。作者还报告,基于 VDETR 的方法在上述数据集达到新的 SOTA,但摘要未提供对应分数及完整比较范围。实验协议、消融及统计信息尚未验证,代码与复现条件也需核对全文。 平台推测(待验证):该机制依赖可序列化的场景点、查询表示及目标检测训练任务,其可借鉴之处是让输入特征与任务状态共同更新,而非直接复用点云检测器。若用于 EEG 序列建模,可考虑保留交互式 SSM 与状态间关系建模,同时改造输入编码、序列化规则、查询含义及任务输出;这是假设,不是已验证的 BCI 贡献。EEG 的低信噪比、通道布局差异及小样本条件可能使动态更新不稳定。一个可检验的小实验是在固定的跨被试 EEG 划分下,对比固定输入特征与交互更新版本,匹配训练预算并记录分类性能和计算开销。已有 EEG 相关工作尚未检索确认。
值得关注其将检测查询建模为 SSM 系统状态、同步更新场景与查询特征的机制,但性能增益与线性复杂度的适用范围仍需全文核对,不能据此认定其对 EEG/BCI 有效。
来源:OpenReview · State space models · openreview.net