跳到正文
OpenReview · State space models· Chuxin Wang; Wenfei Yang; Xiang Liu; Tianzhu Zhang·· 2025-01-23精选AI 评分77

状态空间模型与 Transformer 相结合:3D 目标检测的新范式

State Space Model Meets Transformer: A New Paradigm for 3D Object Detection

AI 导读

基于摘要分析。本文研究室内点云的 3D 目标检测:针对 DETR 类方法在多层解码中仅迭代细化目标查询、场景点特征保持固定的问题,提出采用交互式状态空间模型的 DEST,使查询特征与场景点特征能够共同更新。 核心机制是将目标查询建模为系统状态、场景点建模为系统输入,并通过状态依赖的 SSM 参数化支持查询与输入之间的迭代交互。针对点云与 SSM 的特性,方法还引入序列化和双向扫描以实现点特征的双向交互,以 inter-state attention 建模状态点之间的关系,并使用门控前馈网络增强通道间关联。作者称该框架可在线性复杂度下同步更新两类特征,并声称这是首次采用上述状态与输入对应方式;具体参数化、复杂度计算范围及实现细节尚未验证。 作者报告,在两个室内 3D 检测数据集上,相对 GroupFree 基线,DEST 在 ScanNet V2 和 SUN RGB-D 上的 AP₅₀ 增量分别为 +5.3 和 +3.2;摘要未明确数值尺度、数据划分及训练配置。作者还报告,基于 VDETR 的方法在这两个数据集上取得新的 SOTA,但摘要未提供对应分数或完整对照。实验协议、消融及统计信息尚未验证,不能据此判断各模块的独立贡献。 平台推测(待验证):可检验的迁移假设是,将任务查询作为状态、EEG 时空特征作为输入,允许信号表示随查询同步更新,可能比固定输入特征的解码方式更适合任务相关信息提取。这一路径依赖可序列化的输入表示与任务监督;状态—输入交互模块可能复用,但点云序列化和空间扫描需按 EEG 时间与通道结构改造。低信噪比可能使交互放大伪迹,通道差异、跨被试分布偏移及小样本也可能削弱效果。一个小规模验证可在同一 EEG 任务、同一跨被试划分和匹配训练预算下,对比固定特征解码与同步更新机制,并检验通道扰动后的性能稳定性。以上不是本文已验证的 BCI 结果,已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 DEST 如何通过状态依赖的 SSM 参数化同步更新查询与场景点特征,以及其相对 GroupFree、VDETR 的增益是否来自交互机制;迁移至 EEG 的有效性尚未验证。

来源:OpenReview · State space models · openreview.net