用于实时 RGB-thermal 野外场景语义分割的跨模态状态空间建模
Cross-modal State Space Modeling for Real-time RGB-thermal Wild Scene Semantic Segmentation
基于摘要分析。本文研究野外机器人使用 RGB 与热成像进行语义分割时,多源数据处理带来的计算开销问题,提出跨模态状态空间架构 CM-SSM,旨在兼顾分割质量与资源受限系统的运行效率。其主要研究对象是视觉场景分割,而非 EEG 或 BCI。 机制方面,cross-modal 2D-selective-scan(CM-SS2D)模块构造跨模态视觉序列,并由一种模态推导另一种模态的隐藏状态表示,以建立 RGB 与热成像之间的状态空间关联。cross-modal state space association(CM-SSA)模块进一步融合 CM-SS2D 提供的全局关联与卷积提取的局部空间特征。作者称,相比 Transformer-based 方法,该架构的计算复杂度随图像分辨率线性增长;这一复杂度主张不等同于已验证的实际实时性能,仍需核对具体硬件、输入分辨率与推理测量协议。 作者报告,CM-SSM 在 CART 数据集上达到 state-of-the-art 性能,同时使用更少参数并降低计算成本;PST900 上的进一步实验支持其泛化能力。摘要未提供具体指标、数值、对照模型或数据划分,不能据此判断是否属于跨数据集训练与测试。实验协议、消融及统计信息尚未验证。摘要提供了代码仓库,但实现完整性、训练配置与复现结果尚未核对。 平台推测(待验证):其可迁移假设是利用跨模态隐藏状态传递,建模同步 EEG 与其他神经信号之间的互补关系,以应对单模态信息不足;这依赖时间对齐及可学习的模态对应关系。状态关联与全局—局部融合思路可供参考,但图像二维扫描需改造成适合时间—通道结构的处理方式,并适配不同采样率和通道布局。低信噪比、跨被试差异与小数据可能使状态传递放大伪迹或造成负迁移。一个可检验的小实验是在同步多模态神经信号数据上固定被试划分,比较单模态、简单融合与跨模态状态传递,并测试一种模态受噪声扰动时的性能变化。已有 EEG 相关工作尚未检索确认。
值得核对其跨模态状态传递与全局—局部融合机制是否能在降低计算成本的同时保持分割质量,但摘要中的性能与效率结论及其向神经信号任务的迁移价值尚未验证。
来源:OpenReview · State space models · openreview.net