跳到正文
OpenReview · State space models· Xiaodong Guo; Zi'ang Lin; Luwen Hu; Zhihong Deng; Tong Liu; Wujie Zhou·· 2025-12-31精选AI 评分74

面向实时 RGB-thermal 野外场景语义分割的跨模态状态空间建模

Cross-modal State Space Modeling for Real-time RGB-thermal Wild Scene Semantic Segmentation

AI 导读

基于摘要分析。本文研究野外机器人场景中的 RGB 与热成像语义分割,针对多源视觉处理的计算开销,提出跨模态状态空间架构 CM-SSM,以融合两种模态的信息并降低计算成本;主要研究对象是视觉分割,而非 EEG 或 BCI。 核心机制包括两个模块:CM-SS2D(cross-modal 2D-selective-scan)构造跨模态视觉序列,通过状态空间建模从另一模态推导当前模态的隐状态表示;CM-SSA(cross-modal state space association)将 CM-SS2D 提供的全局关联与卷积提取的局部空间特征融合。其机制依赖 RGB 与热成像的多源图像结构,但具体模态对齐要求、扫描顺序、训练监督和损失形式尚未验证。作者称,相较 Transformer-based 方法,该架构的计算复杂度随图像分辨率线性增长;这一复杂度表述不能直接等同于特定硬件上的实时性能。 作者报告,CM-SSM 在 CART 数据集上取得 state-of-the-art 表现,同时参数量和计算成本更低,并通过 PST900 数据集上的进一步实验展示泛化能力。摘要未提供具体指标、数据划分、对照模型、参数量、运算量或推理延迟;PST900 实验是否属于直接跨数据集测试也尚未验证。实验协议、消融及统计信息尚未验证。摘要提供了代码仓库,但实现完整性、运行环境及结果可复现性仍需核对。 平台推测(待验证):若 EEG 与其他传感模态具有可对齐的时间结构,跨模态隐状态传递及全局—局部融合可能用于研究互补信息利用;这是迁移假设,不是本文验证的 BCI 结果。可考虑复用状态关联思路,但需将二维视觉扫描改为适合时间与通道结构的序列组织,并处理采样率差异和模态同步。低信噪比、跨被试差异、通道变化及小数据可能使错误信息在模态间传播。一个可证伪的小实验是:在固定被试内划分和匹配计算预算下,对比跨模态状态传递、独立编码后融合与单模态模型,并测试模态噪声或缺失时的性能变化。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其跨模态状态传递与全局—局部融合机制,作者报告的分割效果和计算效率优势仍需结合全文中的对照设置核验,EEG/BCI 适用性尚未验证。

来源:OpenReview · State space models · openreview.net