ViSSNet:通过视觉状态空间网络进行 RGB-T 显著目标检测
ViSSNet: RGB-T Salient Object Detection via Vision State-Space Network
基于摘要分析。该研究面向 RGB 与热成像联合显著目标检测(RGB-T SOD),提出 ViSSNet,利用视觉状态空间建模提取并融合两种图像模态的信息,以兼顾全局上下文建模、显著区域定位和计算效率。 核心机制是双流 VMamba 编码器,分别提取 RGB 与热成像的模态特异性特征;随后通过 State-Space Interactive Fusion Module(SSIFM)结合状态空间建模与卷积操作,增强跨模态表征。自顶向下的解码结构逐步整合高层语义与空间细节,输出显著性预测。相较于摘要所述 CNN 长程建模能力受限、Transformer 计算成本较高的问题,该方法的主要设计取向是将状态空间建模用于双模态编码和交互融合;具体交互方式、损失函数及训练配置尚未验证。 作者报告,在三个公开 RGB-T SOD 基准上,与 14 种被作者称为当前先进的方法比较,ViSSNet 获得更优或相当的准确性,同时显著降低模型参数量和计算成本。摘要未列出基准名称、数据划分、指标及具体数值,因而目前无法判断优势在不同基准上的一致性,也无法量化效率收益;实验协议、消融及统计信息尚未验证。 平台推测(待验证):可迁移的假设是,模态特异性编码加状态空间交互融合可能用于 EEG 与其他同步生理信号的联合建模,而非直接迁移图像显著性解码器。原任务依赖双模态图像的空间对应与显著性监督,迁移时需改造输入表示、时序对齐和任务输出;EEG 低信噪比、跨被试差异、通道布局及小数据规模可能削弱收益。一个可证伪的小实验是在固定跨被试划分下,比较双流状态空间交互融合与简单特征拼接,并控制参数预算、报告任务指标和计算成本。该假设不属于原论文已验证结果,相关 EEG 工作尚未检索确认。
来源:OpenReview · State space models · openreview.net