跳到正文
OpenReview · State space models· Zerui Zhu; Dongmei Liu; Huaxiang Zhang; Li Liu; Fengfei Jin·· 2026-01-01AI 评分66

ViSSNet:基于视觉状态空间网络的 RGB-T 显著目标检测

ViSSNet: RGB-T Salient Object Detection via Vision State-Space Network

AI 导读

基于摘要分析。ViSSNet 面向 RGB 与热成像联合的显著目标检测,利用两种模态的互补信息定位图像中的显著区域;其核心贡献是将视觉状态空间建模用于模态特征提取与交互融合,以兼顾全局上下文建模和计算效率。 方法采用双流 VMamba 编码器,分别提取 RGB 与热成像的模态特定特征,再通过 State-Space Interactive Fusion Module(SSIFM)结合状态空间建模与卷积操作,增强跨模态表征。自顶向下解码器逐步融合高层语义与空间细节,输出显著性预测。摘要将 CNN 的长程建模局限与 Transformer 的计算开销作为设计动机,但具体扫描方式、融合算子、损失函数、训练与推理配置尚未验证。 作者报告,在三个公开 RGB-T SOD 基准上,ViSSNet 相比 14 种作者称为最先进的方法取得更优或相当的精度,并显著降低模型参数量与计算开销。摘要未提供基准名称、数据划分、具体指标、参数量或计算量数值,因此无法核对各项优势的幅度与适用条件;实验协议、消融及统计信息尚未验证,代码与权重可用性也尚未确认。 平台推测(待验证):双流编码与交互融合可能为 EEG 与其他同步模态的联合建模提供结构参考,但原研究依赖 RGB 与热成像的空间对应关系及显著性监督,不是 EEG/BCI 有效性的证据。可借鉴模态特定编码与融合思路;迁移到 EEG–fNIRS 等任务时,需要改造输入表示、时序对齐和任务解码器。假设融合模块能够利用互补信息,可在固定跨被试划分下,小规模比较单模态、简单拼接与改造后的交互融合,并测试模态错位或缺失时的性能。低信噪比、通道配置差异、模态时间响应差异与小数据过拟合都可能使迁移失败;已有 EEG 相关工作尚未检索确认。

来源:OpenReview · State space models · openreview.net