ZeroMamba:探索用于零样本学习的视觉状态空间模型
ZeroMamba: Exploring Visual State Space Model for Zero-Shot Learning
基于摘要分析。该研究针对视觉零样本学习(ZSL),利用已见类别的语义知识识别未见类别,提出基于 Vision Mamba 的端到端框架 ZeroMamba,通过局部与全局语义表示融合改善视觉—语义交互;原研究对象是视觉分类,并非 EEG 或 BCI。 核心机制包括 Semantic-aware Local Projection(SLP)、Global Representation Learning(GRL)和 Semantic Fusion(SeF)。SLP 将语义嵌入引入视觉特征投影,形成与语义相关的局部表示;GRL 促进全局语义表示学习;SeF 融合两类表示以增强语义特征的判别性。作者以 CNN 感受野受限、ViT 计算复杂度呈二次增长为动机,利用 Vision Mamba 建模长程依赖。具体损失、语义嵌入来源、预训练及微调方式尚未验证。 作者报告,在四个 ZSL 基准上,ZeroMamba 在 conventional ZSL(CZSL)与 generalized ZSL(GZSL)设置下均优于所比较的 CNN 和 ViT 方法。摘要未提供基准名称、数据划分、指标或提升幅度,不能据此量化优势或直接比较两种设置的结果。作者将框架描述为参数高效,并提供代码地址;参数统计、运行开销、实验协议、消融及统计信息尚未验证,代码可用性亦未核验。 平台推测(待验证):其局部—全局语义融合机制可能用于具有明确类别语义描述的 EEG 零样本识别,假设类别语义能够与神经信号建立可学习的对应关系。可复用 SLP、GRL 与 SeF 的设计思路,但视觉输入与特征提取需改为 EEG 时序或时空表示,并重新定义类别语义。主要风险是语义描述未必对应可辨识的 EEG 模式,低信噪比、跨被试差异、通道变化和小样本可能进一步破坏对齐。一个可检验的小实验是在具备语义描述与足够类别的 EEG 数据上固定已见/未见类别划分,对比全局语义模型与加入局部投影、语义融合的模型,分别评估 CZSL 与 GZSL,并明确被试内或跨被试协议。已有 EEG 相关工作尚未检索确认。
值得关注其将局部语义投影与全局语义学习结合到 Vision Mamba 的 ZSL 机制,但性能与参数效率仍需核对完整实验,向 EEG/BCI 的迁移尚未验证。
来源:OpenReview · State space models · openreview.net