MambaHash:用于大规模图像检索的视觉状态空间深度哈希模型
MambaHash: Visual State Space Deep Hashing Model for Large-Scale Image Retrieval
基于摘要分析。本文研究如何将图像映射为二值哈希码,以支持大规模图像检索,并探索 Mamba 在深度图像哈希中的适用性。作者提出视觉状态空间哈希模型 MambaHash,结合分阶段骨干网络、分组 Mamba 操作、通道交互注意力和自适应特征增强模块,提升图像表示与检索能力。 核心机制是沿不同通道组执行多方向 Mamba 扫描,以建模局部和全局信息;随后通过通道交互注意力增强跨通道的信息交流,并使用自适应特征增强模块增加特征多样性。摘要以 Vision Mamba 的线性时间复杂度作为方法动机,但尚不能据此确认完整 MambaHash 的计算与存储成本。哈希码生成方式、训练损失、监督信号及各模块的具体实现尚未验证。 作者报告,在 CIFAR-10、NUS-WIDE 和 IMAGENET 三个数据集上,与先进深度哈希方法相比,MambaHash 具有较好的效率与检索性能。摘要未提供指标数值、哈希码长度、查询与检索库划分、具体基线或运行成本,因此不能量化收益或判断不同协议下的可比性。实验协议、消融及统计信息尚未验证。材料提供了源代码地址,复现时仍需核对代码版本、训练配置和评估协议。 平台推测(待验证):其分组扫描与跨通道交互机制,可作为 EEG 片段检索中联合建模时间结构和通道关系的候选方案,但这只是迁移假设,并非已证实的 BCI 效果。原方法依赖图像空间结构,迁移需改造输入表示、扫描方向及通道分组,使其适配电极拓扑与时间轴;哈希监督也需对应明确的 EEG 检索目标。低信噪比、跨被试差异、通道配置变化和小数据训练可能使哈希码主要编码噪声或被试身份。一个可检验的小实验是在固定 EEG 数据划分、检索目标与码长下,对比普通骨干、分组 Mamba 及加入通道交互的版本,分别评估被试内与跨被试检索表现及计算成本。相关 EEG 工作尚未检索确认。
来源:OpenReview · State space models · openreview.net