跳到正文
OpenReview · State space models· Hao Zhang; Yongqiang Ma; Wenqi Shao; Ping Luo; Nanning Zheng; Kaipeng Zhang·· 2024-01-01AI 评分67

HRVMamba:用于密集预测的高分辨率视觉状态空间模型

HRVMamba: High-Resolution Visual State Space Model for Dense Prediction

AI 导读

基于摘要分析。该研究针对 Mamba 在人体姿态估计和语义分割等密集预测任务中归纳偏置不足、长程遗忘及输出表示分辨率偏低的问题,提出 Dynamic Visual State Space(DVSS)模块,并结合 HRNet 的多分辨率并行设计构建 HRVMamba。 机制上,DVSS 使用多尺度卷积核提取不同尺度的局部特征,以增强视觉归纳偏置;使用可变形卷积进行依赖输入与任务信息的自适应空间聚合,作者将其作用解释为缓解长程遗忘。HRVMamba 在整个处理过程中保留高分辨率表示,同时促进多尺度特征学习。摘要以 Mamba 对 token 长度的线性计算复杂度和全局感受野为背景,但未给出 HRVMamba 的实际计算量、内存占用或速度测量,不能直接据此认定新模型具有相同的效率表现。 作者报告,HRVMamba 在人体姿态估计和语义分割等密集预测实验中取得了相对现有基准模型有竞争力的结果。摘要未列出数据集、划分、基线名称、评价指标及具体数值,因而尚不能判断收益幅度或不同任务中的一致性。实验协议、消融及统计信息尚未验证;复现时应重点核对多尺度卷积、可变形卷积和多分辨率并行设计的独立贡献及计算成本。摘要提供了代码仓库地址,但代码内容、运行环境及结果可复现性尚未验证。 平台推测(待验证):迁移假设是,多尺度局部建模与高分辨率表示保留可能有助于 EEG 时间序列中的短时事件定位,但原方法面向具有规则空间结构的视觉密集预测,不能直接视为已验证的 BCI 方法。可复用的是多尺度特征提取思路;空间聚合及高分辨率分支需依据 EEG 的时间轴、电极布局和目标监督重新设计。低信噪比、跨被试差异、通道配置变化及小样本可能使自适应聚合学习到不稳定模式。一个可检验的小实验是在固定 EEG 事件定位任务及相同被试划分下,比较基础 SSM 与加入多尺度卷积的版本,核对定位指标和计算成本,再评估可变形聚合是否带来增益。已有 EEG 相关工作尚未检索确认。

来源:OpenReview · State space models · openreview.net