基于全局—局部状态空间模型的视频人体姿态估计高分辨率时空建模
High-Resolution Spatiotemporal Modeling with Global-Local State Space Models for Video-Based Human Pose Estimation
基于摘要分析。本文研究视频人体姿态估计(VHPE)中的高分辨率时空表示,提出全局—局部状态空间模型框架,分别捕获整体人体运动趋势与局部关键点的高频运动细节,旨在兼顾长程依赖建模、细节保留和计算效率。 核心机制包括两个模块:Global Spatiotemporal Mamba 使用 6D selective space-time scan,以及受空间和时间调制的扫描合并,提取全局时空表示;Local Refinement Mamba 采用窗口化时空扫描,增强局部关键点运动的高频细节。摘要未解释“6D”的具体含义、扫描路径或调制实现,不能据此补全结构。相较于使用单一卷积或注意力结构统一建模的方法,该框架的设计重点是将全局动态与局部细节分开处理,并利用 Mamba 的线性复杂度长程建模能力;完整框架的实际复杂度与资源消耗仍需正文核对。 作者报告,在四个基准数据集上的实验中,该模型优于现有先进 VHPE 方法,并取得更好的计算权衡。摘要未提供数据集名称、划分、评估指标、具体数值及对照配置,因此目前无法判断优势幅度或跨场景稳定性。训练目标、输入表示、实验协议、消融及统计信息尚未验证,复现所需代码与配置也尚未确认。 平台推测(待验证):若 EEG 任务同时依赖长时程状态与局部瞬态活动,全局扫描与窗口化细节建模的分工可能具有借鉴价值,但这是假设,不是本文验证的 BCI 效果。其迁移依赖可定义的通道—时间结构,以及适配 EEG 的监督信号和训练规模;扫描、合并与窗口机制可作为候选模块,视频输入编码和空间扫描顺序则需改造。低信噪比可能使局部分支强化伪迹,跨被试差异、通道布局变化和小数据也可能削弱收益。可在固定通道布局、严格跨被试划分下,以相同训练预算比较全局模块、局部模块及二者组合,同时记录任务指标和计算开销,检验分工是否带来独立增益。已有 EEG 相关工作尚未检索确认。
值得阅读其全局与局部动态分开建模的扫描机制,以及高分辨率序列中的精度—计算开销权衡;作者报告的优势仍需核对完整实验,向 EEG 迁移的有效性尚未验证。
来源:OpenReview · State space models · openreview.net