MV-SSM:用于 3D 人体姿态估计的多视角状态空间建模
MV-SSM: Multi-View State Space Modeling for 3D Human Pose Estimation
基于摘要分析。该研究针对多视角 3D 人体姿态估计在遮挡及新相机配置下的泛化问题,提出 MV-SSM,在多视角图像特征层面和人体关键点层面显式建模关节空间序列。其主要研究对象是视觉人体姿态估计,而非 EEG 或 BCI。 核心机制是 Projective State Space(PSS)模块,通过状态空间建模学习关节空间布局的泛化表示;模块内将 Mamba 的传统扫描改为 Grid Token-guided Bidirectional Scanning(GTBS)。作者认为,现有基于注意力的 Transformer 在遮挡情况下难以准确表达关键点空间关系,并可能过拟合训练中的相机布局与场景。摘要未说明 PSS 的具体投影运算、两级表示的融合方式、监督目标及训练配置,这些机制细节尚未验证。 作者报告,相较所比较的方法,MV-SSM 在 CMU Panoptic 的三相机设置下取得 AP25 +10.8,在变化相机布局的评估中取得 AP25 +7.0,在跨数据集评估的 Campus A1 上取得 PCP +15.3。摘要未交代这些增量的单位、具体对照方法、绝对分数或完整数据划分,不能将其直接解释为百分比提升,也不能跨协议比较。实验协议、消融及统计信息尚未验证。材料提供了项目网站,但代码、权重及复现依赖是否公开尚未验证。 平台推测(待验证):若 PSS 与 GTBS 的收益确实来自空间拓扑建模而非视觉特定表示,其扫描设计可能为 EEG 通道空间关系建模提供参考。原方法依赖多视角图像、人体关节结构与相机布局,不能直接等同于 EEG 多通道数据;迁移需将图像与关键点表示替换为带电极位置的时序特征,并重新定义空间序列及训练目标。EEG 的低信噪比、跨被试差异、通道缺失和小数据规模可能削弱这一机制。一个可检验的小实验是在固定跨被试划分、相同输入和训练预算下,对比普通 Mamba 扫描与空间引导双向扫描,并增加通道缺失条件以检验鲁棒性;这只是迁移假设,不是本文已验证结果。相关 EEG 工作尚未检索确认。
值得关注其利用 PSS 与 GTBS 建模多视角空间关系的机制及相机配置泛化评估,但对 EEG 空间建模的价值仍属待验证假设。
来源:OpenReview · State space models · openreview.net