用于第一视角三维手部轨迹预测的不确定性感知状态空间 Transformer
Uncertainty-aware State Space Transformer for Egocentric 3D Hand Trajectory Forecasting
研究针对第一视角 RGB 视频中的手部轨迹预测,提出从早期观测预测三维空间轨迹的任务,并设计不确定性感知状态空间 Transformer(USST),以回应仅在二维图像空间预测难以满足三维应用需求的问题。基于摘要分析,未取得论文全文。 USST 在经典状态空间模型框架下结合注意力机制与偶然不确定性(aleatoric uncertainty);摘要还提出利用速度约束和大型视觉 Transformer 上的 visual prompt tuning(VPT)进一步增强模型。状态变量、状态转移与观测关系、不确定性的参数化方式、损失函数及训练与推理流程尚未验证,不能据此将其等同于其他现代序列状态空间架构。 作者开发了用于采集高质量三维手部轨迹的标注流程。作者报告,在 H2O 和 EgoPAT3D 数据集的二维与三维轨迹预测评估中,USST 优于所比较的方法;摘要未提供具体指标、数值、数据划分或对照配置,实验协议、消融及统计信息尚未验证。作者称代码与数据已公开发布,但本次未核验其完整性及复现条件。 平台推测(待验证):其潜在方法联系在于,将动态状态建模与观测不确定性结合,可能为 EEG 驱动的连续运动轨迹解码提供思路。假设是注意力与不确定性建模能帮助区分运动动态和噪声观测,而非原论文已证明 BCI 效果。原任务依赖视频观测与三维轨迹标注;迁移时需替换视觉编码及 VPT 模块,并处理 EEG 与运动轨迹的时间对齐。低信噪比、跨被试差异、通道变化与小数据可能导致状态估计或不确定性校准失效。一个可检验的小实验是在固定被试内划分的配对 EEG—轨迹数据上,比较相同解码骨干加入或不加入不确定性建模后的轨迹误差与校准表现。已有相关 EEG 工作尚未检索确认。
值得阅读的是 USST 将注意力机制与偶然不确定性纳入经典状态空间框架来预测三维手部轨迹的思路,但其具体实现、对照效果及 EEG/BCI 迁移价值尚未验证。
来源:OpenReview · State space models · openreview.net