FTMoMamba:基于频率与文本状态空间模型的动作生成
FTMoMamba: Motion Generation with Frequency and Text State Space Models
基于摘要分析。本文研究文本驱动的人体动作生成,针对现有扩散方法对潜在空间频率信息利用不足、文本与动作语义不一致的问题,提出结合 Frequency State Space Model(FreqSSM)与 Text State Space Model(TextSSM)的扩散框架 FTMoMamba;其主要研究对象不是 EEG 或 BCI。 机制上,FreqSSM 将序列分解为低频与高频分量,分别引导静态姿态与细粒度动作生成。摘要以坐、躺等姿态,以及过渡、踉跄等动作为例说明这种分工。TextSSM 在句子层面编码文本特征,使文本语义与序列特征对齐。摘要未说明具体频率分解算子、状态空间模型结构、对齐损失或训练与推理流程,这些实现细节尚未验证。 作者报告,在 HumanML3D 的 text-to-motion generation 任务中,FTMoMamba 的 FID 为 0.181,对照 MLD 为 0.421,且称其取得最低 FID。该结果对应动作生成评估,不能解释为 BCI 解码性能;数据划分、采样设置、对照配置、消融及统计信息尚未验证,尚不能判断优势分别来自哪个模块。 平台推测(待验证):假设频率分解后的独立序列建模有助于保留 EEG 的多尺度动态,FreqSSM 的设计可能为 EEG 重建提供可检验的借鉴。可复用的是频率分解与分量建模思路,需改造的是分解尺度、多通道表示及任务目标;动作中“低频对应静态、高频对应细节”的关系不能直接套用到 EEG。低信噪比、肌电污染、跨被试频谱差异及小数据训练可能使分支学习到伪迹或被试特征。一个小规模检验是在固定跨被试划分和相同训练预算下,对比加入频率分解与不加入该模块的 EEG 掩码重建模型,检查重建误差及下游解码表现。TextSSM 则依赖文本语义与序列对应关系,不能默认适用于没有配对文本的 EEG 数据。已有 EEG 相关工作尚未检索确认。
值得关注其将频率分解与文本语义建模分别用于动作细节和文本—动作一致性的设计,但性能优势的评估协议及其对 EEG 的可迁移性尚未验证。
来源:OpenReview · State space models · openreview.net