DA-Mamba:用于多模态参与度估计的对话感知选择性状态空间模型
DA-Mamba: Dialogue-aware selective state-space model for multimodal engagement estimation
基于摘要分析。该研究面向对话场景中的人类参与度估计,利用面部表情、语音、手势及随时间变化的行为线索,提出 DA-Mamba,以 Mamba 选择性状态空间处理替代计算开销较高的注意力式对话编码,兼顾时序建模与跨模态推理。原论文研究对象是多模态对话参与度,而非 EEG 解码或 BCI。 架构包含三个核心模块:Dialogue-Aware Encoder、Modality-Group Fusion 和 Partner-Group Fusion,后两者均采用 Mamba。摘要提出该架构具有线性时间与内存复杂度,但未给出各模块的具体运算、对话伙伴关系的编码方式、损失函数或训练细节,因此其复杂度适用条件及关系建模机制仍需正文核对。 作者报告,在 NoXi、NoXi-Add 和 MPIIGI 三项基准上,DA-Mamba 的 concordance correlation coefficient(CCC,一致性相关系数)超过此前 SOTA 方法,同时减少训练时间和峰值内存。摘要未提供具体 CCC 数值、收益幅度、数据划分、对照方法或硬件条件,不能据此量化优势或判断跨场景泛化。更长序列处理与资源受限场景下的实时部署是作者提出的应用收益,实际延迟及部署条件尚未验证。实验协议、消融及统计信息尚未验证;摘要称源代码将公开,当前可用性未核实。 平台推测(待验证):假设其优势来自长时序处理及模态、交互伙伴的分组融合,则可能用于同步 EEG 与行为信号的参与度估计。迁移依赖时间对齐的多模态序列、参与度监督和明确的交互伙伴结构;可考虑复用状态空间时序处理与融合思路,但需改造 EEG 输入表征、采样对齐和缺失模态处理。低信噪比、通道变化、跨被试差异及小数据训练可能使收益消失。可在固定跨被试划分和相同 EEG 输入下,小规模比较 Mamba 与注意力式时序编码器的 CCC、延迟和峰值内存,再检验分组融合的增益。上述为迁移假设,已有 EEG 相关工作尚未检索确认。
值得核对 DA-Mamba 的对话关系建模与两类融合机制能否在降低计算开销的同时保持 CCC 表现;摘要报告了三项基准结果,但具体收益、评估协议及 EEG 迁移有效性尚未验证。
来源:OpenReview · State space models · openreview.net