跳到正文
OpenReview · State space models· Leon Götz; Marcel Kollovieh; Stephan Günnemann; Leo Schwinn·· 2024-09-15精选AI 评分76

通过 Token Merging 实现 Transformer 与状态空间模型的高效时间序列处理

Efficient Time Series Processing for Transformers and State-Space Models through Token Merging

AI 导读

基于摘要分析。本文研究 Transformer 与状态空间模型处理超长时间序列时的计算开销,将以线性组合替代多个 token 的 Token Merging 从视觉任务扩展到时间序列,并提出限制合并范围的 local merging,以兼顾序列压缩、计算效率和因果处理。 核心机制是选择局部邻域内的 token 进行合并。作者称,合并算法的计算复杂度可随邻域大小从二次调整到线性,从而适应长序列;作者同时将该方法称为首个因果合并方案,用于支持 Transformer 解码器中的 token 合并。这些复杂度描述针对合并算法,不能直接等同于整个模型的端到端复杂度。邻域选择、合并权重、时间位置处理及因果性实现细节尚未验证。 作者报告,在多种模型和数据集上的评估中,Token Merging 带来较大的计算收益,且对准确性的影响较小;在 Chronos 基础模型上,作者报告最高达 5400% 的加速,并伴随轻微精度下降。摘要未说明该加速百分比的计算口径、具体任务、数据划分、硬件、对照配置与精度指标,因此不将其换算为倍数,也不能直接用于不同模型或协议间的比较。实验协议、消融及统计信息尚未验证。 平台推测(待验证):局部合并可能缓解长时 EEG 序列的处理成本,但这一假设依赖时间邻域内存在可压缩冗余,而不是仅凭原领域加速结果成立。可复用的是局部候选限制与序列压缩思路;需针对 EEG 的 token 构造、通道关系和关键事件时间分辨率改造。低信噪比可能使相邻 token 的相似性失真,合并也可能抹去短暂 ERP 或 MI 判别信息;跨被试、通道变化及小数据条件下的稳定性尚未验证。一个可证伪的小实验是在固定被试内划分、模型和训练预算下,对照不合并与不同局部合并强度,同时测量任务指标、推理延迟和显存,并检查短时事件附近的性能损失。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 local merging 如何在压缩长时间序列的同时保持因果性,以及其吞吐收益与精度损失的权衡;摘要提供了明确的机制路径,但尚不能据此确认 EEG/BCI 适用性。

来源:OpenReview · State space models · openreview.net