通过 Token Merging 实现 Transformer 与状态空间模型的高效时间序列处理
Efficient Time Series Processing for Transformers and State-Space Models through Token Merging
基于摘要分析。本文研究 Transformer 与状态空间模型处理长时间序列时的计算开销,将以线性组合替代多个 token 的 Token Merging 引入时间序列分析,并提出仅在局部邻域内选择性合并 token 的 local merging。 核心机制是限制合并候选的局部范围。作者称,随邻域大小调整,local merging 的计算复杂度可在二次与线性之间变化,从而使合并过程适用于长序列;作者还称该方法是首个因果合并方案,可用于 Transformer 解码器。这里的复杂度描述针对合并算法,不宜直接理解为整个模型都获得线性复杂度。邻域构造、线性组合权重、因果约束的具体实现,以及是否需要重新训练,尚未验证。 作者报告,在多种模型和数据集上,Token Merging 带来明显计算收益,且对准确性的影响较小;在 Chronos 基础模型上,作者报告加速幅度最高达 5400%,伴随轻微准确性下降。摘要未提供该数值对应的任务、序列长度、硬件、批量大小、计时口径与对照配置,也未给出准确性指标和具体变化,因此不能将其直接换算为确定的速度倍数,或与其他协议下的结果比较。实验协议、消融及统计信息尚未验证。 平台推测(待验证):局部合并可能缓解长窗口 EEG 建模的 token 数量与计算瓶颈,但原论文研究的是通用时间序列,未提供 EEG/BCI 验证。迁移假设依赖相邻时间 token 存在可压缩冗余;可复用局部候选限制与因果合并思想,需要适配 EEG 的时间分块、通道组织和信号尺度。低信噪比可能误导合并,短暂 ERP 或振荡变化可能被平滑,跨被试差异及小数据条件也可能使合并策略不稳定。一个可检验的小实验是在固定 EEG 编码器及数据划分下,对比不合并与不同邻域、合并比例的设置,同时记录任务指标、推理延迟和显存占用,并检查短暂事件信息是否受损。已有 EEG 相关工作尚未检索确认。
值得核对 local merging 的局部性与因果约束如何降低长时间序列处理开销,尤其是 Chronos 加速结果对应的合并比例、计时协议与精度代价;其 EEG/BCI 适用性尚未验证。
来源:OpenReview · State space models · openreview.net