通过 Token Merging 实现 Transformer 与状态空间模型的高效时间序列处理
Efficient Time Series Processing for Transformers and State-Space Models through Token Merging
基于摘要分析。本文研究长时间序列在 Transformer 与状态空间模型中的计算开销,将 Token Merging 引入时间序列分析,并提出仅在局部邻域内选择性合并 token 的 local merging,以减少序列处理成本。 核心机制是限制合并候选的邻域范围。作者指出,合并算法的计算复杂度可随邻域大小在二次与线性之间调整,并声称提出了首个支持 Transformer 解码器的因果合并方案。摘要未给出 token 相似性度量、合并规则、位置与时间信息的保留方式,以及因果约束的具体实现;此处的复杂度描述也不能直接视为整个模型的端到端复杂度。作者还报告,输入数据的谱特性可预测 local merging 的潜在收益,无需先评估下游任务,但所用谱指标与预测可靠性的验证范围尚不明确。 作者报告,在时间序列任务的综合评估中,local merging 带来显著效率收益且对准确性的影响较小,其中在 Chronos 基础模型上最高达到 5400% acceleration。摘要未提供该结果对应的任务、数据划分、硬件、批量大小、序列长度、计时口径或精度变化,因而不能据此换算吞吐倍率,也不能直接外推到其他模型。实验协议、消融及统计信息尚未验证。 平台推测(待验证):其机制可能对应 EEG 长序列建模的计算瓶颈,但依赖可被压缩的局部时间冗余,以及输入谱特性与任务信息之间的关系。局部合并与邻域调节思路可能复用;多通道 EEG 的空间对应关系、时间定位和因果处理则需适配。低信噪比下的相似性估计、短暂 ERP 成分被合并、跨被试谱差异及小数据条件,都可能使压缩收益无法转化为任务收益。一个可检验的小实验是在固定数据划分与同一 EEG 模型下,对比不合并和不同局部邻域设置,联合记录任务原有指标、推理时间、显存及短暂事件的识别变化,检验谱特性能否预测效率与性能之间的权衡。已有 EEG 相关工作尚未检索确认。
值得核对局部 token 合并如何兼顾长时间序列计算效率与因果约束,以及输入谱特性能否预测合并收益;摘要中的加速结果仍需结合计时协议与精度变化验证。
来源:OpenReview · State space models · openreview.net