跳到正文
OpenReview · State space models· Leon Götz; Marcel Kollovieh; Stephan Günnemann; Leo Schwinn·· 2024-01-01精选AI 评分73

通过 Token Merging 实现 Transformer 与状态空间模型的高效时间序列处理

Efficient Time Series Processing for Transformers and State-Space Models through Token Merging

AI 导读

本研究针对 Transformer 与状态空间模型处理长时间序列时仍有较高计算开销的问题,将 token merging 引入时间序列分析,并提出面向长序列的 local merging 算法。基于摘要分析,未取得论文全文。 核心机制是用多个 token 的线性组合替代原 token,从而减少后续处理的序列长度;local merging 将合并候选限制在局部邻域内。摘要称,其计算复杂度随邻域大小在近线性与二次复杂度之间调整,但具体复杂度表达式、邻域选择方式、合并准则、权重计算及训练或推理阶段的使用方式尚未验证。论文的主要研究对象是通用时间序列模型,而非 EEG 或 BCI;作者将贡献定位为对时间序列 Transformer 和状态空间模型中 token merging 的早期探索。 作者报告,在多种模型与数据集上,token merging 带来显著计算收益,对准确性的影响较小;在 Chronos 基础模型上,作者报告最高“5400%”的加速,伴随轻微准确性下降。摘要未给出该数值对应的序列长度、硬件、基线、计时口径、数据划分或准确性指标,因此不能直接换算为确定的速度倍数,也不能据此比较不同模型或任务。实验协议、消融及统计信息尚未验证。 平台推测(待验证):局部合并可能对应长时 EEG 建模中的序列计算瓶颈,可复用的是邻域内压缩 token 的思路;需改造的是适应时间与通道结构的合并规则,并明确模型输入 token 的定义。其有效性可能依赖局部冗余及可容忍的时间分辨率损失;低信噪比下可能合并噪声,短暂 ERP 或快速变化的判别信息也可能被平滑,跨被试与通道差异、小数据条件下的稳定性需另行验证。一个可检验的小实验是在固定 EEG 任务、被试划分、模型与硬件下,对照不合并和不同邻域、压缩比例的设置,同时记录原任务指标、延迟与峰值显存,检验效率收益是否以判别信息损失为代价。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其面向长时间序列的局部 token 合并机制及计算—精度权衡,但作者报告的加速幅度仍需结合计时口径与评估协议核对,EEG/BCI 适用性尚未验证。

来源:OpenReview · State space models · openreview.net