跳到正文
OpenReview · State space models· Jinyoung Park; Minseok Son; Changick Kim·· 2025-12-31精选AI 评分73

通过 token 合并实现高效视觉状态空间模型

Towards Efficient Vision State Space Models via Token Merging

AI 导读

基于摘要分析。本文研究视觉 State Space Models(SSMs)的计算效率问题,提出面向 SSM 的 token 合并策略 MaMe,旨在减少 token 的同时保留序列建模所需的信息。主要贡献是以状态转移参数 Δ 衡量 token 信息量,并通过特定的 token 排列策略维持序列信息流。 技术机制:与直接减少 token 的思路相比,MaMe 将 token 重要性判断与 SSM 的序列特性相结合。摘要没有说明 Δ 如何转换为重要性分数、token 如何配对与合并,以及排列策略如何处理原始位置关系;其是否需要额外训练、具体计算开销及适用的 SSM 架构尚未验证。 作者报告,在微调模型与直接使用现有模型的条件下,MaMe 均取得更优的效率—性能权衡,并在大幅减少 token 时比已有方法更能保持性能。作者还报告其应用从图像分类扩展至视频和音频领域。摘要未提供数据集、对照方法、压缩比例、性能指标、延迟或硬件条件,因此尚不能量化收益或比较不同任务结果;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 的 SSM 编码器也包含可解释为 token 信息量的 Δ 参数,MaMe 的重要性判断与顺序保持机制可能用于降低长时序处理开销。这一假设依赖 EEG 的 token 划分、时间顺序及模型参数化方式;可考虑复用重要性估计,但合并与排列模块需适配时间片段及通道关系。低信噪比可能使重要性估计受伪迹影响,合并可能抹去短暂 ERP 特征,跨被试、通道配置变化及小数据训练也可能使压缩策略不稳定。一个可检验的小实验是在固定 EEG 任务和数据划分下,对同一 SSM 比较不压缩、均匀减少 token 与 MaMe 式合并,在相同压缩比例下记录任务指标、推理延迟及短暂事件特征的保留情况。已有 EEG 相关工作尚未检索确认,原领域结果不能视为 BCI 有效性的证据。

阅读价值

值得核对 MaMe 如何利用状态转移参数 Δ 衡量 token 信息量并在合并后保留序列信息流,尤其是其微调与直接使用模型两种条件下的效率—性能权衡;EEG 迁移价值尚未验证。

来源:OpenReview · State space models · openreview.net