ViS:视觉状态空间 Token 混合器
ViS: Vision State-Space Token Mixer
基于摘要分析。本文研究视觉状态空间模型(SSMs)对手工一维扫描顺序的依赖,提出 Vision State-Space Token Mixer(ViS):让每个 token 按空间距离逐步聚合周围信息,而非沿统一的全局扫描路径处理图像,从而构建具有全局感受野的视觉骨干。 核心机制是重新定义扫描轴:每个 token 的隐藏状态依次吸收以自身为中心的同心环中的信息。这里的“无需扫描顺序”指不依赖手工全局遍历顺序,仍保留由空间距离决定的上下文聚合次序。作者将这种逐位置递推推导为结构化掩码注意力的精确闭式表达,以便在适于注意力运算的现代硬件上高效实现。具体状态更新公式、掩码结构、训练目标与计算复杂度尚未验证,不能仅因采用 SSM 就认定其整体实现具有线性复杂度。 作者报告,在图像分类、分割、目标检测和生成任务中,ViS 可作为通用视觉骨干;在摘要未明确列出的对照及硬件条件下,吞吐量最高达到对照的 5.1 倍,同时维持相当或更好的性能。作者还报告,在其评估的视觉骨干中,ViS 具有最强的零样本分辨率迁移表现,并将其归因于通过坐标计算的空间先验。数据集、模型规模、性能指标、分辨率变化范围、实验协议、消融及统计信息尚未验证。 平台推测(待验证):其潜在 EEG 对应路径是以电极空间坐标定义上下文聚合次序,减少任意通道排列带来的偏置,而非直接替代时间序列建模。可复用的部分是距离驱动的状态聚合与结构化注意力表达;需改造图像同心环为不规则电极布局,并明确空间聚合与时间建模的组合方式。该假设依赖可比的电极坐标和足够训练数据,可能受 EEG 低信噪比、体积传导、跨被试差异、通道缺失及小样本过拟合影响。一个可检验的小实验是在固定 Cross-subject 划分及相同时间编码器下,对比距离聚合、固定通道扫描和普通注意力,并测试通道重排及缺失后的性能变化。相关 EEG 工作尚未检索确认,原文视觉结果不构成 BCI 有效性的证据。
值得核对 ViS 如何将按空间距离组织的状态递推精确改写为结构化掩码注意力,以及其吞吐量和零样本分辨率迁移优势所依赖的对照与评估条件。
来源:OpenReview · State space models · openreview.net