视觉状态空间模型中的内容感知扫描:仅靠聚集是否足够?
Content-Aware Scanning in Vision State Space Models: Is Grouping Enough?
基于摘要分析。本文研究视觉状态空间模型(SSM)中的内容感知扫描:将有信息的 token 排得更近,是否确实能减少递归衰减并改善其交互?核心贡献是在受控图像恢复测试平台中,将 token 聚集程度与排序携带的信息独立操纵,检验收益究竟来自邻近性还是额外信息。 作者报告,在包含 1,108 个已训练模型的测试中,使用无需训练的重要性评分(如 CFAR 检测)排序,虽提高聚集程度,却与随机排列表现接近,差异在 0.1 dB 内;即使评分识别目标的 AUC 达到 0.98,也未因此获得明显恢复收益。另在全部 72 次运行中,将有信息 token 排得比光栅扫描更分散的真值排序仍带来收益。作者据此认为,此类“oracle”排序衡量的是信息泄漏,而非实际可获得的增益;这一解释应限定于本文受控设置。 在独立控制排序精度(所选 token 中有信息 token 的比例)与聚集程度的析因设计中,作者报告:固定聚集程度,将精度从 0 提高至 1 带来 3.5 dB 增益;仅聚集程度解释的方差比例为 0.62,加入精度及交互项后为 0.96。相同信息作为额外输入通道时,收益不低于排序:真值支持信息对应 +9.82 与 +8.03 dB,监督式 O(N) CNN 评分器对应 +0.78 与 +0.69 dB,均为输入通道与排序的对比。摘要未说明这些 dB 数值对应的具体恢复指标。 作者还报告,在因果扫描中,将真值目标块置于开头,相比序列中部多获 3–6 dB;移除扫描卷积、改变目标数量后仍观察到该现象,并将其归因于扫描起点缺少历史状态所形成的位置线索。作者称发布了包含区域感知指标及随机排列、局部性、泄漏和输入通道对照的协议;数据集、模型配置、划分、统计信息及发布内容尚未验证。 平台推测(待验证):若 EEG SSM 使用内容评分重排时间片或通道,可借用这些对照区分聚集收益与评分携带的信息,但不能直接沿用视觉任务结论。假设可通过保留 EEG 时间结构、比较原序列、随机排列、评分排序及评分额外输入通道的小实验检验;需避免重排破坏时序,并控制低信噪比、跨被试差异及小数据下评分不稳定的风险。相关 EEG 工作尚未检索确认。
该研究通过分离 token 聚集程度与扫描顺序携带的信息,检验视觉 SSM 内容感知扫描的收益来源,并提供随机排列、泄漏与输入通道对照,值得用于审查扫描策略的机制解释。
来源:OpenReview · State space models · openreview.net