RepScan:用于视觉状态空间模型的表征自适应扫描
RepScan: Representation-Adaptive Scanning for Visual State Space Models
基于摘要分析。RepScan 面向高分辨率视觉表征学习,试图缓解 Vision Transformers 的二次复杂度以及现有效率导向架构中均匀 token 处理、固定扫描顺序难以适应图像语义非均匀分布的问题。其核心贡献是根据输入表征动态构建序列化顺序,同时保留底层视觉 SSM 的高效状态传播。 机制上,Representation Relation Modeling 联合考虑表征亲和性与预测差异,刻画有向 token 关系;Adaptive Scan Initialization 据此选择具有较强出向关系支持的起始 token,Adaptive Scan Ordering 再根据剩余表征结构确定后续遍历顺序。可微置换松弛使离散扫描过程能够端到端学习,扫描构建采用稀疏、输入依赖的方式。摘要未给出关系计算、稀疏化、置换松弛的具体公式或训练监督配置,因此不能据此确定完整计算复杂度与复现条件。 作者报告,在分类、检测与分割任务中,RepScan 获得了较好的准确性—效率折中;摘要未提供数据集、数据划分、对照基线、具体指标或运行开销。实验协议、消融及统计信息尚未验证,尤其需核对自适应扫描相对固定扫描的独立贡献,以及扫描构建的时间与内存成本。 平台推测(待验证):若将 EEG 的通道或时空片段表示为 token,表征驱动的遍历顺序可能用于研究固定序列化是否限制跨通道信息传播,但这是机制层面的迁移假设,而非已证实的 BCI 效果。可复用的是关系建模与自适应排序思路,需改造 token 构建方式,并约束时间顺序及通道空间关系;低信噪比、跨被试差异和小数据可能使关系估计与离散排序不稳定。一个可检验的小实验是在同一 EEG 划分、相同底层 SSM 与训练预算下,对比固定扫描和自适应扫描,同时记录任务指标及推理开销。已有 EEG 相关工作尚未检索确认。
值得核对其基于表征关系学习输入依赖扫描顺序的实现,以及扫描构建开销是否抵消视觉 SSM 的效率优势;摘要中的准确性—效率收益尚需全文实验验证。
来源:OpenReview · State space models · openreview.net