跳到正文
OpenReview · State space models·· 28 天前精选AI 评分75

TCP-SSM:具有词元条件极点的高效视觉状态空间模型

TCP-SSM: Efficient Vision State Space Models with Token-Conditioned Poles

AI 导读

基于摘要分析。本文研究视觉 State Space Models(SSMs)的递归记忆行为难以显式控制的问题,提出 Token-Conditioned Poles SSM(TCP-SSM),通过稳定、随词元变化的极点调节记忆动态,并结合轻量低秩输入路径降低计算成本。主要研究对象是图像分类、语义分割和目标检测,并非 EEG 或 BCI。 核心机制:作者指出,现有效率优化多调整扫描路线、分辨率或遍历方式,而较少显式处理递归动态;紧凑骨干中的长扫描路径可能超出有效记忆范围。TCP-SSM 使用实极点表示单调或符号交替的衰减,使用复共轭极点表示阻尼振荡响应。通过有界半径与角度调制,各扫描步可根据当前视觉词元调整记忆行为,同时保持极点稳定。低秩输入路径用于实现更高效的扫描算子,保留线性时间扫描复杂度。其创新重点是极点层面的动态控制,而非仅改变视觉扫描方式。 结果与核对事项:作者报告,在上述视觉任务中,TCP-SSM 在 Vision Mamba-style 模型内最多降低 44% 的 SSM 计算复杂度,同时维持或超过基线准确性。该数字针对 SSM 计算复杂度,不能直接解释为端到端延迟或显存降低;各任务指标、对应配置、数据集、训练规模及对照设置尚未验证。极点稳定性的具体约束、低秩路径配置、实验协议、消融及统计信息也需全文核对。 平台推测(待验证):假设这种受约束的衰减与振荡记忆机制可用于 EEG 时序建模,其可能对应长程依赖与节律信息的联合表征需求,但视觉扫描中的有效性不等于 EEG 有效性。可考虑复用极点参数化与扫描算子,并改造 EEG 时间片段输入、通道融合及任务监督;低信噪比、跨被试频谱差异和小数据可能导致词元条件调制追随噪声,极点稳定也不保证泛化。一个可检验的小实验是在固定 EEG 数据划分、训练预算和输入处理下,对比固定极点与词元条件极点,检验调制是否改善任务指标及噪声扰动下的稳健性。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其稳定极点参数化如何显式调控记忆衰减与振荡响应,以及低秩输入路径在降低计算量时是否保留任务性能;对 EEG 时序建模的适用性尚未验证。

来源:OpenReview · State space models · openreview.net