跳到正文

算法、任务与模态

Computer Vision 最新动态

Computer Vision 研究索引;按可核对的标签归档,不以热度评价质量。

109 条精选近 30 天 60 条共收录 131 条

更新

精选归档 · 第 4 页

9月8日周二第 61–80 条
  1. OpenReview · State space models73

    视觉状态空间模型的选择性操作量化

    基于摘要分析。该研究面向视觉 State Space Models(SSMs)在资源受限边缘设备上的部署,提出训练后量化(Post-Training Quantization,PTQ)方法 SELective Operation Quantization(SELOQ),重点解决选择性操作中特殊激活分布造成的量化困难。 核心机制是针对不同量化对象分别处理:作者分析指出,离散参数的分布具有长尾偏斜,隐藏状态序列则具有高度动态的变化;据此设计 Long-tailed Skewness Quantization(LtSQ)量化离散参数,以及 Temporal Scale Quantization(TSQ)量化隐藏状态,以降低量化误差。摘要未提供具体量化公式、位宽、尺度计算方式或校准数据要求,不能据此判断其实现开销与适用边界。 作者报告,在多个视觉任务、模型规模与架构上,SELOQ 对量化视觉 SSMs 的表现显著优于现有方法。摘要未列出任务与数据集名称、评估指标、具体数值及对照基线,因此尚不能量化收益,也不能将任务表现直接等同于真实设备上的加速或能耗改善;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若用于 EEG 的 SSM 同样出现离散参数长尾偏斜与隐藏状态尺度随时间变化,SELOQ 的分对象量化思路可能有助于边缘部署,但视觉模型中的有效性不等于 EEG/BCI 有效性。可复用的是 LtSQ 与 TSQ 的设计思路,需改造和核对的是 EEG 模型中的选择性操作实现、时间维度及校准数据覆盖。低信噪比、跨被试或通道变化可能使校准分布失配,小数据条件也可能难以覆盖隐藏状态变化。一个可检验的小实验是:在已有 EEG SSM 上固定数据划分、量化位宽与校准样本,对比常规 PTQ、分别加入 LtSQ 或 TSQ、以及两者组合,检查量化误差与原任务指标,并独立测量设备延迟。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其针对离散参数长尾偏斜与隐藏状态时序变化分别设计量化策略的机制,但性能收益、部署成本及向 EEG 模型迁移的有效性仍需核对。

7月10日周五
  1. OpenReview · Representation learning71

    通过 Neural Radiance Fields 对齐人类检查意图与机器人行为

    基于摘要分析。研究针对小型工业部件检查中机器人视点控制依赖工程 expertise、现场协作及反复人工干预的问题,提出从感知到动作的框架:操作者通过目标表面的一张或多张 RGB 参考图像表达检查意图,系统将其转换为机器人可执行的观察轨迹。 核心机制是用检查对象的多视角采集数据训练 Instant-NGP 辐射场,作为人类示范与机器人动作之间的共享表示。系统通过场景自适应复合损失,将参考图像与 NeRF 渲染的候选图像匹配,再以姿态估计恢复 6-DoF 相机姿态,并将这些姿态串联为 UR5e 机器人的执行轨迹。摘要未给出复合损失的具体形式、候选视点生成与搜索策略,以及相机姿态到机器人运动的标定和规划细节,这些均尚未验证。 作者报告在合成基准和真实机器人执行中进行了验证,并称系统能够处理梯度式反演失效时的大旋转偏差,不需要 CAD 模型、深度传感器或动觉引导。这些结论依赖对象的多视角采集与已训练辐射场;摘要未提供基准名称、数据划分、对照配置、姿态误差或执行成功率,实验协议、消融及统计信息尚未验证。 本文的“人类意图”由 RGB 图像示范表达,并非从 EEG 或其他脑信号解码,不能视为已验证的 BCI 方法。其直接复现价值在于检查图像匹配能否稳定转化为可执行视点;需进一步核对反光或弱纹理表面、参考图像与采集条件变化、机器人可达性及轨迹安全约束下的表现。尚未检索确认相关 EEG 工作。

    阅读价值:值得阅读其以 Instant-NGP 作为人类图像示范与机器人视点控制之间共享表示的机制,尤其是作者报告可处理梯度式反演失效的大旋转偏差,但具体性能与复现条件尚未验证。

5月1日周五
  1. OpenReview · State space models76

    SF-Mamba:重新思考用于视觉的状态空间模型

    基于摘要分析。本文针对视觉 Mamba 的扫描机制限制图像 patch 间非因果交互、多扫描策略带来数据重排开销,以及短 token 序列下计算速度较慢的问题,提出 SF-Mamba,尝试同时改善视觉编码的信息流与计算效率。 核心机制包括两项:辅助 patch swapping,在单向扫描中编码双向信息流;batch folding 配合周期性状态重置,以提升 GPU 并行度。其思路不是单纯增加扫描方向,而是重新组织 patch 交互与计算执行。摘要未说明交换规则、折叠维度、状态重置周期,以及这些操作如何保持上下文信息,具体实现尚未验证。 作者报告,在图像分类、目标检测、实例分割和语义分割实验中,SF-Mamba 在不同模型规模下优于作者所称的最先进基线,并提升吞吐量。摘要未提供数据集、划分、评价指标、数值、硬件环境及吞吐测量条件,因此目前不能量化性能收益或判断不同设置下的可比性;实验协议、消融及统计信息尚未验证。摘要提供了代码仓库,但代码内容、运行依赖与复现结果尚未核验。 平台推测(待验证):若 EEG 被组织为时间片段或通道—时间 token,patch swapping 可能为单向扫描补充双向上下文,batch folding 则可能改善短序列训练或推理的 GPU 利用率。这一假设依赖 token 的时空结构及计算规模,视觉任务中的收益不能直接视为 BCI 效果。迁移时需改造交换规则以匹配电极与时间关系,并核对周期性状态重置是否截断关键时序信息;低信噪比、跨被试差异、通道变化和小数据可能削弱收益,在线因果解码也需单独评估。可先在固定 EEG 数据划分和硬件条件下,对比原始单向 Mamba 与分别加入两项机制的版本,记录任务指标、吞吐及延迟,以检验机制收益能否迁移。相关 EEG 工作尚未检索确认。

    阅读价值:值得核对 SF-Mamba 如何以 patch swapping 和 batch folding 同时改善视觉状态空间模型的信息交互与 GPU 吞吐,但性能优势及其对 EEG 的迁移价值尚需验证。

3月3日周二
  1. OpenReview · Representation learning73

    面向 flow-matching 模型的结构化图像表征学习

    基于摘要分析。该研究针对标准 flow-matching 图像生成模型难以同时学得可操作、可组合及可供其他任务使用的潜在表征这一问题,提出共同训练图像编码器与以潜变量为条件的 flow-matching“解码器”,将无监督表征学习与图像生成结合。 核心机制是使用强化学习目标训练编码器,并将 flow-matching 回归损失作为随机奖励信号。作者进一步修改强化学习目标,使期望奖励以噪声水平为条件,从而让编码器利用 flow-matching 输出与带噪目标比较所产生的中间信号。摘要未提供奖励与损失的具体转换、梯度估计方式、噪声条件化的实现,以及结构化潜变量的定义与约束,这些细节尚未验证。 作者报告,该方法能够学习非结构化与结构化潜变量,同时保留 flow-matching 的高质量生成能力;但摘要未给出数据集、评估协议、对照模型或定量指标,因此尚不能确认表征的可组合性、下游效用与生成质量之间的权衡。实验协议、消融及统计信息尚未验证,复现还需核对编码器与生成模型的训练安排及实现条件。 平台推测(待验证):若潜变量能分离任务相关因素与噪声因素,该机制可能用于 EEG 时频图的无监督表征学习。原方法依赖图像输入、带噪目标和条件生成训练;迁移时需改造编码器、生成目标及潜变量结构,以适配通道关系和时间信息。低信噪比、跨被试差异及小数据可能使潜变量优先编码伪迹或被试身份,而非任务信息。可检验的小实验是在固定 Cross-subject 划分下,仅用训练被试数据学习表征,再以冻结编码器进行任务线性探测,并与非结构化潜变量版本比较,同时检查被试身份可预测性。该实验属于迁移假设,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其以 flow-matching 回归损失作为随机奖励、并按噪声水平条件化期望奖励的编码器训练机制,以及结构化潜变量的可复用性是否获得下游实验支持。

1月26日周一
  1. OpenReview · State space models77

    使状态空间模型在视觉任务中实现真正的全局感知

    基于摘要分析。该研究针对视觉任务中全局上下文建模缺乏严格数学定义,以及注意力计算成本与状态空间模型(SSMs)递归建模限制之间的矛盾,提出全局图像建模的数学定义和频域理论框架,并据此设计 Global-aware SSM(GSSM)与可嵌入 CNN 的 GMamba 模块。 核心机制是基于 Discrete Fourier Transform(DFT)的调制,在 SSM 前端控制其建模行为,以频域视角处理递归机制对全局感知的限制。作者称已形式化证明 GSSM 满足所提出的全局图像建模定义,并报告其计算复杂度为线性对数级。摘要未给出定义的具体条件、调制形式、训练目标及复杂度所对应的输入规模变量,因此尚不能判断该定义与常见全局感受野或全局信息交互的关系。 作者报告,在目标检测、语义分割和实例分割任务、以及多种模型架构中,GMamba 均优于现有全局建模模块;但摘要未列出数据集、划分、对照模块、评价指标或具体增益,不能据此判断优势幅度及不同协议下的可比性。作者提供了代码链接,代码完整性、运行条件、实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 DFT 调制的全局建模机制能够适配多通道时间序列,它可能用于探索 EEG 长时程信息交互,但视觉结果不等于 BCI 有效。原方法面向图像结构,其监督方式与所需数据规模尚未明确;迁移时需改造时间与通道布局、频域调制及任务输出模块,并核对是否需要双向或完整片段输入。低信噪比、跨被试频谱差异、通道变化及小数据过拟合均可能使收益失效。可在固定 EEG 数据划分与相同训练预算下,对比基础 SSM、加入 GSSM 的版本及移除 DFT 调制的版本,检验任务指标与计算开销,并分别报告被试内和跨被试结果。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其全局建模的数学定义与 DFT 调制如何改变 SSM 的递归建模限制,但理论证明的适用条件、计算复杂度口径及视觉实验对照尚需全文核对。

11月6日周四
  1. OpenReview · State space models70

    RPCASSM:用于红外小目标检测的鲁棒主成分分析状态空间模型

    基于摘要分析。该研究针对远距离红外成像中小目标占比低、主流视觉状态空间模型难以准确建模目标边缘的问题,提出基于鲁棒主成分分析(RPCA)范式的 RPCASSM,分别设计背景状态空间模块(BSSM)与目标状态空间模块(TSSM)。核心贡献是依据红外小目标的空间结构特性定制扫描机制,而非直接沿用主流视觉状态空间框架。 机制方面,BSSM 利用空间异质信号的显著性,通过空间探针扫描机制(SPCM)建模背景信息;TSSM 利用目标的稀疏性与局部高亮特征,通过可变形提示扫描机制(DPCM)聚焦目标的可变形空间。摘要将该设计与 RPCA 范式关联,但具体分解形式、模块耦合方式、损失函数及训练和推理流程尚未验证,不能据此认定网络显式求解了某种 RPCA 优化目标。 作者报告,在现有基准数据集上的实验支持 RPCASSM 设计的有效性,并称其改善了红外小目标边缘结构的建模。摘要未提供数据集名称、划分协议、对照基线或定量指标,因此目前无法判断收益幅度及适用范围;实验协议、消融及统计信息尚未验证。 平台推测(待验证):其背景与稀疏局部目标分开建模的机制,可能启发 EEG 中背景活动与短暂事件的分离,但这是迁移假设,不是已证实的 BCI 效果。该方法依赖图像中的空间异质性、目标稀疏性和局部高亮,而 EEG 事件未必稀疏或高幅,电极邻接结构也不同于图像网格。可复用的是分模块建模思路,扫描路径与可变形提示机制则需适配时间轴及通道拓扑;低信噪比、伪迹高幅响应、跨被试差异和小数据训练均可能导致失败。一个可证伪的小实验是在固定 EEG 数据划分和相同训练条件下,比较通用状态空间模型与适配后的双模块模型,检验事件检出及时间定位是否改善,并核对是否增加伪迹误检。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其依据背景与稀疏目标结构分别设计状态空间扫描机制的思路,但边缘建模收益及相对基线的有效性仍需核对全文实验。

9月19日周五
  1. OpenReview · Representation learning71

    FORLA:基于 Slot Attention 的联邦对象中心表征学习

    基于摘要分析。FORLA 面向异质、无标签视觉数据上的联邦表征学习,尝试在保留跨客户端共同信息的同时解耦域特有因素。其核心贡献是协同训练共享特征适配器与共享 slot attention 模块,将基础模型特征适配与对象中心表征学习结合起来。 机制上,共享适配器负责转换基础模型提供的特征,slot attention 模块学习重建适配后的特征,并承担跨客户端对象级表征对齐。为优化适配器,作者设计了双分支 student–teacher 架构:各客户端的 student decoder 重建基础模型的完整特征,teacher decoder 重建适配后的低维特征。摘要未给出具体损失形式、教师更新方式、联邦聚合策略或基础模型配置,这些实现条件尚未验证。 作者报告,在多个真实世界数据集的对象发现任务中,FORLA 优于集中式基线,并学得紧凑、可跨域泛化的表征。但摘要未提供数据集名称、客户端划分、评价指标、数值结果及基线配置,因而无法判断优势出现的具体条件,也不能据此认定其在所有联邦设置下优于集中式训练。实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移至 EEG 的假设是,共享适配器可缓解不同被试或采集域的特征差异,slot attention 可用于提取跨域共有的潜在成分。原方法依赖基础模型特征及视觉对象结构;EEG 中是否存在可稳定分离、对齐的对应成分尚不明确。可复用部分是共享适配与潜在成分重建,需改造 EEG 特征编码、时空位置表示及客户端划分。低信噪比、通道不一致和小数据可能使 slot 聚合噪声或被试特有因素,而非任务相关成分。一个可检验的小实验是在固定 EEG 编码器和相同 Cross-subject 划分下,对比共享适配器单独使用与加入 slot attention 的方案,核对跨被试表现及成分稳定性;这不是已验证的 BCI 结果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的具体原因是 FORLA 将共享特征适配器、无监督 slot attention 与双分支 student–teacher 重建结合,用于异质客户端间的对象级表征对齐,但其优于集中式基线的条件及向 EEG 迁移的可行性尚未验证。

  2. OpenReview · Representation learning74

    面向定制任务的条件表征学习

    基于摘要分析。该研究针对通用表征偏向主导语义、难以匹配用户定制任务的问题,提出 Conditional Representation Learning(CRL),利用用户指定的语义准则构造条件特征空间,并将图像表示投影到该空间,为定制分类与检索任务提供表征。 核心机制:作者提出,特征空间的语义由其基决定,因此可用一组描述性词语近似定制空间的基。CRL 先通过大语言模型(LLM)生成与用户准则相关的描述文本,再借助视觉语言模型(VLM)将图像表示投影到相应条件空间。摘要以动物栖息地分析为例,说明任务需要场景特征,而通用嵌入可能更强调类别语义。其方法侧重按准则调整表示空间,而非直接依赖监督微调;是否完全免训练、如何构造和规范化语义基、具体投影公式及计算成本尚未验证。 作者报告,分类与检索实验支持 CRL 的优越性和通用性,但摘要未提供数据集、划分、对照方法或具体指标,暂不能判断收益幅度及适用边界。实验协议、消融及统计信息尚未验证。摘要提供了代码仓库地址,但实现细节、模型依赖和复现条件尚未核查,亦不能由仓库名称推断论文接收状态。 平台推测(待验证):该机制可能为 EEG 中“通用表征未保留目标任务信息”的问题提供思路,但原方法依赖图像与文本之间的语义对齐,不能直接视为 EEG 方法。假设已有 EEG 编码器可与任务描述建立可靠对齐,可复用文本准则生成与条件投影思路,需改造信号编码和跨模态对齐模块。低信噪比、跨被试或通道差异,以及小数据条件下的对齐不稳定,可能使文本基无法对应可解码的神经特征。一个可检验的小实验是在固定的跨被试划分下,对同一冻结 EEG 表征比较原始表示、真实任务文本条件投影与打乱文本条件投影,检查增益是否确由任务语义带来。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 CRL 如何用文本构造条件语义基并投影图像表示,以缓解通用表征与定制任务的语义错配;其对 EEG/BCI 的适用性尚未验证。

  3. OpenReview · State space models72

    DAMamba:采用动态自适应扫描的视觉状态空间模型

    基于摘要分析。该研究针对视觉状态空间模型(SSMs)将图像块按人工设计的路径展平为序列时,可能破坏语义空间邻接关系、难以适应复杂图像结构的问题,提出 Dynamic Adaptive Scan(DAS),并据此构建视觉骨干 DAMamba。其核心贡献是以数据驱动方式自适应分配扫描顺序与区域,而非依赖固定的局部或全局扫描路径。 机制与结果:作者称 DAS 在增强建模灵活性的同时,保持线性计算复杂度与全局建模能力。作者报告,DAMamba 在图像分类、目标检测、实例分割和语义分割任务中优于多种常用视觉 Mamba 模型,并超过部分近期先进 CNNs 与 ViTs。摘要未给出对应数据集、数据划分、基线配置或具体指标,因此不能量化提升或确认不同模型间的比较条件。扫描分配的实现、训练监督、损失、复杂度计算口径,以及实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设 DAS 能在 EEG 通道拓扑或时频表示上学习有意义的遍历顺序,它可能缓解固定序列化方式对空间关系的扭曲;但图像块的二维邻接与 EEG 电极布局及信号相关性并不等价。可考虑复用自适应扫描思路,需改造输入表示、位置关系和扫描约束。其所需训练规模及监督条件尚未验证;低信噪比、小数据、跨被试差异和通道布局变化可能导致扫描策略不稳定或过拟合。 一个可证伪的小实验是:在同一 EEG 任务、固定数据划分与训练预算下,对比固定扫描和 DAS,使用相同骨干与预处理,分别评估被试内和跨被试表现,并观察通道扰动后的性能与扫描稳定性。这仅是迁移假设,不是已验证的 BCI 结果;已有 EEG 相关工作尚未检索确认。复现仍需全文中的扫描算法、训练配置和实现细节。

    阅读价值:值得核对 DAS 如何学习扫描顺序与区域,以及其线性计算复杂度和视觉任务收益的验证方式;摘要尚不足以确认其对 EEG 空间关系建模的适用性。

9月15日周一
  1. OpenReview · State space models75

    SF-Mamba:重新思考面向视觉的状态空间模型

    基于摘要分析。该研究针对视觉 Mamba 中单向递归扫描限制图像 patch 非因果交互、多扫描策略引入数据重排开销,以及短 token 序列下计算速度较慢的问题,提出视觉编码器 SF-Mamba,试图同时改善信息交互与计算效率。 核心机制包括两项设计:通过辅助 patch 交换,在单向扫描下编码双向信息流;通过 batch folding 与周期性状态重置,提升 GPU 并行性。摘要未给出 patch 交换规则、batch folding 的具体张量组织、状态重置周期及其对上下文保留的影响,因此这些实现细节尚未验证。其创新重点是重新设计扫描与执行方式,而非仅增加扫描方向。 作者报告,在图像分类、目标检测、实例分割和语义分割实验中,SF-Mamba 相比作者所称的最先进基线取得更好的任务表现,并在不同模型规模下提高吞吐量。摘要未提供数据集、指标数值、基线名称、硬件、batch size 或吞吐量测量条件,无法据此量化收益或判断公平比较;实验协议、消融及统计信息尚未验证。材料称代码将在发表后发布,当前代码可用性与论文发表状态不能由此推定。 平台推测(待验证):该方法原本依赖图像 patch 序列及 GPU 批处理结构,其扫描效率设计可能为短序列 EEG 编码提供参考,但不构成已验证的 BCI 效果。迁移假设是,辅助 token 交换能够改善 EEG 时间窗或通道 token 的信息交互;需改造 patch/token 构造与交换规则,并检查周期性状态重置是否损失跨窗依赖。低信噪比、跨被试差异、通道排列变化及小数据训练可能削弱收益。可在固定 EEG 数据划分与同一硬件、batch size 下,对照普通单向扫描,分别加入交换和状态重置,比较任务指标与吞吐量;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 SF-Mamba 如何以辅助 patch 交换和周期性状态重置兼顾信息交互与 GPU 吞吐量,但其相对基线的效果及迁移至 EEG 的适用性尚未验证。

7月8日周二
  1. OpenReview · State space models71

    MS-SSM:用于高效序列建模的多尺度状态空间模型

    基于摘要分析。MS-SSM 针对传统状态空间模型(SSM)有效记忆受限、难以同时捕获多尺度依赖的问题,将序列动态表示在多个分辨率上,并为各分辨率配置专门的状态空间动力学;同时引入输入依赖的 scale-mixer,动态融合不同分辨率的信息。 核心机制是同时建模细粒度高频模式与粗粒度全局趋势,以改善记忆效率和长程建模。相较于摘要所述依赖扩大状态尺寸来提升召回能力的传统 SSM,本文侧重多分辨率处理与动态跨尺度融合。分辨率如何构造、各尺度状态如何更新、scale-mixer 的具体形式,以及训练目标、稳定性约束和复杂度尚未验证。 作者报告,在包括 Long Range Arena、hierarchical reasoning、time series classification 和 image recognition 的基准实验中,MS-SSM 持续优于此前的 SSM 模型,并保持计算效率。摘要未提供具体分数、数据划分、对照模型配置或效率测量条件,因此无法判断提升幅度及性能与成本的权衡;实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设多尺度机制能区分 EEG 的局部快速变化与较慢的时序背景,其可能缓解长序列建模中的记忆压缩瓶颈,但原领域结果不等于 EEG/BCI 有效。可尝试复用多尺度状态动态与 scale-mixer,需按采样率和目标信号调整分辨率构造,并适配多通道输入。低信噪比可能使动态融合追随伪迹,降采样可能损失任务相关信息,跨被试差异与小数据也可能限制泛化。一个可检验的小实验是在固定 EEG 任务和相同 Cross-subject 划分下,对比单尺度 SSM、多尺度但固定融合、完整 MS-SSM,并控制参数量与训练预算,联合检查任务指标、推理成本和噪声扰动下的稳定性。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对多分辨率状态空间动力学与输入依赖 scale-mixer 能否在计算成本可比时改善长程记忆,以及各模块对性能的独立贡献;其 EEG 迁移价值尚未验证。

5月1日周四
  1. OpenReview · Representation learning74

    Sliding Puzzles Gym:视觉强化学习中状态表征的可扩展基准

    基于摘要分析。该研究针对视觉强化学习基准难以将表征学习能力与其他学习挑战分离评估的问题,提出 Sliding Puzzles Gym(SPGym),将经典 8-tile puzzle 转化为使用可扩展图像池的视觉 RL 任务。其核心贡献是通过可调网格大小和图像池控制视觉表征难度,为研究表征能力随视觉多样性变化的表现提供评估环境。 机制上,摘要称 SPGym 在保持环境动力学、观测空间和动作空间固定的同时,调节表征学习复杂度。不过,网格大小变化与这些空间保持固定之间的具体实现关系,仍需正文核对。该基准依赖图像构成的拼图观测与 RL 交互任务;图像内容、池规模及训练与测试的分布划分,是解释泛化结果的重要条件。 作者报告,在所评估的 model-free 与 model-based RL 算法中,随着可能出现的图像池扩大,所有受评算法的分布内和分布外表现均下降;复杂表征学习技术也常不及数据增强等较简单方法。这一结果限定于摘要所述实验,不能扩展为所有 RL 方法的普遍结论。具体算法、图像数据集、评价指标、划分协议、消融及统计信息尚未验证,摘要未提供可用于量化比较的数值。 平台推测(待验证):其对 BCI 的潜在启发主要是评估设计,而非直接可迁移的模型——可借鉴将任务规则与输入多样性分开控制的思路,检验 EEG 表征在跨被试或跨会话变化下的稳定性。但 EEG 的低信噪比、通道差异及有限样本与视觉拼图不同,需要重新定义观测、任务和分布变化因素;不能据此认定 SPGym 的结果适用于 EEG。已有 EEG 相关工作尚未检索确认。复现前还需核对环境实现、图像池构建方式、对照配置与代码可用性。

    阅读价值:SPGym 通过控制图像池与拼图规模考察视觉表征能力,值得核对其隔离表征难度的实验设计,以及复杂表征方法与数据增强在相同协议下的比较结果。

1月23日周四
  1. OpenReview · State space models78

    HOPE:长记忆状态空间模型的稳健参数化

    基于摘要分析。本文研究基于线性时不变(LTI)系统的状态空间模型(SSM)为何依赖专门设计的初始化,以及状态矩阵在对数尺度上以很小学习率训练的做法,并提出基于 Hankel operator 理论的参数化方案 HOPE,旨在改善初始化与训练稳定性。 机制上,HOPE 利用 Hankel operators 中的 Markov parameters 对 LTI 系统进行参数化,并通过对 LTI 系统传递函数进行非均匀采样实现高效计算。作者报告,该方案相较于常规 SSM 使用更少参数,并改善训练稳定性。摘要未给出具体参数化公式、采样策略、损失形式或参数量,相关实现条件尚未验证。 实验方面,作者报告,在 Long-Range Arena(LRA)任务上,基于 Hankel operators 参数化的 SSM 相较于采用 HiPPO 初始化的 S4、S4D 表现更好;摘要未提供具体任务分项、指标、数据划分及数值。作者还报告,该参数化具有固定时间窗内不衰减的记忆,并以加入填充噪声的 sequential CIFAR-10 任务提供经验支持。这不等同于无限时长记忆,也不能直接外推为生理信号中的抗噪能力。实验协议、消融及统计信息尚未验证。 平台推测(待验证):其迁移假设是,若 EEG 任务依赖较长时间跨度的有效信息,HOPE 的记忆参数化可能有助于降低长序列训练对初始化的敏感性。原方法依赖时序输入与 LTI 动态建模;迁移时可复用参数化及传递函数采样机制,但需适配多通道 EEG 输入与任务输出。低信噪比可能使长记忆同时保留无关噪声,跨被试差异、通道变化和小数据条件也可能削弱收益。可在一个固定的 EEG 任务与数据划分下,以相同输入处理和训练预算比较 HOPE 与 S4D,并改变有效片段后的噪声填充长度,检验任务指标与训练稳定性是否更稳健。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是 HOPE 将长记忆 SSM 的初始化与训练稳定性问题统一到 Hankel operator 参数化视角;作者报告的固定时间窗内不衰减记忆,为评估噪声背景下的长时依赖提供了具体切入点,但 EEG 适用性尚未验证。

  2. OpenReview · State space models72

    从层到状态:深度神经网络层动态的状态空间模型视角

    基于摘要分析。本文研究深层神经网络如何复用先前层的信息以增强当前层的特征表示,将各层输出视为连续过程的状态,并提出 Selective State Space Model Layer Aggregation(S6LA),利用 Selective State Space Models(S6)设计层间聚合模块。 核心机制是把状态空间模型(SSM)的建模对象从通常的序列位置转向网络深度方向的层输出。作者认为,既有层聚合方法主要采用离散状态视角,在网络层数增大时存在适用性限制;S6LA 则尝试以序列框架结合传统 CNN 或 transformer 架构。这里的“序列”主要对应层间信息演化,不能直接等同于输入信号的时间序列。连续状态的具体参数化、不同层特征的维度对齐、选择性机制及训练方式均需全文核对。 作者报告,S6LA 在图像分类与检测任务中带来显著改进,但摘要未提供数据集、划分、对照基线、指标或具体数值,因此无法判断改进幅度、计算代价及其对网络深度的依赖。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型存在跨层特征复用不足的问题,可考虑复用 S6LA 的沿深度聚合思路,而非直接把它当作 EEG 时间建模模块。该迁移假设依赖可组织为层序列的中间表示,需要改造不同层的通道数、时间分辨率与特征对齐方式;低信噪比可能使聚合传播噪声,跨被试差异和小数据也可能使选择性机制过拟合。一个可检验的小实验是在固定 EEG 骨干和 Cross-subject 划分下,比较原模型、简单层聚合与 S6LA,并同时记录任务指标、参数量及推理开销。上述仅为验证建议,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 S6LA 如何将沿网络深度的层间聚合建模为状态演化,以及其相对既有层聚合方法的收益与开销;摘要支持视觉任务中的作者报告,尚不能据此确认 EEG 适用性。

1月1日周三
  1. OpenReview · State space models72

    DefMamba:可变形视觉状态空间模型

    基于摘要分析。DefMamba 针对视觉 Mamba 将图像按预定义扫描顺序展平为一维序列、可能难以充分利用空间结构的问题,提出结合多尺度骨干与 deformable mamba(DM)模块的视觉基础模型,通过动态调整扫描路径增强相关输入特征的提取。 核心机制是 deformable scanning(DS)策略:不完全沿固定顺序处理图像,而是动态调整扫描路径,优先处理重要信息。作者认为,这有助于学习图像结构并捕捉物体细节变化。摘要未说明扫描位置如何生成、是否使用额外监督,以及动态扫描与状态空间计算如何衔接;具体损失、训练配置、参数规模和计算开销尚未验证。 作者报告,DefMamba 在 image classification、object detection、instance segmentation 和 semantic segmentation 等视觉任务上达到领先性能,但摘要未提供数据集、划分、基线或指标数值,因此无法评估各任务的收益幅度及效率权衡。实验协议、消融及统计信息尚未验证。摘要称代码已开源,但当前材料不足以核对实现入口、权重及复现条件。 平台推测(待验证):迁移假设是,若 EEG 的通道空间关系与时序变化能够形成有意义的扫描结构,动态扫描可能缓解固定通道或时空遍历顺序对局部相关性的限制。可考虑复用状态空间处理与动态扫描思路,但需改造图像空间坐标、多尺度特征组织和扫描约束。原方法依赖的图像网格结构不能直接等同于 EEG 电极布局;低信噪比可能使扫描路径追随伪迹,跨被试及通道配置变化也可能破坏路径稳定性,小数据则可能增加路径学习的过拟合风险。一个可检验的小实验是在同一 EEG 数据划分、预处理与训练预算下,对比固定扫描与可学习扫描,并检查任务指标、计算开销及噪声扰动下的路径稳定性。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其可变形扫描相较固定扫描顺序的空间结构建模收益与计算开销,但摘要中的领先性能主张及向 EEG 迁移的有效性尚未验证。

  2. OpenReview · State space models72

    DefMamba:可变形视觉状态空间模型

    基于摘要分析。DefMamba 针对视觉 Mamba 将图像按预定义顺序展平为一维序列、难以充分利用空间结构的问题,提出结合多尺度骨干结构与 deformable mamba(DM)模块的视觉模型。核心贡献是通过 deformable scanning(DS)策略动态调整扫描路径,使特征处理优先关注重要信息。 机制与证据:摘要将空间结构利用不足归因于固定扫描顺序,并以可变形扫描改善图像结构学习和物体细节变化的捕捉。多尺度结构与动态扫描的具体结合方式、路径生成机制、训练目标及计算开销尚未验证。作者将 DefMamba 称为视觉基础模型,但摘要未提供预训练数据、规模或迁移设置,不能据此判断其基础模型能力。 作者报告,在 image classification、object detection、instance segmentation 和 semantic segmentation 等视觉任务上取得 state-of-the-art 性能;摘要未给出数据集、评估划分、指标数值和对照基线,因此无法判断优势幅度或不同任务间的可比性。实验协议、消融及统计信息尚未验证。摘要称代码已开源,但具体仓库、训练配置和复现条件尚未核实。 平台推测(待验证):迁移假设是,将固定扫描改为内容相关扫描,可能改善 EEG 时空特征的选择与整合;这不是已证实的 BCI 效果。原方法依赖图像的空间结构及视觉任务数据,具体监督方式与数据规模未知。可考虑复用动态扫描思想,但需将二维图像空间改造为电极拓扑与时间结构,并约束扫描保留时序关系。低信噪比可能使路径追踪伪迹,跨被试及通道布局差异可能破坏空间对应,小数据可能导致扫描策略过拟合。一个可证伪的小实验是:在相同数据划分、训练预算与骨干配置下,比较固定扫描和电极拓扑约束的动态扫描在 Cross-subject EEG 分类中的表现,同时检查噪声扰动后的路径稳定性。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其可变形扫描如何缓解视觉 Mamba 固定扫描顺序对空间结构利用的限制,但性能优势及向 EEG 迁移的可行性尚需核对全文与实验。

  3. OpenReview · State space models72

    DefMamba:可变形视觉状态空间模型

    基于摘要分析。DefMamba 针对视觉 Mamba 将图像按预定义扫描顺序展平为一维序列、可能削弱空间结构利用的问题,提出结合多尺度骨干与 deformable mamba(DM)模块的视觉模型。核心贡献是通过 deformable scanning(DS)动态调整扫描路径,优先处理重要信息,以增强空间结构及目标细节的表征。 机制与证据:摘要将改进归因于动态扫描,而非仅采用固定顺序的序列化。作者报告,DefMamba 在 image classification、object detection、instance segmentation 和 semantic segmentation 任务上达到领先性能;但材料未提供数据集、划分、指标数值、对照模型或计算成本,尚不能判断收益幅度及效率权衡。扫描路径如何生成、是否可微、训练目标,以及多尺度骨干和 DS 的独立贡献,均需查阅全文;实验协议、消融及统计信息尚未验证。作者称代码已开源,但材料未给出可核对的仓库地址,运行环境、配置及权重可用性尚未验证。摘要称其为视觉基础模型,预训练规模与迁移评估范围仍待核对。 平台推测(待验证):迁移假设是,若 EEG 的通道拓扑与时频表示提供稳定的空间结构,内容自适应扫描可能缓解固定序列化难以利用通道关系的问题。可考虑复用动态扫描思想,但扫描坐标、通道邻接及输入编码需针对 EEG 改造;其监督需求和数据规模依赖尚不明确。低信噪比可能使路径追随伪迹,跨被试差异与通道缺失可能破坏结构,小数据也可能使路径学习过拟合。一个可检验的小实验是在同一 EEG 任务、固定 Cross-subject 划分和相同训练预算下,仅替换固定扫描与动态扫描,并比较预先选定的同一指标及通道扰动下的稳定性。该实验只是迁移验证建议,不代表已有 EEG 效果;相关 EEG 工作尚未检索确认。

    阅读价值:值得核对 DefMamba 的动态扫描机制及其相对固定扫描顺序的收益,但摘要中的领先性能主张与向 EEG 迁移的价值均需进一步验证。

  4. OpenReview · State space models72

    DefMamba:可变形视觉状态空间模型

    基于摘要分析。DefMamba 针对视觉 Mamba 将图像按预定义扫描顺序展平成一维序列、难以充分利用空间结构的问题,提出结合多尺度骨干与 deformable mamba(DM)模块的视觉模型。其核心贡献是通过 deformable scanning(DS,可变形扫描)动态调整扫描路径,优先处理重要信息,以增强空间结构与目标细节的表征。 机制与结果:摘要将 DefMamba 称为视觉基础模型,但其预训练数据、规模与迁移设置尚未验证。动态扫描改变了特征进入序列处理的次序,而不只是采用固定遍历方式;扫描路径的生成方式、是否可微、训练目标及额外计算开销仍需正文确认。作者报告,DefMamba 在 image classification、object detection、instance segmentation 和 semantic segmentation 等视觉任务上达到领先性能;摘要未提供数据集、指标、划分或对照数值,因此目前无法评估收益幅度及不同任务间的一致性。作者称代码已开源,但材料未提供可核对的仓库地址。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若动态扫描能够根据输入选择有意义的邻接关系,其机制可能用于缓解 EEG 时空序列展平后电极空间关系被弱化的问题;但图像规则网格与 EEG 电极拓扑并不等价。可复用的是 SSM 序列建模与自适应扫描思路,需改造的是电极位置编码、时空扫描约束和重要性估计。低信噪比下扫描可能追随伪迹,跨被试或通道配置变化可能使路径不稳定,小数据也可能不足以学习可靠路径。一个可证伪的小实验是在同一 EEG 任务、固定跨被试划分和匹配训练预算下,仅替换固定扫描与动态扫描,比较任务指标、路径稳定性及计算开销。此项迁移并非作者已验证结果,相关 EEG 工作尚未检索确认。

    阅读价值:值得核对其动态扫描路径如何保留空间结构,以及相对固定扫描的收益与计算代价;摘要中的领先性能结论仍需结合任务协议和对照实验验证。

  5. OpenReview · State space models70

    DSSM:用于人体动作生成的双状态空间模型

    基于摘要分析。该研究面向文本驱动的人体动作生成,针对词级文本描述与关节级动作表示之间特征信息量不均衡、影响潜在空间特征融合的问题,提出 Dual State Space Model(DSSM),通过从粗到细重建融合特征缓解模态间失衡。 机制上,DSSM 包含 Masked State Space Model(MSSM)与 Hierarchical State Space Block(HSSB)两个单元,并引入状态空间模型(SSM)以利用时序信息、降低计算复杂度。摘要未说明掩码对象、层级组织、融合位置、损失函数及训练与推理流程,这些细节尚未验证。作者声称这是首次将 SSM 引入文本驱动的动作序列生成,该优先性尚未独立核实。 作者报告,在 HumanML3D 与 KITML 基准数据集上达到 SOTA 表现;但摘要未提供具体指标、数值、数据划分或对照基线,因此无法判断优势幅度,也无法核对计算复杂度收益。实验协议、消融及统计信息尚未验证。摘要提供了 GitHub 代码地址,但代码完整性、依赖环境及复现条件尚未核验。 平台推测(待验证):其原问题是文本与动作序列的信息量不平衡,机制依赖文本—关节序列的跨模态对应关系;具体监督形式和训练规模尚未明确。假设 EEG 与文本或运动学信号的融合也受到模态信息量失衡影响,可考察粗到细融合重建与 SSM 时序建模的复用价值,但需改造 EEG 输入表示、通道处理及模态对齐方式。低信噪比、跨被试差异、通道配置变化与小数据可能使重建过程偏向更强模态,削弱 EEG 信息。一个可检验的小实验是在固定划分的配对 EEG—运动学任务中,对比常规融合与该重建机制,并通过削弱或移除 EEG 输入检验是否真正利用 EEG;这不构成已验证的 BCI 效果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得关注其以 MSSM 与 HSSB 从粗到细重建文本—动作融合特征的机制,但作者报告的性能优势及其对 EEG 多模态融合的适用性尚需分别核对与验证。

  6. OpenReview · State space models72

    用于图像去模糊的高效视觉状态空间模型

    基于摘要分析。该研究针对高分辨率图像去模糊中长程依赖建模与计算成本之间的矛盾,提出高效视觉状态空间模型 EVSSM,以视觉扫描模块获取非局部信息,并用频域前馈网络 EDFFN 表征局部信息。 核心机制:摘要指出,ViTs 的计算复杂度随图像分辨率呈二次增长,而现有部分视觉 SSM 方法采用多个固定方向扫描,也会增加计算成本。EVSSM 在各 SSM 模块之前应用不同几何变换,以捕获有用的非局部信息并维持效率;EDFFN 则估计有助于恢复潜在清晰图像的频率信息。具体几何变换、扫描路径、频域运算、损失函数及训练配置尚未验证,不能据摘要确定其复杂度或参数规模。 结果与证据边界:作者报告,EVSSM 在基准数据集和真实图像上相较先进方法表现有利。摘要未提供数据集名称、划分、对照方法、评价指标、数值或运行硬件,因此尚不能量化质量与效率的权衡;实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,SSM 的长程建模与频率信息筛选可能用于 EEG 时序去噪,但图像去模糊的二维空间结构及清晰图像恢复目标不能直接等同于 EEG。可考虑复用 SSM 与频域处理思路;扫描和几何变换需依据时间轴、通道拓扑改造,并明确干净信号或其他监督来源。低信噪比下的频率筛选可能误抑制任务相关活动,跨被试差异、通道排列变化及小数据训练也可能削弱效果。一个可检验的小实验是,在固定被试划分和受控噪声条件下,对比 SSM 基线、加入 EDFFN 的版本及改造扫描的版本,同时检查信号恢复与下游任务指标,避免仅凭重建质量判断 BCI 价值。已有相关 EEG 工作尚未检索确认。

    阅读价值:值得关注其通过几何变换组织 SSM 扫描、结合频域前馈网络处理非局部与局部信息的机制,但效率优势、去模糊收益及 EEG 迁移价值仍需核对全文或实验验证。