跳到正文
OpenReview · Representation learning· Theodore Zhengde Zhao; Sid Kiblawi; Jianwei Yang; Naoto Usuyama; Reuben Tan; Noel C Codella; Tristan Naumann; Hoifung Poon; Mu Wei·· 2026-04-24精选AI 评分78

通过空间—语义分解学习稀疏视觉表示

Learning Sparse Visual Representations via Spatial-Semantic Factorization

AI 导读

基于摘要分析。本文研究视觉自监督学习中语义不变性与空间细节保留之间的张力,提出 STELLAR,将图像表示分解为稀疏语义 token 与空间分配图,使语义对齐和图像重建能够在同一潜在空间中实现。原论文的主要研究对象是图像表示,而非 EEG 或 BCI。 核心机制是让语义 token 保持跨视图不变性,由定位矩阵承担空间等变性。训练结合低秩重建、在线概念聚类和跨视图最优传输对齐。相较于直接使用稠密网格表示,这一设计试图将“表示什么”与“位于何处”分开;具体损失形式、视图构造、聚类更新方式及各组件贡献尚未验证。 作者报告,使用仅 16 个 token 时,STELLAR 同时获得较好的重建与语义质量,包括 2.60 FID 和 79.10% ImageNet 线性评估 Accuracy。摘要未说明 FID 对应的数据集与评估设置,也未给出 ImageNet 的训练规模、数据划分、线性评估协议及对照基线,因此不能据此判断相对优势或与其他协议下的结果直接比较。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 中的任务相关表示与通道布局、时间位置等变化能够部分分离,该因子化思路可能用于探索跨被试或跨会话表征。可借鉴稀疏 token、分配图和跨视图对齐机制,但需要重新定义时空分配、有效增强及重建目标,不能直接将图像空间等变性视为 EEG 的成立条件。低信噪比、被试差异、通道缺失及小数据可能使聚类捕获伪迹,或使对齐抹去任务信息。一个可检验的小实验是在固定数据划分和训练预算下,对比稠密表示与因子化表示,分别评估跨被试分类和信号重建,并消融分配图与对齐模块。已有相关 EEG 工作尚未检索确认。

阅读价值

值得核对 STELLAR 将语义不变性与空间等变性分配给不同表示组件的机制,以及稀疏表示兼顾重建与语义判别的实验依据;其对 EEG 表征学习的适用性尚未验证。

来源:OpenReview · Representation learning · openreview.net