跳到正文
OpenReview · Representation learning· Jianan Wei; Guikun Chen; Zhiyuan Weng; Yujia Wang; Wenguan Wang·· 2025-09-03精选AI 评分74

用于视觉表征学习的双曲层次聚类

Hyperbolic Hierarchical Clustering for Visual Representation Learning

AI 导读

基于摘要分析。该研究面向视觉骨干网络中图像 patch 之间的信息交换,提出以双曲层次聚类实现 token mixing 的 ClusterMixer,并将其整合为视觉骨干架构 HCFormer,旨在兼顾表征能力与编码过程的可解释性。 核心机制是将 token mixing 显式表述为层次聚类,而非仅依赖卷积、注意力、MLP 或其混合。作者认为视觉数据具有自然的树状关系,因此选择适于低失真嵌入层次结构的双曲空间。HCFormer 进一步结合一系列聚类策略,但摘要未说明具体聚类规则、双曲空间参数化、训练目标、可微实现或推理流程;“可解释性”目前是作者的设计主张,其验证方式尚未核实。 作者报告,HCFormer 在 image classification、object detection、instance segmentation 和 semantic segmentation 等任务上持续优于对照方法。摘要未提供数据集、数据划分、基线配置、指标数值或计算开销,因此尚不能判断增益幅度及公平比较条件。实验协议、消融及统计信息尚未验证。作者表示将发布源代码,不能据此认定代码已公开。 平台推测(待验证):若 EEG 的时空 token 确实存在稳定且与任务相关的层次关系,显式聚类可能为信息聚合提供可检查的分组结构;这是假设,不是论文已证实的 EEG 或 BCI 结果。潜在可复用部分是层次聚类式 token mixer,需改造的是 EEG 的通道与时间片编码,以及层次结构的构建方式。原方法依赖图像 patch 和视觉层次假设,其监督方式与所需数据规模尚未明确;EEG 的低信噪比、被试差异、通道布局变化及小数据条件可能使聚类优先捕捉伪迹或个体特征。可检验的小实验是在固定 EEG 数据划分和相同训练预算下,仅替换 token mixer,对照注意力聚合,分别检查被试内与跨被试表现及聚类稳定性。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的是将 token mixing 显式表述为双曲空间中的层次聚类这一机制,但其可解释性证据、性能与计算成本权衡及 EEG 迁移价值尚待验证。

来源:OpenReview · Representation learning · openreview.net