通过架构等变性实现可辨识表征学习
Identifiable Representation Learning via Architecture Equivariances
基于摘要分析。本文研究图像与视频中可解释、可辨识的表征学习,利用数据中自然存在的等变性,使潜变量对应变换下的对象位置,并支持通过潜空间干预生成反事实场景。其主要贡献是无对象标注的对象检测、潜变量可辨识性理论,以及不同几何变换场景下的实验验证。 机制与理论:方法围绕平移、旋转和尺度等变性构建表征,即输入发生相应变换时,潜表征也按对应规律变化。作者报告证明,学习到的潜变量在允许置换及小幅位移的意义下可辨识,位移范围与模型感受野大小有关;这不等同于潜变量具有唯一且绝对精确的坐标。摘要未提供具体架构、损失函数、训练流程及理论假设,相关细节尚未验证。 实验与结论:作者在迷你台球中运动的球、环岛上行驶的汽车,以及传送带上向相机靠近的对象视频中,分别考察平移、旋转和尺度等变性。作者报告这些场景均能无监督学习变换等变表征,并通过潜空间干预实现训练分布外泛化、生成训练时未见的逼真反事实视频。摘要未给出定量指标、数据规模、划分或对照基线;实验协议、消融及统计信息尚未验证。所述工业应用面向静态相机下的检测与监控,并非 EEG 或 BCI 验证。 平台推测(待验证):迁移假设是,若 EEG 数据中存在具有明确物理意义且保留任务语义的变换,可借鉴等变约束减少表征歧义;但图像对象位置与 EEG 潜在神经源并不直接对应。可复用的是变换与潜表征对应的设计原则,需改造输入变换、潜变量含义及观测模型。低信噪比、通道不规则、跨被试差异和小数据可能破坏等变假设。一个可证伪的小实验是在已知源位置及头模型的模拟 EEG 中施加受控源变换,比较加入等变约束与不加入约束时的源位置恢复误差及表征一致性,再检验噪声和通道扰动下是否失效;这不构成真实 BCI 有效性的证据。已有 EEG 相关工作尚未检索确认。
来源:OpenReview · Representation learning · openreview.net