从 LiDAR 图像进行自监督表征学习
Self-Supervised Representation Learning from Lidar Images
基于摘要分析。本文研究自动驾驶场景中的 LiDAR 距离视图自监督表征学习,探索将 LiDAR 图像输入视觉基础模型(VFM)并进行知识蒸馏,能否把从自然 RGB 图像学到的语义知识迁移到 LiDAR 表征,而无需在 LiDAR 预训练期间使用 RGB/相机数据。 研究动机是 LiDAR 标注成本高、数据稀缺,以及传感器快速迭代带来的数据适配问题。核心机制是跨模态知识蒸馏:教师模型接受 LiDAR 图像,而非依赖配对相机图像提供监督。论文还追问跨越这一较大模态差异后,实际迁移了什么知识。摘要未说明教师与学生模型、距离视图编码、蒸馏目标、训练规模或知识迁移分析方法。 作者报告,在全面微调后的下游语义分割评估中,自监督初始化达到同架构、以 ImageNet-21k 初始化的监督基线的分割分数;在冻结表征的线性探测评估中,VFM 蒸馏的分数显著高于 MAE。摘要未给出具体指标与数值,两个评估协议也不能直接互换。作者据此认为,该路线对无标注、长距离、高分辨率 LiDAR 传感器具有潜力;这不等于已经验证所有新型传感器上的泛化能力。 平台推测(待验证):可供 EEG 研究检验的假设是,将信号构造成具有明确时间、频率或通道含义的图像后,视觉教师可能提供自监督训练信号,以缓解标注稀缺。可复用的是教师—学生蒸馏思路,需改造的是信号图像化方式与监督目标;视觉语义是否适配 EEG、低信噪比、跨被试差异、通道变化及小数据过拟合均可能导致失败。一个小规模检验可在固定跨被试划分下,对比相同学生模型的视觉教师蒸馏、MAE 与随机初始化,分别评估线性探测和全面微调。已有 EEG 相关工作尚未检索确认。 数据集、划分、实验协议、消融及统计信息尚未验证。摘要仅承诺论文被接收后公开 GitHub 代码,不能据此认定论文已接收或代码已发布。
值得核对的是:将 LiDAR 图像直接输入视觉基础模型进行蒸馏,能否在无需同步 RGB 数据的条件下获得可迁移的语义表征,以及线性探测优势为何未体现为全面微调后的分割优势。
来源:OpenReview · Representation learning · openreview.net