跳到正文
OpenReview · Representation learning·· 25 天前精选AI 评分78

Touch-JEPA:有限触觉监督下基于手—物体交互视频的触觉表征学习

Touch-JEPA: Tactile Representation Learning from Hand-Object Video with Limited Tactile Supervision

AI 导读

基于摘要分析。Touch-JEPA 针对触觉测量成本高、覆盖范围有限的问题,从手—物体交互视频学习接触状态与触觉强度表征,并利用少量触觉测量为表征提供物理约束。其贡献是将视频自监督预训练与有限触觉监督下的联合表征学习连接起来。 核心机制:自监督阶段利用从视频提取的手部几何信息,根据空间与时间上下文,预测对应手表面位置的被掩码视觉特征,以促使表征捕捉潜在接触动态。联合学习阶段对全部视频应用掩码预测,仅对有标签子集使用触觉监督,使共享表征与实测接触状态及强度关联。摘要未提供具体损失形式、几何提取方法或模型结构。 作者报告:在三个具体名称尚未提供的人手基准上,仅使用自监督预训练得到的冻结 Touch-JEPA 特征,再训练简单监督读出,即可在接触判别与触觉强度估计中优于监督基线;该表征还可在不使用机器人触觉训练数据的条件下迁移到机器人手。作者报告,加入有限触觉监督的联合学习进一步改善了人手基准上的两项任务。摘要未给出指标、提升幅度、标签比例、划分方式及基线配置,实验协议、消融及统计信息尚未验证;机器人迁移的具体适配与评估条件也需核对。 平台推测(待验证):其可供 EEG 研究借鉴的是利用结构位置对齐的时空掩码预测,并以少量任务标签约束共享表征,而非直接迁移触觉模型。假设通道位置与时间上下文能提供有效预测信息,这一机制可能用于缓解 EEG 标注稀缺;但需将手部几何映射改为电极布局或其他可验证的空间对应,并改造特征目标与监督任务。低信噪比、跨被试差异、通道不一致及小数据可能使模型主要学习噪声或被试特征。可在固定跨被试划分与标签预算下,对比位置对齐掩码、随机掩码及纯监督基线的冻结表征读出,以检验机制是否有效。相关 EEG 工作尚未检索确认。

阅读价值

值得关注其以手表面位置对齐的掩码特征预测结合少量触觉监督的机制,以及冻结表征读出和向机器人手迁移的验证思路,但具体实验协议与效果幅度尚未验证。

来源:OpenReview · Representation learning · openreview.net