跳到正文
arXiv · 多模态与生成机制· Jaeyoung Lee; Jiyeon Koo; Taehwa Kim; Yerin Cha; Andrew Jaeyong Choi·· 4 天前精选AI 评分73

MIM-VLA:从夹爪电机反馈学习物理交互表征

MIM-VLA: Learning Physical Interaction Representations from Gripper Motor Feedback

AI 导读

基于摘要分析。本文研究机器人 Vision-language-action(VLA)策略如何利用接触后的物理响应,而非主要依赖视觉观察与机器人状态推断抓取动作。MIM-VLA 将近期夹爪电流、位置、速度及信号有效性编码为 128 维交互 token,用于调节抓取策略,并支持候选交互的比较与解释。 机制上,纯电机反馈的 Motor Interaction Module(MIM)使用经人工审核的接触与交互阶段标签进行预训练,随后仅为 SmolVLA 的夹爪动作路径提供条件信息;机械臂动作及位置控制接口保持不变。同一 token 也输入 MEM selector VLM,使其比较候选交互并生成基于证据的选择与解释。该方法依赖可对齐的电机反馈序列和交互标签,具体时间窗口、训练目标、数据规模与模块连接方式尚未验证。 作者在三类真实场景中评估:比较视觉外观不同物体的交互阻力,通过主动探测区分视觉相似的真实物体与仿制品,以及轻柔抓取易碎物体,评估包含未见物体实例。作者报告,在 13 对物体的阻力比较试验中,MIM-VLA 选中较高阻力物体的比例为 75.0%,SmolVLA 基线为 48.8%。摘要未提供试验总次数、各场景的详细划分、其余任务的量化结果与统计不确定性,实验协议、消融及统计信息尚未验证。作者指出,在所评估任务中,方法利用夹爪已有反馈,无需额外触觉阵列、力矩传感器、校准后的力估计或直接电流控制。 平台推测(待验证):其与 BCI 的潜在联系限于具备机器人夹爪的闭环辅助控制,而非直接的 EEG 解码创新。可检验假设是:将该物理交互模块置于 EEG 高层意图解码器之后,可能改善接触后的抓取控制,同时不改变意图解码路径。可复用电机反馈编码模块,需改造意图到动作的接口与反馈时序;低信噪比、跨被试或通道变化引起的意图误判,以及小规模交互标签数据,都可能削弱收益。小实验可固定 EEG 解码器与夹爪,在相同物体划分下比较有无 MIM 的抓取成功率和损伤率,并单独记录意图误判。相关 EEG 工作尚未检索确认。

阅读价值

值得阅读的是其将夹爪已有电机反馈编码为交互表征、仅调节抓取动作路径的设计,以及与 SmolVLA 的实物对照;其对 EEG/BCI 的适用性尚未验证。

来源:arXiv · 多模态与生成机制 · arxiv.org