GeoBridge-VLA:面向视觉-语言-动作模型的几何感知残差适配
GeoBridge-VLA: Geometry-Aware Residual Adaptation for Vision-Language-Action Models
基于摘要分析。GeoBridge-VLA 针对视觉-语言-动作(VLA)模型具备语义表征、但机器人操作仍需精确空间推理的问题,提出从预训练模型的冻结视觉编码器中学习几何特征,并将其用于动作预测的两阶段方法。其核心贡献是在不增加第二个图像编码器或视觉 token 数量的情况下,通过残差接口补充几何信息,部署时无需深度观测。 机制上,Stage I 使用深度监督训练 feature bridge 与 geometry decoder;Stage II 冻结上述模块,联合训练 gated residual interface、动作侧投影及 action expert。残差用于增强已有视觉 token。推理输入为 RGB、机器人状态和语言;具体损失、门控形式及深度监督数据来源尚未验证。 作者报告,在匹配评估条件下,GeoBridge-VLA 在 LIBERO 上的成功率为 70.9%,SmolVLA 为 60.0%。但在同一已训练检查点中关闭残差,成功率仅从 70.90% 降至 69.85%,且不同任务套件的变化方向不一致。这一干预结果不能直接等同于从头训练的模块消融,也不足以把相对 SmolVLA 的整体提升全部归因于推理时残差;需核对动作侧训练、基线适配条件及各套件结果。 作者报告,在实体 ROBOTIS OMY 机器人四项任务的 200 次试验中,GeoBridge-VLA 成功 148 次(74.0%),SmolVLA 成功 108 次(54.0%)。任务分配、训练与测试划分、随机种子、消融及统计信息尚未验证,尚不能据摘要判断跨任务泛化或结果稳定性。 平台推测(待验证):可供 EEG 方法设计参考的是“辅助监督学习表征,再以冻结模块和残差接口适配任务”的分阶段思路,而非直接复用几何解码器。假设有与 EEG 对齐且可靠的辅助监督,可测试该策略能否补充预训练表征;需改造输入编码及监督目标,低信噪比、通道差异与小样本可能使辅助表征失效。一个可证伪的小实验是在固定跨被试划分及相同训练预算下,对比仅任务适配、两阶段残差适配及同一检查点关闭残差的表现。已有 EEG 相关工作尚未检索确认。
值得核对其以深度监督提取几何特征、部署时仅用 RGB 的两阶段适配机制,尤其是整体成功率提升与同一检查点关闭残差后较小变化之间的贡献归因。
来源:arXiv · 多模态与生成机制 · arxiv.org