跳到正文
arXiv · 表征与预训练· I-Chun Arthur Liu; Jason Chen; Gaurav S. Sukhatme; Daniel Seita·· 6 天前精选AI 评分76

ExStereo:通过显式立体表示将二维视觉-语言-动作模型扩展至三维

ExStereo: Lifting 2D Vision-Language-Action Models to 3D with Explicit Stereo Representations

AI 导读

基于摘要分析。ExStereo 针对机器人精细操作中单目 RGB 难以恢复度量深度与精确三维位置的问题,为预训练二维 Vision-Language-Action(VLA)模型增加立体感知模块,使动作生成能够利用三维场景信息。 核心机制是利用立体匹配基础模型,从立体图像对重建场景几何,再渲染多视角观测,构成用于立体特征提取的显式立体表示。动作专家产生的 action tokens 通过作者提出的 action-stereo cross-attention,选择性关注 stereo tokens。训练上,作者在任务特定后训练之前加入中间训练阶段,以大规模立体数据上的自监督目标学习稳健三维表示;具体目标形式、数据规模及模块训练范围尚未验证。 作者对两个公开 VLA——π₀.₅ 和 SmolVLA——进行微调,并在仿真及真实双臂 PiPER 平台上评估。作者报告,接入 ExStereo 的 VLA 在两类环境中均持续优于基线。摘要未提供具体任务、基线配置、指标、提升幅度或数据划分,实验协议、消融及统计信息尚未验证,因此目前不能判断增益分别来自显式几何、交叉注意力还是额外自监督训练。复现需核对立体相机标定、几何重建与渲染流程、中间训练数据及任务后训练设置;摘要提供了项目网站,但代码和权重开放状态尚未验证。 平台推测(待验证):其可供跨领域研究借鉴的是向预训练模型接入结构化辅助信息的 token 融合思路,而非直接将立体视觉机制迁移至 EEG。原方法依赖成对图像及可恢复的三维几何,EEG 不具备同等观测结构;是否存在合理的辅助表示与监督路径仍需评估。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其将显式立体几何通过 action-stereo cross-attention 接入预训练 VLA 的机制,但摘要不足以验证性能增益来源,且其对 EEG/BCI 的适用性尚未验证。

来源:arXiv · 表征与预训练 · arxiv.org