跳到正文
arXiv · 多模态与生成机制· Xingtai Gui; Yucheng Zhou; Dongqian Guo; Jiahao Gong; Feiyang Tan; Jianbing Shen·· 3 天前精选AI 评分73

面向自动驾驶视觉-语言-动作模型的显式几何思维链

Explicit Geometric Chain-of-Thought for Vision-Language-Action in Autonomous Driving

AI 导读

基于摘要分析。研究针对自动驾驶视觉-语言-动作(VLA)模型中精确 3D 行动需求与主要在 2D 语义空间进行理解、推理之间的不匹配,提出 GeoCoTDrive,以规划导向的区域定位和局部几何先验支持轨迹生成。 核心流程遵循“先进行 2D 思考,再借助专门的 3D 先验驾驶”:首先定位与决策关键线索对应的 2D 区域,再在这些区域内从几何基础模型采样特征,获取局部 3D 先验;随后将这些局部几何特征交错插入自回归上下文,为轨迹生成提供依据。这里的显式几何思维链是区域定位、几何特征获取与轨迹生成之间的连接过程,不宜仅理解为生成文字推理说明。 为监督这一过程,作者引入 planning-relevant grounding 区域级定位任务,聚焦直接影响自车规划决策的局部空间线索,并构建 PlanningGrounding 数据集。摘要未提供数据规模、标注流程、划分方式、几何基础模型名称及具体训练目标,上述复现条件尚未验证。 作者报告,在多个端到端自动驾驶基准上,GeoCoTDrive 一致改善了安全关键规划表现;摘要未列出基准名称、指标、数值或对照基线,因此无法判断改善幅度及适用边界。实验协议、消融及统计信息尚未验证,尤其需要核对区域定位、3D 特征和上下文注入各自的贡献,以及额外几何模型带来的计算成本。 该工作的主要研究对象是自动驾驶规划,并非 EEG 或 BCI。其局部 3D 场景先验不能直接等同于电极空间信息或神经源定位结果;当前材料不足以建立具体的 EEG 迁移机制,不据此主张 BCI 有效性。相关 EEG 工作尚未检索确认。

阅读价值

值得关注其将决策相关的 2D 区域定位与局部 3D 几何先验显式连接的规划机制,但性能提升幅度、对照设置及几何先验的独立贡献尚未验证。

来源:arXiv · 多模态与生成机制 · arxiv.org