跳到正文
arXiv · 多模态与生成机制· Ruicheng Zhang; Kaiwen Shen; Jiaqi Hou; Shuhan Yang; Junchao Huang; Kewei Zhang; Jun Zhou; Li Jiang; Shen Zhao·· 1 天前精选AI 评分77

ContourVLA:用于广义指代表达分割的闭环感知—动作轮廓策略

ContourVLA: A Closed-Loop Perception-Action Contour Policy for Generalized Referring Expression Segmentation

AI 导读

基于摘要分析。ContourVLA 面向广义指代表达分割(GRES),通过将可编辑轮廓作为显式策略状态,把语言指定的可变数量目标定位与精细边界描绘转化为闭环视觉运动过程。其核心贡献是让轮廓状态持续调节多模态感知,并通过几何动作块更新轮廓,而非仅进行单次掩码预测。 机制方面,Evolution-Aware Semantic Scheduling(EASS)将轮廓引导的双向边界采样与状态条件化的多层级多模态特征路由结合,使感知随轮廓演化而调整。在监督初始化之后,Dustbin-Augmented Entropic Credit Transport GRPO(DECT-GRPO)以实例级信用分配联合优化离散目标定位与连续轮廓动作。摘要说明,轨迹奖励和信用来自软预测—目标对应关系,并考虑误检与漏检;具体奖励公式、动作参数化、迭代终止条件及训练规模尚未验证。 作者报告,在 gRefCOCO 的 val、testA、testB 划分上,相对所评估的最强基线,gIoU 分别提高 8.7、2.8、2.7 个百分点;并在 RefCOCO、RefCOCO+、RefCOCOg 的全部八个划分上获得最高 mIoU。摘要未提供绝对分数、基线名称或统计信息,不能据此判断不同协议下的优势。复现需核对监督初始化、奖励与信用计算、闭环推理预算,以及同等计算条件下的单次预测对照;实验协议、消融及统计信息尚未验证。 平台推测(待验证):可复用的主要是“显式几何状态—局部感知—迭代修正”机制,可能适用于由 EEG/BCI 指令选择目标的视觉交互模块,但不能直接视为 EEG 解码方法。原方法依赖图像、语言及目标分割监督;若引入 EEG 指令,需改造输入接口并处理低信噪比、跨被试差异与小数据下的指令不确定性。一个可检验的小实验是固定视觉分割模型,以同一组 EEG 解码指令比较单次预测与闭环轮廓修正,分别评估目标选择错误和边界质量,检验闭环是否放大错误指令。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其如何以可编辑轮廓连接动态多模态感知、几何动作与实例级奖励分配,以及闭环修正相较单次掩码预测的收益;具体训练与对照协议尚未验证。

来源:arXiv · 多模态与生成机制 · arxiv.org