跳到正文
arXiv · 多模态与生成机制· Mousumi Das; Aditeya Prajapati; Abrar Anwar; Jesse Thomason·· 7 天前精选AI 评分75

SWAP:面向 Vision-Language-Action 模型的逐步动作策略路由

SWAP: Stepwise Action Policy Routing for Vision-Language-Action Models

AI 导读

基于摘要分析。该研究针对单一 Vision-Language-Action(VLA)模型难以适应不同任务状态与环境的问题,提出 StepWise Action Policy Routing(SWAP),在执行过程中动态组合多个 VLA 策略,而非整段任务始终使用同一策略。 核心机制是将策略路由建模为离线强化学习问题,学习一个 routing critic,根据当前观测在每个决策步选择适合执行的策略。其贡献重点在于将策略选择从整段 episode 的固定承诺改为在线逐步切换;摘要未说明 critic 的结构、训练目标、离线数据构成、候选 VLA 配置及切换开销,相关细节尚未验证。 作者在真实世界 DROID 操作任务和 LIBERO 仿真实验中评估 SWAP,报告其优于固定策略执行与路由基线。对于真实世界任务,作者报告任务成功率的绝对提升最高为 33%(原文如此表述;具体基线、分母及是否按百分点统计尚待全文核对),成功轨迹中的机器人动作步数减少 28.3%。这些结果属于机器人操作评估,不能视为 EEG 或 BCI 性能证据;任务划分、样本规模、消融及统计信息尚未验证。 平台推测(待验证):假设不同 EEG 解码器在不同信号状态下具有互补性,可探索以观测驱动的路由器选择解码器。可复用的是逐步策略选择思想,但需改造观测表示、奖励定义与切换约束;其依赖能支持离线学习的状态、动作及结果记录。EEG 低信噪比、跨被试差异和小数据可能使路由判断不稳定,解码器频繁切换也可能损害输出连续性。一个可证伪的小实验是在严格隔离训练与测试数据的单一 EEG 任务中,比较路由组合、最佳固定解码器与简单路由基线,并核对收益是否伴随切换频率或延迟增加。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的具体原因是将多 VLA 的选择转化为逐决策步的离线强化学习路由,并以真实机器人任务与仿真实验检验相对固定策略和路由基线的收益;其对 BCI 的适用性尚未验证。

来源:arXiv · 多模态与生成机制 · arxiv.org