通过预测不确定性触发双系统 VLA 的通用模型推理
Triggering Generalist Reasoning via Predictive Uncertainty for Dual-System VLA
基于摘要分析。该研究针对双系统 Vision-Language-Action(VLA)中慢速通用推理模型与快速专用动作模型的协作问题,提出 TUD(Triggering generalist reasoning via predictive Uncertainty for Dual-system VLA),用预测不确定性自适应触发通用模型,避免固定调用频率在简单阶段浪费计算、在场景突变时延迟重新推理。 核心机制是在缓存的通用模型上下文下,比较不同时间步对同一个即将执行的动作块位置所作的重新预测,以跨步离散程度作为不确定性信号。该信号反映新观测到来后未来动作计划的变化程度。作者称其复用架构原本就执行的前向计算,不需要人工阶段标签或额外的不确定性模型;通过调整单一阈值,可形成不同成本与成功率的运行配置。具体离散度定义、缓存更新及触发规则尚未验证。 作者报告,在 VLA-Arena 上,TUD 在匹配通用模型调用预算时比其他不确定性基线获得更高成功率,同时保持较低的实际运行时间开销,并能更一致地区分成功与失败的执行轨迹。作者还报告,相比非自适应基线,其成本—成功率权衡更有利,在匹配成功率时可减少 VLM 调用。真实机器人实验中,相对于最强固定间隔基线,作者报告通用模型调用次数减少 75%,且成功率更高。摘要未提供任务组成、试验次数、具体成功率及硬件条件;实验协议、消融及统计信息尚未验证。调用次数下降不应直接等同于总延迟或能耗按同比例下降。 平台推测(待验证):可检验的迁移假设是,将“新观测使未来预测发生变化”作为 EEG/BCI 中昂贵模型重新推理的触发条件。可复用的是跨步预测比较与阈值调度,需改造的是动作块对齐为统一预测目标,并适配 EEG 时间窗口及缓存更新。原机制依赖连续观测和可重复预测的同一未来位置;低信噪比、被试差异、通道变化与小数据可能使预测波动反映噪声而非任务难度。一个小规模检验是在固定 EEG 解码器上比较固定间隔与预测变化触发策略,在相同昂贵模型调用预算下评估解码指标、延迟和误触发率。已有 EEG 相关工作尚未检索确认。
值得核对其利用既有动作预测构造推理触发信号的机制,以及相同调用预算或成功率下的成本比较;该机制是否适用于 EEG/BCI 尚未验证。
来源:arXiv · 多模态与生成机制 · arxiv.org