跳到正文
arXiv · 泛化与分布偏移· Jaemin Kim; Jiahn Kim; Taesik Gong·· 4 天前精选AI 评分73

VLA-ZO:视觉-语言-动作模型的快速零阶适应

VLA-ZO: Fast Zeroth-Order Adaptation for Vision-Language-Action Models

AI 导读

基于摘要分析。VLA-ZO 针对视觉-语言-动作(VLA)模型部署时的分布偏移,提出仅适应动作侧、复用冻结视觉-语言前缀计算状态的零阶(ZO)优化框架,旨在降低适应耗时,并保持接近推理级别的内存需求。 核心机制是避免在每次参数扰动查询中重复运行昂贵的视觉-语言前缀:将其冻结后,跨扰动查询及优化器步骤复用条件状态,并通过感知调度的预取隐藏状态传输开销。其针对的瓶颈不同于常规一阶适应的梯度存储成本,而是零阶梯度估计所需大量前向查询带来的计算成本。摘要未提供具体损失、参数扰动方式、动作侧可更新模块或缓存生命周期,相关实现尚未验证。 作者报告,在 LIBERO 摄像机视角偏移评估中,相对基线 ZO,q=16 时端到端适应耗时缩短至对应 25.59 倍加速,q=64 时为 32.54 倍加速;平均任务成功率从不适应时的 48.27%,分别提高到 58.17% 和 63.58%。耗时比较对象是基线 ZO,成功率比较对象是不适应模型,两者不能混为同一对照。具体模型、任务划分、适应监督、硬件、内存实测、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 解码模型也具有昂贵的冻结特征前缀和较轻的可更新输出模块,这种复用思路可能降低资源受限部署中的零阶适应开销;这是计算结构层面的迁移假设,并非已验证的 BCI 效果。可复用部分是条件状态缓存与查询调度,需改造的是 EEG 输出模块、适应目标和流式缓存管理。低信噪比、小样本可能使零阶估计不稳定;跨被试或通道变化若主要影响前缀表征,仅更新输出侧可能不足。可在固定 Cross-session 划分、相同查询预算与适应目标下,对比普通 ZO 和缓存复用 ZO 的耗时、峰值内存及解码指标,检验计算收益是否保留且性能不受损。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其冻结计算前缀与缓存复用机制:作者报告在 LIBERO 摄像机视角偏移下显著缩短零阶适应耗时,但收益对模型计算结构与缓存有效性的依赖仍需全文验证。

来源:arXiv · 泛化与分布偏移 · arxiv.org