超越 LLM 推理服务:面向具身 AI 系统设计的视觉—语言—动作工作负载特征分析
Beyond LLM Serving: Characterizing Vision-Language-Action Workloads for Embodied AI System Design
基于摘要分析。本文研究视觉—语言—动作(VLA)模型在机器人实时控制中的运行特征,重点是单机器人 batch-1 推理如何在设备端或邻近边缘平台满足每个控制周期的推理期限。其贡献是将单次推理性能剖析与闭环任务评估结合,为模型架构、硬件和运行时策略的联合设计提供依据,而非提出新的 VLA 模型。 VLA 将多模态观测转化为低层机器人动作;推理超时会使机器人继续依据过时观测执行动作,影响任务成功。虽然此类模型包含视觉—语言、自回归及扩散式组件,但其 batch-1 实时控制负载与常规 LLM 推理服务的设计目标不同。作者对四个代表性 VLA 模型在一台边缘 GPU 服务器和两个机载 SoC 上进行单次推理剖析,并开展 43,200 个闭环回合评估;摘要未提供模型名称、任务构成及各平台的回合分配。 作者报告,动作张量的维度会影响某一计算阶段受内存还是计算能力限制,平台的计算与内存能力配比也可能改变瓶颈;GPU 频率调整存在平台相关的能耗—延迟较优工作点。在闭环运行中,让推理与动作执行重叠会形成准确性、速度和能耗之间的权衡,且在所考察的部署服务水平目标(SLO)下,没有一种配置在所有目标上均占据 Pareto 优势。摘要未给出准确性的具体定义、任务成功率或延迟与能耗数值,不能将其直接解读为统一的最优部署方案。 复现需核对具体模型与硬件、数值精度、控制周期、推理与动作重叠策略、功耗测量方法,以及闭环任务和 SLO 的定义;实验协议、消融及统计信息尚未验证。本文直接证据属于机器人 VLA 系统,不构成 EEG/BCI 实时解码效果的验证;相关 EEG 工作尚未检索确认。
值得阅读之处在于通过单次推理剖析与闭环运行评估,揭示 VLA 在 batch-1 控制期限下的硬件瓶颈和能耗—延迟权衡;具体模型与实验协议仍需全文核对。
来源:arXiv · 多模态与生成机制 · arxiv.org