FLEX-WAM:用于长时域想象与规划的灵活块因果世界—动作模型
FLEX-WAM: Flexible Block-Causal World-Action Models for Long-Horizon Imagination and Planning
基于摘要分析。FLEX-WAM 研究如何用统一世界—动作模型(WAM)预测动作条件下的未来、生成可行动作并支持想象中的规划,重点解决固定时域视频—动作模型在流式推理、计算效率和长时域开环生成中的限制。 机制上,模型采用可使用 KV-cache 的块因果架构,结合 axial attention 与 blockwise diffusion forcing,支持可变长度上下文、非因果预测时域,以及逐帧或逐块持续自回归生成。作者提出可在部署时、不重新训练的情况下调整延迟与吞吐量的权衡;摘要未给出具体缓存组织、块大小或推理配置。 针对联合训练可能生成视觉上合理、却对指令动作响应较弱的未来这一问题,作者在状态—动作扩散噪声网格上平衡状态与动作的 flow-matching 梯度贡献,并用 Forward-Dynamics(FD)elasticity 调节世界模型采样。摘要将 FD elasticity 描述为训练期间评估动作响应性的高效代理,但其定义、计算方式及与真实动作响应性的对应关系尚未验证。 作者报告,在模拟与真实世界数据集上,多步预测质量及延迟优于对照,并可稳定生成数千步联合状态—动作序列;数据集清单、划分、对照基线、指标和硬件条件未在摘要中提供。作者还报告,将模型作为 MCTS 内的动作提议器与模拟器,可完全在想象中求解长时域 PushT 和全部五个 OGBench Puzzle-4x4 任务。在基于 OpenArm 的双臂机器人上,同一检查点兼任 play policy 与预期结果预测器,用于实时识别和收集模型与现实的不一致;这不等于已验证后续自我改进效果。 平台推测(待验证):块因果缓存可能有助于流式 EEG 推理,但原方法依赖联合状态—动作序列,不能直接视为 EEG/BCI 方法。若用于动作条件神经信号预测,需要改造信号表示与动作条件接口,并检验低信噪比、跨被试差异和小数据下的稳定性。一个可证伪的小实验是在固定数据划分和硬件条件下,对比逐帧与逐块缓存推理的预测误差、延迟及长序列漂移。已有 EEG 相关工作尚未检索确认;全文实验协议、消融及统计信息尚未验证。
值得核对其块因果缓存机制与动作响应性约束能否同时改善长时序生成效率和规划可靠性;摘要提供了具体机制,但性能优势与复现条件尚未验证。
来源:arXiv · 在线与高效推理 · arxiv.org