跳到正文
OpenReview · State space models·· 24 天前精选AI 评分75

Marionette:用于交互式世界模型的显式世界状态

Marionette: Explicit World State for Interactive World Model

AI 导读

基于摘要分析。Marionette 研究交互式游戏世界模型在长时域自回归生成中的误差累积问题,核心贡献是将与交互相关的动力学表示为显式三维骨骼动画,并把动力学预测与视频外观生成解耦,使几何约束能够直接修正不合理状态。 传统模型在像素或视觉潜空间中反复以自身预测为条件,输入可能逐渐偏离训练分布;当动力学隐含于视觉潜变量时,漂移难以直接纠正。Marionette 使用动作条件模型预测角色姿态与运动轨迹,再由确定性图形桥接模块施加状态约束,将动画栅格化为姿态控制视频,最后交给视频扩散模型生成最终画面。显式骨骼表示使骨长、关节角度和地形接触约束可以直接表达。 作者报告,在交互动作输入和长序列滚动生成实验中,预测运动能够响应动作输入,状态约束可减少地面穿透并保持骨架结构,且无需改变视频模型。摘要未提供数据集、训练规模、动作条件编码、损失函数、滚动长度、定量指标或对照细节,实验协议、消融及统计信息尚未验证。复现时需核对三维状态的获取方式、约束实施过程、图形桥接模块与视频模型之间的接口,以及约束对动作响应和视觉质量的影响。 平台推测(待验证):其可借鉴之处是“显式状态预测—约束修正—观测生成”的模块化设计,而非已验证的 EEG/BCI 方法。迁移假设依赖任务存在可识别、可约束的状态,例如 EEG 驱动虚拟角色时的姿态与轨迹;骨骼约束及图形桥接模块可能复用,但 EEG 到动作或状态的解码模块需另行设计。低信噪比、跨被试差异、通道变化和小数据可能使解码误差无法通过几何约束纠正,甚至产生合法但不符合用户意图的动作。可在固定 EEG 解码器与同一测试划分下,对比启用和关闭状态约束时的运动合法性及意图一致性,检验约束是否改善前者而不损害后者;已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其将可约束的显式动力学状态与视频外观生成解耦的机制;作者报告该设计可改善长序列中的地面穿透与骨架保持,但定量效果及其对 EEG/BCI 的适用性尚未验证。

来源:OpenReview · State space models · openreview.net