跳到正文
OpenReview · State space models·· 2026-08-20精选AI 评分75

Any Time, Any Space:以世界状态为中心的智能体视频生成框架

Any Time, Any Space: A World-State-Centric Framework for Agentic Video Generation

AI 导读

基于摘要分析。本文研究长篇智能体视频生成中,如何将剧本转化为在非连续请求之间仍保持空间与时间一致性的镜头,提出 Any Time, Any Space(ATAS)框架。核心贡献是为镜头请求建立显式的位置、相机与事件时间引用,通过共享场景记忆和事件记忆支持场景重访与先前事件的再现,而非仅在镜头间传递提示词或近期帧。 机制上,ATAS 先将剧本编译为带有上述引用的镜头请求,再从两类记忆检索相关证据:场景记忆保存已配准的静态几何,事件记忆保存按场景、事件和时间索引的动态观测。生成后,框架对片段进行重建与配准;只有观测通过审查和状态检查才更新记忆,视频交付则不依赖该观测是否获准写入。这一区分将生成输出与共享状态维护分离,但具体重建方法、检查规则和错误处理机制尚未验证。 作者报告,在四个视频生成器上,ATAS 改善了全部已报告的跨镜头一致性指标,并在每个骨干生成器上取得最高的基准综合得分;相较所比较的智能体与 3D 引导方法,它在目标图像空间重访任务上表现更好,在三个事件再捕获标准上领先,并在全部六个人类评价标准上获得最高评分。摘要未提供具体数值、基准名称、对照配置或人类评价协议,因而无法判断收益幅度与统计可靠性,实验协议、消融及统计信息尚未验证。 本文的主要研究对象是视频生成智能体的世界状态管理,并非 EEG 解码或 BCI 方法;摘要也未展示状态空间模型的具体数学机制。现有材料不足以建立其静态几何、事件记忆与神经信号建模之间的明确对应关系,因此不据此推断 BCI 有效性或提出迁移实验。复现仍需核对记忆表示、检索流程、片段配准、记忆准入规则及各生成器的接口配置;摘要提供了视频展示地址,但代码、数据与完整评估配置的可用性尚未验证。

阅读价值

值得阅读的是 ATAS 将静态场景几何与按事件时间索引的动态观测分开管理,并以审查和状态检查控制记忆写入;其一致性收益仍需结合全文中的评估协议与消融核对。

来源:OpenReview · State space models · openreview.net