状态先于像素:表征空间中的大规模文本到视频生成
State Before Pixels: Large-scale Text-to-Video Generation in Representation Space
基于摘要分析。本文研究大规模、开放域文本到视频生成,提出 WorldFlow,以视频基础模型学习到的原生表征作为生成目标,将世界状态建模与视觉渲染分离。核心贡献是尝试直接生成包含场景语义与动态的高维视频表征,再将其转换为可观看的视频,而非仅在像素或重建潜空间中建模。 方法采用两阶段流程:第一阶段由文本条件流模型在原生 V-JEPA 空间中生成潜在世界状态;第二阶段由另一流模型将这些状态渲染到 VAE 空间。该设计旨在保留预训练视频表征的语义结构,同时利用适合重建的空间合成精细视觉细节。针对高维表征空间中的 diffusion-transformer 去噪,作者研究了表征几何与预测参数化,并报告在原生表征流形上使用 Riemannian Flow Matching 与 v-prediction,可以在不引入额外压缩的情况下建模这些表征。摘要未提供具体流形定义、损失公式及训练配置。 作者报告 WorldFlow 实现了高质量文本到视频生成,同一组生成世界状态还可渲染为对齐的深度、分割和人体姿态等多模态输出。摘要未提供数据集、数据划分、规模、指标数值或对照基线,因此尚不能量化其优势,也不能独立确认多模态对齐的评估强度。实验协议、消融及统计信息尚未验证;代码、权重与复现资源的可用性也尚未验证。 平台推测(待验证):可关注的跨领域机制是依据预训练表征的几何结构进行生成,并把状态建模与输出解码分离;这不等于已验证的 EEG/BCI 方法。迁移假设依赖 EEG 表征是否具有稳定、可建模的流形结构,以及是否存在合适的条件监督和解码目标。流匹配与预测参数化可作为候选研究模块,但 V-JEPA、文本条件和视频渲染流程不能直接视为 EEG 可用组件;低信噪比、跨被试与通道差异、小数据规模均可能破坏这一假设。已有 EEG 相关工作尚未检索确认,当前材料不足以提出具体复现实验配置。
值得阅读的是 WorldFlow 将预训练视频表征中的世界状态生成与视觉渲染解耦,并研究高维表征流形上的流匹配;其对 EEG/BCI 表征建模的价值尚未验证。
来源:OpenReview · State space models · openreview.net