使用 U-JiT 进行像素空间视频生成
Pixel-space video generation with U-JiT
基于摘要分析。本文研究直接在像素空间生成视频的可行性,针对基础 Transformer 图像生成设计扩展到高维视频时的局限,提出类 UNet 的 Transformer 架构 U-JiT,并改进训练方案与采样策略。研究对象是视频生成,而非 EEG 解码或 BCI。 作者指出,潜空间扩散与 flow matching 视频模型通常依赖预训练自编码器,形成自编码器预训练与潜空间生成模型训练两个阶段,并引入压缩导致的信号损失。U-JiT 探索绕过这一依赖的像素空间路线;摘要未提供具体网络结构、损失函数、训练方案或采样改动,因此尚不能判断各项设计的独立贡献,也不能断言已消除所有压缩损失。 作者在 Kinetics-600 上开展受控实验,从头训练潜空间和像素空间模型。对于 128 分辨率的标准 frames-to-video 任务,作者报告 U-JiT 的生成 FVD 相比此前最先进结果降低 27%,相比 JiT 像素空间基线降低 14%。在 256 分辨率下,作者报告随着时空压缩率提高、最高达到 64×64×8,U-JiT 相对像素空间与潜空间模型的优势增大;该压缩率对应的具体模块及实现尚未验证。 对于 class-to-video 任务,作者报告逐帧 FID 相比潜空间模型降低 27%、相比像素空间模型降低 61%,FVD 分别降低 9% 和 56%;摘要未明确该任务的分辨率。逐帧 FID 与视频 FVD 衡量的方面不同,不能将二者的降幅互换或跨任务直接比较。 复现时需核对数据划分、条件帧设置、生成视频长度、指标计算、基线训练预算及采样配置。实验协议、消融及统计信息尚未验证,模型规模、计算成本与代码可用性也无法由摘要确认。材料不提供 EEG/BCI 迁移验证,不能据此推导神经信号任务上的有效性。
值得阅读的是其在 Kinetics-600 上从头训练潜空间与像素空间模型的受控比较,可用于核对绕过预训练自编码器的直接视频生成方案及压缩率对生成质量的影响,但具体架构、训练成本与实验公平性尚需全文验证。
来源:OpenReview · State space models · openreview.net