跳到正文
arXiv · 多模态与生成机制· Kiyohiro Nakayama; Brian Chao; Jan Ackermann; Hansheng Chen; Federico Tombari; Leonidas Guibas; Lior Yariv; Gordon Wetzstein·· 5 天前精选AI 评分75

Level-of-Token Diffusion:基于 token 细节层级的扩散生成

Level-of-Token Diffusion

AI 导读

基于摘要分析。该研究针对图像和视频扩散模型通常向各区域分配相同计算量、难以利用场景细节需求差异的问题,提出 Level-of-Token(LoT)Diffusion:将生成前可预期的细节分布转化为显式多分辨率 token 布局,在需要细节的位置使用更细的 token,其他位置使用更粗的 token,以支持自适应、高效生成。 核心机制是让 token 表示大小与形状不同的矩形图像块,并通过 patch-wise asymmetric flow parametrization(逐块非对称流参数化)及多分辨率 token 嵌入,将预训练扩散 Transformer 适配到 LoT 布局。摘要指出,该方法在每个去噪步骤仍保持全分辨率流预测,但 Transformer 仅处理缩短后的 token 序列;其关键区别是调整空间计算分配,而非简单统一降低生成分辨率。作者称该适配能够保留预训练生成先验,具体参数化、训练目标及适配成本尚未验证。 作者展示了由语义掩码、边界框、纹理方差、景深线索及 agentic plans 构建布局的生成方式。在摘要所述图像和视频生成评估中,作者报告了有利的质量—效率权衡,并称加速程度由布局的 token 预算决定;摘要未提供具体数据集、基线、质量指标、延迟数值或硬件条件,因此不能量化收益或判断跨设置的一致性。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 条件化的图像或视频生成任务能够提供可靠的空间细节先验,LoT 布局与多分辨率嵌入可能作为生成端的计算分配模块复用,但需改造 EEG 条件接口和布局预测方式。该假设不等于 EEG 解码性能提升;低信噪比、小数据及跨被试变化可能使布局预测失准,导致关键区域细节被压缩。可在固定 EEG 条件生成模型与数据划分下,对比均匀布局、外部已知布局和 EEG 预测布局,联合测量生成质量、条件一致性及实际延迟,检验节省计算是否以损害解码内容为代价。相关 EEG 工作尚未检索确认。

阅读价值

值得阅读其如何通过多分辨率 token 布局与 patch-wise asymmetric flow parametrization,在缩短扩散 Transformer 输入序列的同时保持全分辨率流预测;具体加速幅度及质量代价尚待全文核对。

来源:arXiv · 多模态与生成机制 · arxiv.org