跳到正文
arXiv · 多模态与生成机制· Hanqiu Li Cai; Chema Garabito·· 3 天前精选AI 评分77

Iris-3B:超越潜在空间的像素空间扩散训练、转换与微调

Iris-3B: Going Beyond the Latent with Pixel-Space Diffusion Training, Conversion and Fine-Tuning

AI 导读

基于摘要分析。本文研究像素空间扩散模型绕过有损 VAE 后,是否能改善依赖细粒度信息的下游视觉任务,并通过从头预训练 Iris-3B 与转换已有潜在空间模型两条路线进行检验。作者报告,在所采用的单目深度估计及图像恢复/超分辨率微调协议下,像素空间生成先验未带来显著改善。 方法上,Iris-3B 是一个 3B 参数的像素空间文生图 transformer,采用 PixelDiT 的 pixel-transformer(PiT)头。作者先在 256² 分辨率下对预测目标与表征对齐进行消融,再采用 256→512→1024 的分辨率课程从头预训练;另一条路线将预训练的 FLUX.2 Klein base 4B 从潜在空间转换到像素空间。摘要未说明预测目标、对齐机制及转换过程的具体实现。 作者报告,在采用同一套匹配的直接回归微调方案进行单目深度估计时,Iris-3B 与潜在空间 FLUX.2 Klein 表现相当,转换后的像素空间 FLUX.2 Klein 则落后。在 DIV2K 的 4× 图像恢复任务中,两种像素空间模型均未超过潜在空间 FLUX.2 Klein 的微调版本,转换模型略逊。摘要未提供指标数值、数据划分或统计检验细节,因此不能将“未显著改善”扩大为所有像素空间方法均无优势。 生成能力方面,作者报告,采用 PiT 头的像素空间预训练可扩展至 3B 参数;在 1024² 分辨率、OneIG 官方评估器下,Iris-3B 的文生图表现与 Qwen-Image 相当。该结果与下游任务的负面结果属于不同评估,不能相互替代。作者表示发布模型权重与训练代码,但其可获取性及复现条件尚未核验。 全文中的训练数据、实验协议、消融结果、统计信息及作者讨论的失败模式与残余混杂因素尚未验证。本文主要研究图像生成与视觉任务,不提供 EEG/BCI 有效性的直接证据,也不足以据此提出具体迁移方案。

阅读价值

值得阅读的是其对“绕过有损 VAE 能否改善细粒度下游任务”进行了从头预训练与潜在空间模型转换两条路线的对照,并报告负面结果;具体实验控制与残余混杂因素仍需全文核对。

来源:arXiv · 多模态与生成机制 · arxiv.org