跳到正文
arXiv · 多模态与生成机制· Arshia Hemmat; Amirhossein Vahidi; Amitis Shidani; Mohammad Vali Sanian; Hesam Asadollahzadeh; Aryan Yazdan Parast; Mohammad Lotfollahi·· 3 天前精选AI 评分80

ORCA:探查文本到图像扩散模型的组合性失败

ORCA: Hunting Compositional Failures in Text-to-Image Diffusion

AI 导读

基于摘要分析。本文研究文本到图像扩散模型中的组合性失败,包括属性绑定到错误对象、空间关系颠倒以及多对象场景中的计数错误,提出 ORCA(Orthogonal Residual Compositional Alignment),以单一辅助损失为扩散训练提供显式跨模态对齐信号。其主要研究对象是图像生成,而非 EEG 解码或 BCI。 作者认为,加入 T5 后仍存在的组合性问题不只是文本信息缺失,更可能源于语言建模形成的表示空间与视觉表示不对齐,而去噪目标没有直接奖励这种对应关系。ORCA 将 diffusion transformer 的潜变量与冻结视觉编码器所提供的低秩目标对齐;其中,预测器的正交基由 T5 与 CLIP 嵌入之间的可学习残差参数化,使视觉读出子空间的选择依赖具体提示词。作者还给出理论界限:在给定秩下可恢复的跨模态信息受视觉编码器协方差顶部成分的谱质量约束。具体损失公式、秩的选择及理论成立条件尚未验证。 作者报告,在 DiT-B/2、DiT-L/2 和 U-ViT-L 三种骨干上,ORCA 相对原始模型及 REPA 基线改善 FID 与 GenEval,且不增加推理阶段成本。在 DiT-L/2 上训练 200K 步时,作者报告 FID 为 16.65、GenEval 为 0.291,优于其比较中最强的 400K 步基线,并称训练成本减半;收益主要集中于属性绑定、空间关系及多对象提示词。训练步数不能单独证明实际算力成本减半,仍需核对硬件、批量大小和辅助模块开销。 摘要未提供训练数据、评估样本规模、数据划分、冻结视觉编码器的具体型号及统计不确定性;实验协议、消融及统计信息尚未验证。复现重点是核对低秩目标构建、正交约束实现、文本残差的作用,以及与 REPA 的训练预算和评估设置是否一致。材料未建立该机制与 EEG/BCI 的具体对应关系,因此不据此推导 BCI 有效性;相关 EEG 工作尚未检索确认。

阅读价值

值得核对 ORCA 如何通过提示词条件化的低秩视觉对齐改善组合生成,以及其相对 REPA 的训练效率收益;摘要报告的结果尚需结合完整评估协议验证。

来源:arXiv · 多模态与生成机制 · arxiv.org