绘制前先思考:扩散模型的递归潜在推理
Think Before You Paint: Recursive Latent Reasoning for Diffusion Models
基于摘要分析。本文研究扩散模型在像素空间中处理数独、迷宫等视觉推理任务时的约束满足问题,提出 Painter-Thinker(PaTh),将递归推理网络与冻结扩散模型结合,无需符号表示或符号监督即可生成符合复杂约束的图像。 核心机制是由小型递归网络 Thinker 在学习到的 token 网格上进行推理,该网格编码带噪图像及条件信息;Thinker 在每个去噪步骤内反复细化潜在状态,再通过 ControlNet 适配器引导冻结的 Painter。训练仅使用标准重建损失,不依赖符号目标、求解器或验证器。与在离散符号表示上求解的 Tiny Recursive Model(TRM)相比,本文关注的是如何将递归推理机制接入像素空间生成过程,而非直接使用符号求解结果。 作者报告,在 hard MNIST Sudoku 上,PaTh 的解题成功率为 92.5%,此前最佳为 75%;在 extreme 难度上为 71.2%,此前最佳为 4.1%。摘要同时报告 PaTh 为 10M 参数,标准扩散模型为 82M 参数,但该计数是否包含冻结 Painter 与适配器尚未验证。作者报告在迷宫、Queens 及指定空间关系的 CLEVR 场景上也有改善,且优势随问题规模增大而扩大;这些任务的具体指标和对照设置未在摘要中展开。 作者报告,错误注入诊断实验显示 PaTh 能修复扩散模型无法修复的错误,尤其在较多单元出错时。这为其迭代纠错机制提供了可进一步核对的证据,但尚不能据此确认它在未见约束或其他数据模态上的泛化能力。数据划分、既有最佳结果的协议可比性、递归次数、计算开销、消融及统计信息尚未验证,代码与复现条件亦未确认。 平台推测(待验证):其“每步生成前细化潜在状态”的机制或可用于具有明确观测约束的 EEG 条件生成或缺失片段重建,但依赖适合 EEG 的时序/通道表示及预训练生成模型,不能直接沿用图像网格与 ControlNet 接口。低信噪比、跨被试变化和小数据训练可能使递归过程强化伪结构。一个可检验的假设是:在固定 EEG 重建任务、相同数据划分与计算预算下,加入递归潜在细化能否比无递归基线更好地满足已观测信号约束,并保持频谱结构。该迁移并非本文已验证结果,已有 EEG 相关工作尚未检索确认。
值得核对其如何仅凭重建损失,将递归潜在推理接入冻结扩散模型,并通过错误注入实验检验复杂视觉约束下的纠错能力;摘要结果尚不能证明其适用于 EEG/BCI。
来源:arXiv · 多模态与生成机制 · arxiv.org