跳到正文
arXiv · 多模态与生成机制· Jieke Wu; Qijie Zhu; Weimin Wu; Zeqi Ye; Minshuo Chen; Han Liu·· 6 天前精选AI 评分76

D-DOIT:通过 Doob's h-Transform 实现离散扩散的免训练适配

D-DOIT: Training-free Adaptation of Discrete Diffusion via Doob's h-Transform

AI 导读

D-DOIT 研究如何在不重新训练离散扩散模型、也不使用奖励梯度的条件下,以通用奖励引导生成;其核心贡献是将适配表述为从奖励倾斜的目标分布采样,并通过 Doob's h-Transform 重加权逆向转移概率。基于摘要分析,未取得论文全文。 机制上,掩码离散扩散执行的是类别 token 的揭示转移,而非连续状态更新,因此 D-DOIT 调整的是逆向转移概率,而不是添加连续扩散中的漂移修正。为避免昂贵的未来轨迹 rollout,每个引导步骤先采样候选下一状态,再用模型预测头将各候选补全为干净序列,经奖励 oracle 评估后,按与奖励成比例的概率重采样下一状态。可选的后期 best-of-K 优化仅在去噪接近结束时分支轨迹,避免在完整轨迹上承担 K 倍成本。奖励的具体变换、候选补全对目标分布的近似误差及计算开销尚未验证。 作者报告,在调控 DNA 设计与蛋白质逆折叠基准上,D-DOIT 优于免训练引导基线;在 DNA 设计中提升增强子活性和细胞类型特异性,同时保持序列自然性,并在所评估的蛋白质逆折叠实验中取得最高成功率。摘要未提供具体数据集名称、划分、基线、指标数值或成本测量,实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 任务已具备离散 token 表示、掩码扩散生成器及可靠的序列级奖励,该重采样机制可能用于任务约束下的生成适配,但不等于已验证的 BCI 效果。可复用模块是候选补全与奖励重采样;需改造的是 EEG 离散表示及奖励定义。低信噪比、跨被试或通道差异,以及小数据下不可靠的奖励估计,可能导致生成器偏向奖励而损害信号真实性。一个可证伪的小实验是在固定 EEG 离散扩散模型和推理预算下,对比无引导采样与 D-DOIT,分别检查任务奖励及独立的信号质量指标。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其如何用奖励值重加权离散扩散的逆向转移,以实现无需训练、无需奖励梯度的生成适配,尤其是候选补全带来的奖励近似与推理成本权衡。

来源:arXiv · 多模态与生成机制 · arxiv.org