Ambient Discrete Diffusion:在恰当时间使用不匹配数据实现数据高效学习
Ambient Discrete Diffusion: Using the Wrong Data at the Right Time for Data Efficient Learning
基于摘要分析。本文研究数据严重稀缺时如何训练离散扩散模型,提出 RefineMix,在选定的扩散时间引入域外数据,以改善泛化并避免使采样分布产生偏差。贡献在于将域间差异与扩散噪声水平联系起来,为离散生成中的数据混用提供机制解释和理论分析。 核心机制:连续扩散中的 Gaussian noise 与离散扩散中的掩码并不等价。掩码后保留的 token 仍携带域信息,因此高噪声阶段不能直接沿用连续扩散中借用相关数据的策略。摘要指出,在低噪声阶段,不同域的支持集实际上互不重叠,这一特性反而可让模型同时利用域内与域外数据,而不使采样器产生偏差。具体扩散时间选择、训练目标、数据混合比例及理论成立条件尚未验证。 作者报告,在五种域偏移设置中,RefineMix 达到或超过仅用域内数据微调及直接数据混合的表现;摘要未给出各设置的任务、数据划分和具体指标。在蛋白质序列生成中,作者报告,使用仅 197 个域内样本微调后,相较标准微调,生成蛋白质同时满足新颖、可折叠和属于目标家族的比例接近翻倍。这是组合条件下的相对比例变化,不能解读为绝对百分点提升;判定方法、绝对比例、实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 被表示为离散 token,RefineMix 可能为小样本生成预训练提供借用相关域数据的思路,但这是假设,不是已验证的 BCI 效果。可复用的是按扩散时间调度数据来源的原则,需改造的是 EEG token 化、域定义及时间选择。跨被试或跨通道数据可能具有重叠支持集,低信噪比及小数据也可能削弱域可分性,从而破坏摘要所述机制的适用前提。一个可证伪的小实验是在固定 token 化和域内样本量下,对比域内训练、直接混合与选时混合,并在独立被试上检查生成分布偏差及下游表现。相关 EEG 工作尚未检索确认。
值得核对 RefineMix 如何利用扩散时间与域支持集的关系,在小数据离散生成中借用域外数据而不偏移采样分布;其理论适用条件与蛋白质生成评估协议尚未验证。
来源:arXiv · 多模态与生成机制 · arxiv.org