跳到正文
OpenReview · State space models· Viacheslav Meshchaninov; Alexander Shabalin; Egor Chimbulatov; Nikita Gushchin; Ilya Koziev; Alexander Korotin; Dmitry Vetrov·· 2026-05-31精选AI 评分77

如何将潜在扩散语言模型与潜在空间联合训练

How to Train Your Latent Diffusion Language Model Jointly With the Latent Space

AI 导读

基于摘要分析。本文研究非自回归文本生成中如何构造适合扩散建模的连续潜在空间,提出 Latent Diffusion Language Model(LDLM),联合训练潜在编码器、扩散模型和解码器,使文本表征既易于去噪,也易于解码为 token。 核心机制是使用可训练编码器重塑预训练语言模型的表征,在连续潜在空间中并行去噪整个序列。作者报告,朴素联合训练会得到质量较低的扩散模型,因此提出包含 MSE 解码器损失、diffusion-to-encoder warmup、自适应时间步采样和解码器输入噪声的训练配方。摘要未提供损失的具体计算对象、warmup 的调度方式或各组件的实现细节,尚不能据此重建完整训练流程。 作者报告,在 OpenWebText 和 LM1B 上,LDLM 的生成表现优于已有离散及连续扩散语言模型,同时速度为对照的 2–13 倍;作者还报告,各训练组件均显著影响生成表现。具体生成指标、对照模型、数据划分、采样步数、硬件与计时条件,以及消融幅度和统计信息尚未验证,因此这些结论不能直接外推到其他评估协议。 平台推测(待验证):可迁移的假设是,联合调整表征空间与去噪模型,可能缓解固定 EEG 表征不适合扩散重建的问题,而非直接提升 BCI 解码性能。原方法依赖预训练文本表征及 token 解码目标;迁移时需改造为 EEG 编码器和信号重建目标,并核对数据规模需求。低信噪比、通道差异、跨被试分布变化及小数据可能导致表征退化或过拟合。一个可证伪的小实验是在固定跨被试划分、训练数据和计算预算下,比较冻结表征与联合训练表征的 EEG 去噪重建表现,并另行检查是否保留任务相关信息。相关 EEG 工作尚未检索确认。

阅读价值

值得阅读的是其围绕潜在空间联合学习提出的训练配方及组件消融,能为连续表征上的扩散训练提供可核对的设计线索,但其 EEG/BCI 适用性尚未验证。

来源:OpenReview · State space models · openreview.net