扩散应在语言模型的何处引入?几何引导的隐藏状态替换
Where Should Diffusion Enter a Language Model? Geometry-Guided Hidden-State Replacement
基于摘要分析。本文研究连续扩散语言模型应在哪个表征空间执行去噪,将这一问题表述为预训练语言模型内部的隐藏状态接口选择,并提出 DiHAL:依据表征几何定位接口,以条件扩散替换接口之前的 transformer 前缀,同时保留预训练后缀与 LM head。 核心机制是用三个无需训练的几何代理量——局部紧致性(local compactness)、全局刚性(global stiffness)和有效秩(effective rank)——构建几何评分,判断哪些隐藏表征更适合扩散衔接。其设计重点不是仅调整扩散模块,而是把扩散所作用的表征空间本身作为设计变量。摘要未提供代理量的计算公式、评分组合方式、扩散条件、损失函数或采样流程。 作者报告,在两个 8B 规模的骨干模型上,几何评分能够在层深这一主导因素之外,预测固定预算下的扩散衔接能力。在完整训练条件下,几何选出的接口表现接近按验证损失确定的 oracle 接口,并优于最差层对照;在匹配的诊断条件下,扩散桥接模块优于参数量匹配的确定性替换。摘要未给出具体分数,不能据此量化提升幅度或判断不同任务上的普适性。 复现时需核对几何统计使用的数据、候选接口范围、固定预算的定义、验证损失 oracle 的选择流程,以及确定性对照的参数与训练条件如何匹配。数据集、划分、训练与推理成本、消融及统计信息尚未验证。 平台推测(待验证):若预训练 EEG 模型存在可用于上下游衔接的隐藏状态接口,可假设类似几何指标有助于选择扩散重建位置,对应 EEG 表征中的噪声与跨被试分布变化问题。但需改造扩散条件、信号重建目标及通道适配方式;低信噪比、通道差异和小数据可能使几何统计不稳定,且几何上适合去噪不等于保留任务信息。可检验的小实验是在同一 EEG 模型、相同数据划分与训练预算下,比较几何选层和仅按层深选层,并加入参数匹配的确定性替换,分别观察重建表现与下游任务指标。已有 EEG 相关工作尚未检索确认,这不是原论文已验证的结论。
值得核对其表征几何评分能否在控制层深影响后预测扩散替换的可训练性,以及参数匹配的确定性替换对照;这些证据针对语言模型,尚不支持 EEG/BCI 有效性。
来源:OpenReview · State space models · openreview.net