从预训练扩散表征构建可辨识的世界模型
Identifiable World Models from Pretrained Diffusion Representations
基于摘要分析。本文研究高维动力系统中“预测准确不等于潜在状态与因果关系可辨识”的问题,提出 Contrastive Diffusion Alignment(ConDA):在冻结的预训练扩散模型潜在表征上,仅学习轻量对齐映射,使生成模型获得具有结构解释性的状态坐标,而无需重新训练生成骨干。 理论机制:作者将辅助变量非线性 ICA 的可辨识性保证迁移至 ConDA。作者报告,在标准 TCL/GCL 假设成立时,对齐表征可在置换及逐分量可逆变换的意义下识别潜在动力状态,保留潜在动态结构因果模型,并将滞后图恢复转化为转移 Jacobian 的稀疏性识别。该结论依赖特定假设,不应理解为任意扩散表征都能无条件恢复真实因果结构;假设细节、辅助变量构造与具体训练目标尚未验证。 实验与结果:研究对象是物理与机器人视频系统,而非 EEG 或 BCI。作者比较了基于 TCL、GCL、CEBRA 的 ConDA,以及 TDRL、CaRiNG、IDOL、temporal SuaVE 和 iVAE。作者报告,TCL 与 GCL 版本在这些评估中实现接近完美的分块状态恢复及有竞争力的滞后图恢复,其中模拟落体系统实现精确图恢复;在模拟双足机器人中,学习到的动力学恢复了留出控制扰动响应的符号与时间结构。摘要未提供具体分数、数据规模及划分细节,实验协议、消融及统计信息尚未验证。 平台推测(待验证):可迁移的候选机制是“冻结表征+轻量可辨识对齐”,可能用于探索 EEG 潜在动力状态的解释性,而非直接提高 BCI 分类性能。该假设依赖保留时间结构的表征、可用辅助变量及相应可辨识性条件;需要改造 EEG 表征骨干、辅助变量设计和状态评估方式。低信噪比、通道混合、跨被试差异与小数据可能使这些条件失效。一个可证伪的小实验是,在已知潜在状态和滞后图的合成 EEG 混合信号上,固定同一表征骨干,比较对齐前后的状态与图恢复,并逐步增加噪声检验稳健性。已有 EEG 相关工作尚未检索确认。
值得核对其将非线性 ICA 可辨识性条件连接到冻结扩散表征的理论路径,以及状态恢复、滞后图恢复与留出控制扰动之间的验证关系;其 EEG/BCI 适用性尚未验证。
来源:arXiv · 多模态与生成机制 · arxiv.org