面向奖励的因果表征学习
Reward-oriented Causal Representation Learning
基于摘要分析。本文研究高维观测背后低维潜在因果因素的学习,但不以完整恢复潜变量及其因果图为最终目标,而是提出 reward-oriented CRL:仅学习足以优化指定下游任务奖励的最粗粒度表征,避免超出任务需求的精确恢复。 方法将目标形式化为在所有可能干预构成的空间上,优化观测数据的某个指定函数,研究范围限定在线性因果模型与线性变换模型。作者设计自适应探索算法,逐步学习识别最佳干预所需的潜在因果图与变量,以序贯确定最优干预子集。其关键区别是以任务优化需求决定表征学习程度,而不是默认完整因果恢复必不可少;摘要尚未说明如何具体判定表征粒度、实施干预及更新图估计。 作者报告理论结果:在潜在空间维度为 n、观测空间维度为 d、探索时域为 T 的设定下,算法遗憾上界为 Õ(d^(1/3)n^(1/3)u^(2/3)T^(2/3) + u√T),其中 u 衡量因果图估计的总不确定性。作者还给出近乎匹配的下界 Ω(d^(1/3)n^(1/3)p^(2/3)T^(2/3) + p√T),其中 p 为图中因果路径数量。上下界使用的结构量不同,不能仅据摘要将其解读为完全匹配;具体假设、遗憾定义及证明条件尚未验证,实验协议、消融及统计信息亦尚未验证。 平台推测(待验证):其潜在 EEG/BCI 对应点是任务相关表征不必恢复全部信号生成因素,但这属于迁移假设。原方法依赖线性潜在因果结构、观测变换及可探索的干预空间,普通离线 EEG 分类数据未必满足这些条件。可考虑复用任务驱动的探索思想,但须重新定义安全可执行的干预、奖励与观测映射;低信噪比、跨被试变化、通道混合及小样本可能使因果图估计不稳定。一个可证伪的小实验是在具有已知线性潜在图、可控干预和 EEG 式噪声的合成数据上,在相同探索预算下比较任务导向恢复与完整恢复的累计遗憾,并考察噪声增强时优势是否消失;这只能检验机制,不能证明真实 BCI 有效。已有 EEG 相关工作尚未检索确认。
值得阅读的是其将因果表征恢复目标改为下游奖励所需的最粗粒度表征,并在明确的线性模型条件下给出自适应干预探索的遗憾上界与近乎匹配的下界;对 EEG/BCI 的适用性尚未验证。
来源:OpenReview · Representation learning · openreview.net