跳到正文
OpenReview · Representation learning· Yusuf Syed; Viraj Parimi; Brian C. Williams·· 2026-06-22精选AI 评分75

MoMo:用于偏好调节规划的条件化对比表示学习

MoMo: Conditioned Contrastive Representation Learning for Preference-Modulated Planning

AI 导读

MoMo 针对同一起点—目标查询下,单一潜在几何难以表达任务效率与风险暴露之间多种有效权衡的问题,提出偏好条件化的对比式规划方法,使标量用户偏好能够在推理时连续调节规划的保守程度,无需重新训练。基于摘要分析,未取得论文全文。 机制上,时间对比表示学习将长时程规划转化为低维线性系统中的推断。MoMo 使用 Feature-Wise Linear Modulation 对表示几何进行条件化,并使用低秩神经调制对潜在预测算子进行条件化。其关键不只是将偏好附加到输入,而是联合调节规划所依赖的表示空间与预测机制。作者称,该构造保留了表示空间中对推断驱动的对比式规划至关重要的概率密度比,同时保留推理阶段的效率;具体理论假设、损失形式及效率测量尚未验证。 作者报告,在六个环境中,MoMo 能随用户偏好平滑调整规划安全性,并相较于状态增广基线改善时间一致性与偏好一致性。摘要未提供环境名称、训练与测试划分、指标定义或结果数值,因此无法判断改善幅度及适用边界;实验协议、消融及统计信息尚未验证。复现时需核对偏好如何参与训练、风险与效率如何量化,以及未见偏好或环境变化下的表现。 平台推测(待验证):其对 EEG/BCI 的潜在启发更接近 BCI 下游辅助控制中的偏好条件化规划,而非直接提升 EEG 解码。假设 BCI 控制任务具有可用于时间对比学习的状态轨迹、起点—目标查询及风险或偏好信号,可尝试复用表示与预测算子的联合条件化机制;EEG 观测编码和偏好标定则需另行改造。低信噪比、跨被试及通道变化、小规模轨迹数据可能使潜在动力学和偏好效应不稳定。一个可检验的小实验是在固定 EEG 解码器的辅助控制仿真中,对比联合条件化与状态增广,检查偏好变化是否稳定改变风险—效率权衡,并测量推理开销。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的具体原因是,MoMo 将用户偏好同时引入潜在表示几何与预测算子,并声称保留对比式规划所需的概率密度比结构,为核对偏好调节与推理效率能否兼容提供了明确机制。

来源:OpenReview · Representation learning · openreview.net