跳到正文
OpenReview · State space models· Leitian Tao; Xuefeng Du; Sharon Li·· 2025-09-19精选AI 评分75

偏好数据有限?通过潜在空间合成学习更好的奖励模型

Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis

AI 导读

基于摘要分析。研究针对 LLM 人类偏好对齐中偏好数据获取成本高、文本合成计算开销大的问题,提出 LENS:直接在潜在嵌入空间合成偏好数据,以增强奖励模型训练,而非生成并标注新文本。 核心机制是用 Variational Autoencoder(VAE)学习回答嵌入的结构化潜在表示,在该潜在空间中施加受控扰动,再解码回嵌入空间,生成多样且语义一致的合成偏好对。其区别于文本增强的关键在于绕过文本生成与标注。摘要未说明扰动约束、偏好标签构造、VAE 损失或奖励模型训练细节,这些尚需正文核对。 作者报告提供了合成偏好对近似保持原始偏好排序、改善奖励模型泛化的理论保证,但保证所依赖的假设与适用范围尚未验证。作者还报告,在未具名的标准基准上,LENS 优于文本增强,生成速度为对照的 18 倍,所用模型小 16,000 倍;摘要未交代基准、数据划分、性能指标、模型规模口径及计时条件,因此这些数值仅能作为作者在其评估设置下的报告,不能外推。实验协议、消融及统计信息尚未验证。摘要提供了公开代码地址,但实现与复现条件尚未核验。 平台推测(待验证):若 EEG 下游任务具有稳定的表征空间和可信的成对偏好监督,潜在空间增强或可用于缓解偏好数据稀缺;这是假设,不是本文已验证的 BCI 效果。可复用的是 VAE 与受控扰动思路,需改造的是 EEG 表征、偏好定义及标签保持约束。低信噪比、跨被试分布差异、通道变化与小样本可能使扰动破坏偏好排序。可检验的小实验是在固定真实偏好数据和被试隔离划分下,对比无增强与 LENS 式嵌入增强,核对合成对排序一致性及独立测试集表现。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 LENS 在嵌入空间合成偏好对时保持偏好排序的理论条件,以及其相对文本增强的效率与泛化收益,但这些结论目前仅有摘要支持。

来源:OpenReview · State space models · openreview.net