跳到正文
OpenReview · Representation learning·· 25 天前精选AI 评分74

偏好优化中的 On-Policy 表征对齐

On-Policy Representation Alignment in Preference Optimization

AI 导读

基于摘要分析。本文研究 LLM 偏好优化中静态离线偏好数据与持续变化的当前策略之间的错配,提出 On-Policy Representation Alignment(OPRA),将偏好优化从奖励层面的回答排序扩展到表征层面的偏好对齐。 核心机制是:针对一个离线偏好对,从当前策略采样一段短回答前缀作为锚点,促使其回答级表征更接近被偏好的回答表征,而远离被拒绝的回答表征。OPRA 联合优化输出层面的偏好一致性与 on-policy 表征对齐,旨在把离线监督直接连接到策略自身的自回归生成过程。相较于摘要所述的奖励空间约束或数据侧策略,其区别在于显式约束生成过程中的表征,而不只约束最终回答的偏好排序。具体表征提取位置、距离度量、损失形式、权重及采样开销尚未验证。 作者报告,在十个基准的实验中,OPRA 在不同偏好数据设置与 LLM 骨干模型上取得一致改进;进一步分析显示其学习到更符合偏好的表征,并在多种设置下表现出泛化能力。摘要未提供基准名称、数据划分、对照方法、指标或增益数值,实验协议、消融及统计信息尚未验证,因此不能据此判断改进幅度或比较不同协议的结果。 本文主要对象是具有自回归生成能力、使用成对偏好监督的 LLM,并非 EEG 解码或 BCI 控制。平台推测(待验证):若某个 BCI 系统包含可采样的序列生成策略及可靠的成对偏好反馈,可假设以当前策略输出作为表征锚点有助于缓解离线反馈与策略行为的错配;可复用的是锚点采样和偏好表征对齐思路,信号编码、序列定义及反馈收集需要改造。低信噪比、跨被试差异和小数据可能使锚点及偏好监督不稳定。一个可证伪的小实验是在固定数据划分与反馈预算下,对比仅输出级偏好优化和加入表征对齐的同一生成策略,检查任务性能及偏好一致性是否同时改善。已有 EEG 相关工作尚未检索确认,该假设不适用于没有生成策略或偏好反馈的普通 EEG 分类任务。

阅读价值

值得阅读的是 OPRA 利用当前策略生成的短前缀连接离线偏好监督与表征学习的机制;作者报告其在多个基准上有效,但具体增益、实现成本及对 EEG/BCI 的适用性尚未验证。

来源:OpenReview · Representation learning · openreview.net