跳到正文
OpenReview · Representation learning· Connor Mattson; Anurag Sidharth Aribandi; Daniel S. Brown·· 2024-05-15精选AI 评分72

基于人类反馈的表征对齐:从混合质量示范中学习跨具身奖励

Representation Alignment from Human Feedback for Cross-Embodiment Reward Learning from Mixed-Quality Demonstrations

AI 导读

基于摘要分析。本文研究跨具身逆强化学习:从一种或多种具身的视频示范中学习奖励函数,再迁移到动作空间、动力学、尺寸或形态不同的另一种具身。核心贡献是将研究条件从近最优示范扩展到混合质量示范,并分析利用人类反馈进行表征学习与对齐的多种技术。 原研究面向机器人从人类视频学习策略,以及不同具身机器人之间的策略模仿。作者指出,近最优示范在实践中难以保证;混合质量数据要求奖励表征不仅处理具身差异,还要保留与行为质量有关的信息。摘要没有说明人类反馈的具体形式、对齐目标、损失函数及训练流程,不能据此将方法等同于偏好学习或某种特定对比学习算法。 作者报告,在其混合质量示范实验中,既有方法难以学到可泛化的奖励表征;所分析的不同表征学习技术会产生定性不同的奖励塑形行为,结果提示人类反馈对混合质量、混合具身数据学习的重要性。摘要未给出任务、数据规模、具身组合、划分协议、对照方法名称或定量指标,实验协议、消融及统计信息尚未验证。复现前需核对示范质量的定义、人类反馈获取方式、迁移奖励的评估方式及各方法的比较条件。 本文并非 EEG 或 BCI 研究。平台推测(待验证):若 BCI 系统存在可比较的任务行为轨迹、质量反馈及跨执行端迁移需求,其反馈驱动的奖励表征对齐可能具有方法参考价值;这不等同于跨被试 EEG 解码。奖励学习与反馈利用思路可能可复用,但输入编码和对齐约束需要适配 EEG 的低信噪比、通道差异及小样本条件,否则可能保留个体或设备特征而非任务质量。一个可检验的假设是:在同一 BCI 控制任务中固定反馈预算,比较加入与不加入表征对齐时的跨执行端奖励排序一致性。该设想不属于作者已验证结果,相关 EEG 工作尚未检索确认。

阅读价值

值得阅读的是其对混合质量示范下跨具身奖励表征泛化的分析,以及人类反馈驱动的表征学习与对齐如何产生不同奖励塑形行为;具体效果与复现条件尚待全文核对。

来源:OpenReview · Representation learning · openreview.net