跳到正文
OpenReview · Representation learning· Yi-Shiuan Tung; Yuni Wu; Wei Jiang; Alessandro Roncone; Bradley Hayes·· 2026-07-10AI 评分65

随机结果下的风险感知偏好学习

Risk-Aware Preference Learning for Stochastic Outcomes

AI 导读

基于摘要分析。研究关注人机交互中通过人类偏好学习奖励函数时,期望效用(EU)假设能否准确描述用户对随机结果的评价。作者在社会机器人导航场景中,将 EU 与累积前景理论(CPT)纳入 Bradley-Terry 偏好学习框架进行比较,以研究风险敏感决策模型对奖励恢复的影响。 EU 按结果概率线性汇总效用;摘要指出,人类可能高估罕见负面事件并表现出损失厌恶,因此这一假设可能偏离用户偏好。研究以碰撞等发生概率低、后果严重的导航结果为背景,用 CPT 的非线性决策建模与 EU 对照。CPT 的具体参数化、参考点设定、偏好概率构造及优化方式尚未验证。 作者报告,在偏好由风险敏感用户生成的初步实验条件下,CPT 学习器恢复奖励函数的 regret 显著低于 EU 学习器。摘要未给出数值、regret 定义或统计检验,因此这里的“显著低于”仅转述作者的定性描述,不代表已确认统计显著性。偏好来自真实参与者还是模拟生成、样本规模、训练与测试划分、消融及统计信息尚未验证。 平台推测(待验证):该机制可能适用于依据用户偏好优化 BCI 辅助设备行为的奖励学习,尤其是错误操作后果不对称的情境,但它不是 EEG 表征或解码方法。迁移依赖可描述的随机行动结果及偏好监督;可复用偏好比较框架,需重新定义 BCI 的结果、风险与用户参考点。低信噪比 EEG 导致的概率估计误差、跨被试风险偏好差异及小样本下 CPT 参数难以辨识均可能使迁移失败。一个可检验的小实验是在固定 BCI 行动及结果概率的条件下收集成对偏好,以相同划分比较 EU 与 CPT 对留出偏好的预测表现,并核对奖励恢复指标的适用性。已有 EEG/BCI 相关工作尚未检索确认。

来源:OpenReview · Representation learning · openreview.net