跳到正文
arXiv · 多模态与生成机制· Jiamu Bai; Jiaming Hu; Yanhong Wu; Zellux Wang·· 4 天前精选AI 评分73

测试时个性化:学习用于图像生成的用户偏好

Personalize at Test Time: Learning User Preferences for Image Generation

AI 导读

基于摘要分析。研究针对 diffusion models 难以利用有限反馈对齐个体用户偏好的问题,提出从用户历史图像偏好对直接学习个性化奖励模型的方法。核心贡献是把用户适配简化为低维权重估计,并在保持 diffusion model 冻结的情况下,于推理时使用个性化奖励引导图像生成。 方法先用 autoencoder 将数百个视觉属性压缩为 50 个由属性锚定的偏好维度,再训练评估器为图像在各维度上打分。每名用户的偏好被表示为这些共享维度评分的线性组合;用户专属权重通过最大化 Bradley-Terry 模型下已观察成对偏好的似然来估计。共享表征与个体权重的分离旨在降低每位用户的适配成本,但属性锚定的具体实现、评估器训练监督及奖励如何引导生成尚未验证。 作者报告,在真实用户偏好数据的留出成对偏好预测评估中,Accuracy 约为 77%,并报告生成图像与个体偏好的对齐有所改善。摘要未提供数据集名称、用户数量、每位用户反馈量、留出划分方式、对照基线或生成对齐的具体指标,因此不能据此判断跨用户泛化能力或相对现有方法的收益幅度。 复现需核对共享属性表征与评估器的训练数据、用户权重优化设置,以及推理时奖励引导的计算开销。实验协议、消融及统计信息尚未验证。该研究的直接对象是图像生成中的用户偏好建模,并非 EEG 解码或 BCI 验证,不能将其个性化效果视为神经信号任务中的有效性证据。

阅读价值

值得核对其将共享视觉属性评分与用户专属线性权重分离的个性化机制,重点验证稀疏反馈下的偏好预测能力及冻结 diffusion model 时的生成引导效果。

来源:arXiv · 多模态与生成机制 · arxiv.org