跳到正文
OpenReview · State space models· Atoosa Chegini; Hamid Kazemi; Seyed Iman Mirzadeh; Dong Yin; Maxwell Horton; Moin Nabi; Mehrdad Farajtabar; Keivan Alizadeh·· 2024-10-10精选AI 评分71

用于改进 RLHF 的 Model Soup:通过权重空间平均提升 LLM 对齐

Model Soup for Better RLHF: Weight Space Averaging to Improve Alignment in LLMs

AI 导读

基于摘要分析。本文研究 LLM 的人类反馈强化学习(RLHF)中,固定参考策略的 KL 散度惩罚可能限制策略探索的问题,提出 SALSA(Soup-based Alignment Learning for Stronger Adaptation):将两个独立监督微调(SFT)模型的权重进行平均,构造新的参考模型,以改善对奖励空间的探索和模型对齐。 核心机制:传统 RLHF 在 PPO 等策略优化算法中,以当前策略与冻结初始策略之间的 KL 散度作为惩罚。作者认为,这种约束可能使优化局限于较窄的参数区域。SALSA 的改动重点是参考模型的构造,而非摘要中明确给出的新策略优化损失:利用权重空间平均形成 model soup,作者称其能在保持稳定性的同时允许更大的 KL 偏离,使策略探索更有潜力的解空间。两个 SFT 模型的初始化关系、训练数据、权重平均系数,以及参考模型与待优化策略的具体配置尚未验证。 结果:作者报告,在 Llama-7B、Mistral-7B 和 Gemma-2B 上,使用 MT-Bench、Arena-Hard、UltraFeedback 进行评估时,SALSA 持续优于 PPO,并改善奖励、鲁棒性、分布外泛化和对齐表现。摘要未提供具体分数、数据划分、评估器设置或各项结论对应的实验协议,因此无法量化增益,也不能直接比较不同模型或评测任务的效果。 阅读与复现应重点核对:平均后的参考模型是否兼容并保持基础能力,KL 约束与奖励提升如何共同变化,以及相对 PPO 的训练预算和超参数是否可比。实验协议、消融及统计信息尚未验证。本文的主要研究对象是 LLM 对齐,所给材料未建立其与 EEG/BCI 任务的具体机制对应关系,不据此推断 BCI 有效性。

阅读价值

值得关注其通过两个独立 SFT 模型的权重平均改造 RLHF 参考模型的机制;摘要报告了相对 PPO 的改进,但参考模型构造、比较协议及稳定性证据仍需全文核对。

来源:OpenReview · State space models · openreview.net