SGRPO:使用状态隔离的组相对策略优化状态空间语言模型
SGRPO: Optimizing State-Space Language Models with State-Isolated Group-Relative Policy
基于摘要分析。本文研究状态空间语言模型在 Group-Relative Policy Optimization(GRPO)训练中共享生成缓存可能引入的采样依赖,提出每次生成前恢复提示处理后的状态,并将这一修正与 token 级归一化、future-KL token weighting 组合为 SGRPO。主要研究对象是语言模型的策略优化,而非 EEG 解码或 BCI。 GRPO 将同一提示下多次采样响应的奖励在组内标准化,以构造各响应的优势估计。作者指出,其推导要求组内响应是当前策略的独立样本;对于 Mamba 等状态空间模型,如果为避免重复编码提示而让多个响应顺序使用同一生成缓存,各层递归状态与因果卷积缓冲区就可能从前一次响应延续到下一次。后续响应因此不再从仅由提示产生的干净状态开始。作者主张,在非退化奖励映射下,这会引入依赖生成顺序的估计偏差,并通过共享组基线影响首个未受状态延续污染的响应。该问题针对共享缓存且未重置状态的实现,不宜扩大为所有状态空间策略的固有缺陷。 修正机制是在每次响应生成前,将各层递归状态和卷积缓冲区恢复至提示处理完成时的值,保留原有组相对目标。作者报告,这能恢复严格独立性,且不增加 FLOPs;但零额外 FLOPs 不等于没有状态复制、显存或运行时间开销,相关实现成本尚未验证。摘要未展开 token 级归一化及 future-KL token weighting 的公式与作用,也未给出数据集、模型规模、奖励设置、下游指标或对照结果。理论推导、实验协议、消融及统计信息尚未验证。 平台推测(待验证):这一机制首先可用于检查任何依赖组内独立采样、又复用递归缓存的训练流程。若 EEG 条件生成策略确实采用此类优化,才存在迁移路径;需确保神经信号条件状态与生成状态的边界清晰,并验证恢复操作没有遗漏缓冲区。可先固定提示与模型,比较共享缓存和状态隔离条件下不同生成顺序的奖励及优势估计变化,再考虑 EEG 任务。原文没有 EEG/BCI 有效性证据,相关工作尚未检索确认。
来源:OpenReview · State space models · openreview.net