一个循环安全,另一个循环有风险:循环语言模型跨循环深度的安全对齐
Safe at One Loop, Risky at Another: Aligning Safety Across Recurrent Depths in Looped Language Models
基于摘要分析。本文研究循环语言模型(LoopLMs)在不同循环深度下能否保持一致的安全行为,提出 SafeBridge,将深度特定控制、选择性状态桥接与跨循环深度联合安全监督结合,用于降低越狱攻击下的安全风险。 LoopLMs 通过在多个循环步骤中重复使用共享参数扩展模型能力,且各循环深度均可独立读出输出。因此,同一模型需要评估的不只是最终输出,还包括不同推理深度的安全表现。作者报告,在针对不同循环深度的越狱评估中,更深推理可能出现更高的攻击成功率;同一查询在不同深度可能触发不同安全行为,针对某一深度构造的攻击也可能迁移至其他深度。作者还报告,SFT 与偏好对齐未能消除这些安全差异,但摘要不足以确定其适用的具体模型与训练配置。 SafeBridge 的核心思路是对共享循环层施加轻量级、深度特定的控制,通过选择性状态桥接协调循环状态,并在多个循环深度施加联合安全监督。摘要未提供控制模块结构、状态选择规则、损失形式及训练流程,相关实现尚未验证。 作者报告,在多个模型规模、攻击方法和安全基准上,SafeBridge 降低了匹配深度与跨深度攻击的成功率,相比原始模型还改善了通用任务效用,并保持相近的过度拒答表现。摘要未给出具体基准、数值、数据划分或对照配置,因此不能量化收益或比较不同协议的效果;实验协议、消融及统计信息尚未验证。 本文的可核对贡献是指出单一循环深度的安全结果不足以代表整个 LoopLM,并提供跨深度对齐的技术路径。复现时需核对深度采样与读出方式、攻击构造及迁移协议、安全与效用指标,以及额外训练和推理开销。材料称代码与模型检查点将在论文被接收后发布,当前发布状态及接收状态尚未验证。本文未提供 EEG/BCI 实验依据,不应将语言模型安全收益直接外推为 BCI 效果。
值得阅读的具体原因是其将 LoopLM 的安全评估从单一推理深度扩展到匹配深度与跨深度攻击,并提出联合安全对齐方法;效果幅度及复现细节尚未验证。
来源:arXiv · 在线与高效推理 · arxiv.org