跳到正文
OpenReview · State space models· Pengcheng Li; Jie Zhang; Tianwei Zhang; Han Qiu; Zhang kejun; Weiming Zhang; Nenghai Yu; Wenbo Zhou·· 2026-05-01精选AI 评分75

多轮语言模型交互中的状态依赖性安全失效

State-Dependent Safety Failures in Multi-Turn Language Model Interaction

AI 导读

基于摘要分析。本文研究安全对齐语言模型在多轮交互中的安全失效,提出状态导向诊断框架 STAR,将对话历史视为状态转移算子,以分析模型沿交互轨迹如何越过安全边界。核心贡献是把评估对象从孤立提示扩展到上下文状态演化,而非以增强越狱攻击为主要目标。 机制上,STAR 关注自回归条件化过程中对话历史对安全行为的持续影响,并尝试对不同交互轨迹进行受控分析。这里的“状态空间视角”是一种诊断表述;摘要未说明 STAR 是否采用具体的 State Space Model 架构,不能据此视为新的状态空间序列网络。 作者报告,在多个前沿语言模型上的结构化多轮交互评估中,静态评估下表现稳健的系统仍可能出现快速且可重复的安全失效。作者报告的机制分析包括:表征逐步偏离与拒绝行为相关的表征,以及角色条件上下文诱发的突变式相变。摘要未提供模型名单、安全失效的操作性定义、量化指标、轨迹构造方式或表征测量细节,因此尚不能判断这些现象的适用范围与因果解释力度。 复现时需核对状态与安全边界的定义、对话轨迹控制条件、静态与多轮评估的对照设置,以及表征漂移和相变的测量方法。实验协议、消融及统计信息尚未验证。本文主要研究对象是语言模型交互安全,而非 EEG 解码或 BCI 算法;现有摘要未提供可支持直接迁移至神经信号建模的具体机制路径。

阅读价值

值得阅读的是 STAR 将多轮安全失效转化为沿对话轨迹的受控诊断问题,可用于审视单轮评估的覆盖边界,但其机制证据与可复现性尚待全文核对。

来源:OpenReview · State space models · openreview.net