跳到正文
OpenReview · State space models· Luke Bailey; Alex Serrano; Abhay Sheshadri; Mikhail Seleznyov; Jordan Taylor; Erik Jenner; Jacob Hilton; Stephen Casper; Carlos Guestrin; Scott Emmons·· 2024-01-01精选AI 评分77

混淆激活绕过 LLM 潜在空间防御

Obfuscated Activations Bypass LLM Latent-Space Defenses

AI 导读

基于摘要分析。该研究关注 LLM 能否在潜在状态不易被监测器识别的情况下仍执行有害行为,并以混淆激活(obfuscated activations)攻击检验潜在空间防御。作者报告,激活模式可以被重塑而模型行为往往仍得以保留,使依赖内部表征检测有害行为的防御面临挑战。 研究对象是 LLM 安全监测,而非状态空间模型架构或 EEG/BCI 解码。摘要涉及的防御包括稀疏自编码器、表征探针与潜在分布外(OOD)检测;其共同思路是在不良行为发生前,通过扫描内部激活识别风险。攻击则试图使这些激活变得不显眼,同时维持目标行为。具体攻击优化方式、所需模型访问权限、监督信号与计算成本尚未验证。 作者报告,在针对有害性分类探针的攻击评估中,攻击往往可将召回率从 100% 降至 0%,同时保持 90% 的越狱率;这些数字仅对应摘要所述探针攻击场景,不能推广为所有防御的统一结果。所用模型、样本规模、数据划分、探针训练条件及越狱成功判定标准尚未验证。作者还报告,在编写 SQL 代码这一复杂任务上,混淆会降低模型性能,说明隐藏激活与保持任务能力之间可能存在约束,但摘要未给出下降幅度。 阅读全文时需核对攻击与防御的适配条件、各类监测器的独立评估、任务复杂度对行为保留的影响,以及实验协议、消融及统计信息。该摘要未提供与神经信号数据的具体机制对应,不能据此推断 EEG/BCI 表征监测同样可被绕过;已有 EEG 相关工作尚未检索确认。

阅读价值

该研究通过混淆激活攻击检验潜在空间监测的可靠性,值得关注其对“内部表征可检测即行为可防御”这一假设的挑战,但具体攻击条件与防御评估协议尚待全文核对。

来源:OpenReview · State space models · openreview.net