具有状态保留保证及抵御隐藏状态投毒的 PAC-Bayesian 界的 Lipschitz 约束选择性状态空间模型
Lipschitz-Constrained Selective State-Space Models with State-Retention and PAC-Bayesian Bounds Against Hidden-State Poisoning
基于摘要分析。本文研究 Mamba 等选择性状态空间模型(SSM)的隐藏状态投毒(HiSPA):短对抗 token 序列可使输入依赖的离散化步长 Δt 趋于饱和,令状态转移矩阵 exp(ΔtA) 趋近于零,从而抹除先前上下文。作者提出 LipMamba,通过参数化约束结合理论界与攻击实验,限制这一状态擦除机制。 核心机制包括投影的谱归一化、状态矩阵的特征值约束,以及将离散化步长限制在 [Δmin, Δmax]。作者声称证明了有界输入域上选择性扫描的显式 Lipschitz 常数,并指出 Δmin > 0 是保持状态有界的条件;另给出状态保留界及可解析计算的触发长度 ℓ⋆,以及由同一常数控制间隙项的对抗风险 PAC-Bayesian 界。具体假设、推导及实现尚需全文核对。 作者明确限定理论保证:全局 Lipschitz 常数随深度几何增长,所得全局证书不具有效力;逐输入半径来自局部 Lipschitz 估计,属于经验结果。状态保留界仅约束范数,不保证内容保持。在所用约束值下,理论界可保证单 token 触发后至少保留 50% 的状态范数,并可防止最长六个 token 的触发导致近乎完全擦除,不能据此保证更长攻击或语义记忆安全。 作者报告,在 RoBench-25 和 HarmBench 的 HiSPA 评估中,触发长度为 24 时,LipMamba-370M 的投毒后 Accuracy 为 85.3%,Mamba 为 23.4%;在经验局部 Lipschitz 半径 0.18 下,Accuracy 为 80.4%。摘要未明确这些结果的分数据集汇总方式与完整攻击设置。在 WikiText-103 上,相对公开 Mamba 检查点的困惑度开销为 3.5–4.9%。作者报告消融将收益主要归因于选择性投影的谱归一化和步长限制。数据划分、实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型采用输入依赖的选择性 SSM,类似约束可能缓解短时伪迹造成的状态擦除,但原文验证对象是 token 序列,并非 EEG。可复用谱归一化与步长约束,需适配连续信号输入和幅值界;低信噪比、跨被试幅值差异及过强约束可能损害有效信息保留。一个可证伪的小实验是在固定 EEG 数据划分下,对比约束前后模型在短时伪迹注入后的状态范数、任务 Accuracy 与干净数据表现。已有 EEG 相关工作尚未检索确认。
值得核对其选择性 SSM 稳定性约束与状态保留证明,尤其是作者明确区分短触发器的范数保证、长触发器的实测防御效果及不具有效力的全局证书,便于判断理论结论的适用边界。
来源:OpenReview · State space models · openreview.net