跳到正文
OpenReview · State space models· Xiaoyun Xu; Zhuoran Liu; Stefanos Koffas; Stjepan Picek·· 2026-06-03精选AI 评分79

面向模型参数空间的后门隐蔽性研究

Towards Backdoor Stealthiness in Model Parameter Space

AI 导读

基于摘要分析。本文研究机器学习模型的后门攻击能否在多类防御下保持隐蔽,主要对象是图像模型安全,而非 EEG 或 BCI 解码。作者从参数空间分析既有攻击的共同弱点,并提出供应链后门攻击 Grond 及其模块 Adversarial Backdoor Injection(ABI)。 核心问题是:输入空间中难以察觉的触发器、特征空间中难以区分的后门表征,是否足以抵抗检查其他空间的防御。作者考察了12种侧重输入空间或特征空间隐蔽性的常见后门攻击,以及17种具有代表性的防御。作者报告,这些攻击可被参数空间检查缓解,并将这一现象与参数空间中突出的后门相关神经元联系起来;这里的神经元指模型计算单元,不是生物神经元。 方法上,Grond 通过 ABI 限制参数变化,在后门注入过程中自适应增强参数空间隐蔽性。摘要未提供其具体约束、损失形式、训练流程或攻击者权限,因此尚不能判断该机制的实现细节与适用边界。 在 CIFAR-10、GTSRB 和 ImageNet 子集的实验中,作者报告 Grond 面对所评估的先进防御,包括自适应防御,优于上述12种攻击;作者还报告 ABI 能持续改善常见后门攻击的有效性。摘要未给出具体攻击成功率、正常任务性能、数据划分、模型配置或逐项防御结果,实验协议、消融及统计信息尚未验证,不能将这一结论扩展为对所有实际防御均有效。 作者声明代码已公开,但本材料未提供代码地址,复现还需核对完整实现、攻击与防御配置以及 ImageNet 子集构成。本文未提供 EEG/BCI 验证;其参数空间分析是否适用于神经信号模型尚未验证,已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的具体原因是作者将后门隐蔽性评估扩展至参数空间,并以12种攻击和17种防御检验不同空间隐蔽性之间的差异;其结论的适用范围仍需结合全文中的实验协议核对。

来源:OpenReview · State space models · openreview.net