Re-markable:通过合成窃取带水印的神经网络
Re-markable: Stealing Watermarked Neural Networks Through Synthesis
基于摘要分析。本文研究神经网络知识产权保护中的后门式水印是否能抵御模型修改攻击,提出利用 GAN 合成样本重新训练带水印模型,以移除可验证的水印签名,同时尽量保持原任务性能。研究对象是模型水印安全性,而非 BCI 解码或状态空间模型。 核心机制是以 GAN 生成的样本支持模型再训练,改变模型对水印的响应。摘要将该方法描述为能够提取已训练神经网络并移除水印的模型修改攻击,但未说明攻击者是否需要模型权重、查询接口、原始训练数据或标签,也未交代 GAN 的训练来源、再训练目标及水印验证流程;这些条件决定了攻击的适用范围,尚需全文核对。 作者报告,在 MNIST、Fashion MNIST 和 CIFAR-10 上,该攻击成功移除了可验证水印,再训练模型的 Accuracy 与原模型相差约 3%。摘要没有说明这一差异是相对百分比还是百分点,也未提供各数据集的独立结果、数据划分、具体水印方案或攻击对照,因此不能据此认定所有后门式水印均不可靠。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 解码模型采用类似后门式水印,合成数据驱动的再训练可能成为其所有权验证的安全测试路径,而不是解码性能改进方法。可复用的是“合成样本—再训练—任务性能与水印验证联合评估”的流程;需改造的是面向 EEG 时序与通道结构的生成模块,以及水印触发和验证设计。低信噪比、跨被试分布差异、通道配置变化和小样本可能使合成数据失真,导致任务性能先于水印失效。一个可检验的小实验是在固定被试内划分及攻击权限下,对带水印 EEG 分类模型进行合成样本再训练,并与不修改模型、真实样本再训练对照,同时记录 Accuracy 和水印验证结果。已有 EEG 相关工作尚未检索确认。
值得阅读以核对基于 GAN 合成样本的模型修改攻击如何削弱后门式水印的所有权验证能力,但攻击权限、性能比较协议及其对 EEG 模型的适用性尚未验证。
来源:OpenReview · State space models · openreview.net