跳到正文
OpenReview · State space models· Wentao Ye; Jiaqi Hu; Haobo Wang; Xinpeng Ti; Zhiqing Xiao; Hao Chen; Liyao Li; Lei Feng; Sai Wu; Junbo Zhao·· 2025-12-31精选AI 评分76

语言模型反演的不变潜在空间视角

An Invariant Latent Space Perspective on Language Model Inversion

AI 导读

基于摘要分析。本文研究语言模型反演(LMI),即从模型输出恢复隐藏提示词所带来的隐私与系统安全风险。作者提出 Invariant Latent Space Hypothesis(ILSH)及方法 Inv^2A,通过复用 LLM 自身的潜在空间、学习轻量逆编码器来恢复提示词,而非将其作为 EEG 或 BCI 解码问题。 核心假设包含两部分:源不变性要求同一提示词产生的不同输出保留一致语义;循环不变性要求输入与输出之间的循环映射在共享潜在空间中保持自洽。Inv^2A 将 LLM 视为不变解码器,仅学习把输出映射到去噪伪表征的逆编码器。当同一来源有多个输出时,方法在表征层进行稀疏拼接,以提高信息密度。训练分为对比对齐与监督强化两个阶段,分别对应上述两种不变性;另可使用无需训练的邻域搜索进行局部优化。摘要未给出损失公式,“监督强化”的具体实现尚未验证,不能据此认定采用了某种强化学习算法。 作者报告,在覆盖用户提示词与系统提示词场景的 9 个数据集上,Inv^2A 相比基线平均提升 4.77% BLEU,并降低对大规模反演语料的依赖。这里保留摘要的百分比表述,其计算方式、是否为相对提升、数据集名称、划分、基线及各场景结果尚未验证。作者还报告所评估的常见防御保护有限,但防御类型、攻击者访问权限及评价协议仍需核对,不能推广为所有防御均无效。摘要提供了代码与数据仓库,实际可用性及复现条件尚未验证。 平台推测(待验证):源不变性可能对应 EEG 中同一任务语义下不同试次的表征一致性问题,但这一迁移假设依赖可靠的同源分组与任务监督。可借鉴的是对比对齐思路;LLM 解码器、文本伪表征及提示词恢复目标均不能直接移植。低信噪比、被试与通道差异,以及同类试次间真实神经状态变化,可能使强制不变性抹去有用信息。一个小规模可检验实验是在固定 EEG 分类骨干与相同 Cross-subject 划分下,对比加入或不加入同任务试次对比约束的效果,并检查跨被试混杂因素;这不是本文已验证结果,已有 EEG 相关工作尚未检索确认。实验协议、消融及统计信息尚未验证。

阅读价值

值得阅读的是其将提示词反演拆解为源不变性与循环不变性,并复用 LLM 解码器、仅训练轻量逆编码器的机制;具体收益、数据需求与防御评估仍需全文核对。

来源:OpenReview · State space models · openreview.net