读取而非操控:利用 router logits 实现 MoE 视觉语言模型的多模态安全
Reading, Not Manipulating: Leveraging Router Logits for Multimodal Safety in MoE Vision-Language Models
基于摘要分析。研究针对视觉与文本交互产生有害意图的组合式安全风险,提出读取 MoE 视觉语言模型的 router logits 来识别不安全请求,而非通过修改模型内部状态引导行为。核心贡献是一个轻量安全检测器,在提示预填充(prompt prefill)阶段读取路由信号,于生成前进行检测,不修改模型参数或专家路由。 机制与对照:作者认为,提示干预、监督微调和基于路由的专家引导在不同模型与评估分布上的收益不一致,并可能因过度拒绝而带来安全性与效用的权衡。本文转而将模型自然产生的路由状态作为诊断特征,连接外部安全机制。摘要未说明读取哪些层或 token 的 logits、如何聚合特征、检测器形式及训练监督来源,这些实现细节尚未验证;不干预路由本身也不等同于已证明不存在误拒绝或额外计算开销。 结果与边界:作者报告,在 Qwen3-VL 和 Kimi-VL 上,该检测器减少了 HoliSafe benchmark 的安全错误,并泛化到具有不同安全模式的分布外 benchmark,包括 MISHard 和 MM-SafetyBench。摘要未提供具体数值、数据划分、对照基线、阈值设置或误拒绝指标,因此无法量化收益,也不能确认不同模型及分布之间的结果是否可直接比较。实验协议、消融及统计信息尚未验证。 平台推测(待验证):可借鉴的研究思路是将内部路由信号用于外部诊断,而非直接操控模型;但本研究验证的是多模态请求安全,不是 EEG/BCI 性能。迁移到 EEG 场景需先确认模型具备可读取的 MoE 路由状态,并验证这些信号反映的是目标风险而非被试、通道或采集条件差异。已有 EEG 相关工作尚未检索确认,当前不宜将其视为已验证的 BCI 方法。
值得核对 router logits 能否作为不干预专家路由的安全诊断信号,尤其是其跨评估分布表现及安全错误与误拒绝之间的权衡;摘要中的效果仍需全文实验支持。
来源:arXiv · 架构与算子 · arxiv.org