跳到正文
OpenReview · State space models·· 2026-09-09精选AI 评分73

学习文本条件化的状态空间递推以验证多模态医学逻辑深度伪造

Learning Text-Conditioned State-Space Recurrence for Multimodal Medical Logical Deepfake Verification

AI 导读

基于摘要分析。研究针对生成医学图像在视觉上合理、却与配套文本矛盾的问题,将此类图文对称为多模态医学逻辑深度伪造,并提出 Multimodal Bilateral Consistency Network(MM-BCNet)进行防御性一致性验证。主要贡献是在视觉状态空间递推内部引入文本条件,而非仅凭图像判断伪造或依赖全局视觉自注意力。 核心模块 Text-Conditioned Vision Mamba(TC-VMamba)利用每个局部视觉 token 与全局文本表示,生成选择性状态空间参数 Δ_i、B_i 和 C_i,使文本直接参与 selective scan 的参数化。作者将其描述为无需扩展 token、面向高分辨率视觉序列的线性复杂度跨模态递推。单查询 Semantic-Guided Affinity 模块提供空间先验;Seeing Before Reasoning 训练安排先学习视觉取证线索,再进行多模态微调。具体损失、参数生成方式与复杂度测量条件尚未验证。 作者构建了包含 Semantic Misalignment 与 Visual Inpainting 的合成基准,采用按来源分组的数据划分,并提供生成掩码用于编辑区域定位。需区分两个目标:定位图像被编辑的位置,并不等同于确认图文存在语义矛盾。作者报告,相较基线,MM-BCNet 在一致性分类、定位和未见生成器上的 Accuracy 均有改善;摘要未提供具体数值、基线名称或详细评估协议,数据规模、消融及统计信息尚未验证。 平台推测(待验证):其可供 EEG 研究考察的是“上下文直接调制状态空间递推参数”的机制,而非医学图像检测结果本身。假设任务说明或刺激文本能够稳定对应 EEG 时序中的任务语义,可复用条件参数生成思路,但需改造视觉 token 编码与空间先验,并依赖可靠的文本—信号配对监督。低信噪比、跨被试差异、通道变化和小数据可能使条件分支学习文本捷径。一个可证伪的小实验是在固定划分与训练预算下,对比无文本、正确文本和打乱文本条件的状态空间模型;若正确文本没有稳定增益,则不支持该迁移假设。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其将文本直接用于选择性状态空间参数生成的机制,以及来源分组划分下的一致性验证结果,但其医学图文效果尚不能作为 EEG/BCI 有效性的证据。

来源:OpenReview · State space models · openreview.net