使用冻结 LLM 的放射学报告生成中视觉表征的双向学习
基于摘要分析。该研究针对放射学报告生成(R2Gen)中视觉表征难以被 LLM 有效解释的问题,提出双向学习框架:不仅让图像表征支持报告生成,还要求给定真实报告时,LLM 能生成相应视觉表征,以改善视觉与语言之间的对齐。 核心机制包含视觉到文本、文本到视觉两条学习方向。前者要求视觉表征帮助冻结 LLM 生成接近真实报告的文本;后者联合训练新的报告文本编码器,使冻结 LLM 能参与从报告到视觉表征的生成。此外,图像重建任务用于促使表征保留输入放射学图像的核心特征。摘要未给出具体损失形式、模块结构与训练流程,不能据此确定各目标如何组合。 作者报告,学习到的视觉表征与 LLM 词嵌入空间具有更好的对齐,并在语言准确性与临床效用评估中达到其所称的 SOTA;作者同时称该框架不增加推理阶段计算开销。摘要未提供数据集、划分、对照基线、指标名称或数值,实验协议、消融及统计信息尚未验证。“临床效用”也不能直接等同于临床部署验证。作者表示代码将公开,当前发布状态尚未验证。 平台推测(待验证):迁移假设是,可由文本反向生成的信号表征,可能更易被冻结 LLM 用于 EEG 描述生成。该机制依赖成对图像与报告监督;用于 EEG 时,需将图像编码与重建模块改为时序信号模块,并获得与信号内容对应的文本监督。可复用的是双向表征约束,而非直接沿用视觉模块。EEG 的低信噪比、跨被试差异、通道配置变化及小规模配对数据,可能使反向生成只学到文本语义而忽略信号细节。一个可证伪的小实验是在固定跨被试划分、相同冻结 LLM 与训练预算下,对比单向学习和加入反向约束的方案,检验文本生成质量与信号表征保真度能否同时改善。已有 EEG 相关工作尚未检索确认。