跳到正文
arXiv · 学习目标与优化· Shrihari Dumbre; Bikash Santra·· 4 天前AI 评分68

用于全切片图像胃腺癌分类的多模态知识蒸馏

Multimodal Knowledge Distillation for Gastric Adenocarcinoma Classification from Whole-Slide Images

AI 导读

研究针对全切片图像(WSIs)的胃腺癌(GA)组织病理亚型分类,提出多模态知识蒸馏(MKD)框架:训练时利用图像与诊断文本,推理时由学生模型仅凭图像完成分类。基于摘要分析,尚未取得论文全文。 核心机制是将每张 WSI 表示为图像块集合,并配对切片级诊断描述;预训练 WSI 图像编码器与临床文本编码器通过 Low-Rank Multimodal Fusion(LMF)融合。教师模型学习用于亚型分类的图文联合表示,学生模型通过知识蒸馏获得图像单模态推理能力。该设计将跨模态信息利用放在训练阶段,以避免推理时依赖诊断文本;具体蒸馏目标、图像块聚合方式、编码器冻结或微调策略尚未验证。 作者报告,在 PatchGastric benchmark 上,相较其所称的最先进方法,平均 Accuracy 至少提高 3.35%;摘要未明确该百分数代表相对提升还是百分点差值,也未提供具体基线、数据划分及均值计算方式,因此不能据此直接比较不同评估协议。作者说明该框架不依赖 transformer-based fusion、多任务学习或大语言模型,这不等同于所有编码器均不含 transformer。实验协议、消融及统计信息尚未验证;计算效率仍需核对实际训练与推理开销。摘要提供了代码仓库,复现仍需确认数据访问、预训练权重及运行配置。 平台推测(待验证):这一训练时多模态、推理时单模态的机制可能用于 EEG 与同步辅助信息配对的分类任务,假设辅助信息能提供 EEG 单独难以学习且测试时不直接可用的监督。可复用 LMF 与教师—学生框架,但需改造 EEG 编码器、片段聚合及配对方式;低信噪比、跨被试差异、小数据及训练文本与标签过度绑定均可能使收益无法迁移。可在固定 Cross-subject 划分下,以同一 EEG 学生模型比较仅 EEG 训练、真实配对辅助信息蒸馏与打乱配对蒸馏,检验增益是否依赖有效跨模态对应。相关 EEG 工作尚未检索确认。

来源:arXiv · 学习目标与优化 · arxiv.org