跳到正文
arXiv · 表征与预训练· Alfred Nilsson; Joel Lapin; Samuel H. Payne; Mathias Wilhelm; Lukas Käll·· 4 天前精选AI 评分80

dIon:基于碎裂不变性的串联质谱自监督学习

dIon: Fragmentation-Based Invariance for Self-Supervised Learning of Tandem Mass Spectra

AI 导读

基于摘要分析。该研究针对肽串联质谱的无标签表征学习,利用前体属性(质量与电荷)和碎片离子证据之间的物理关系构造不变性,提出 dIon,以改善肽的 de novo sequencing(从头测序)并学习肽相似性表征。 机制上,dIon 改造 DINO 框架,通过两个潜在预测任务恢复干净的教师表征:第一项从混合质谱中预测,以前体作为选择查询,建立前体信息与碎片离子证据的关联;第二项从部分质谱中预测,同时隐去前体信息,旨在防止表征仅依赖前体属性。作者报告,机制探针支持这两种作用,消融结果显示完整目标表现最佳;具体损失形式、混合与部分谱构造、教师更新方式尚未验证。 作者报告,在相同端到端训练条件下,相比从头训练,dIon 初始化使留出的 MassIVE-KB 和 Kingdoms 测试集上的肽测序 Precision 分别提高 5.5 和 8.4 个百分点;采用更大的有监督训练语料时,分别提高 2.3 和 4.8 个百分点。在相同贪心解码协议下,作者报告所得模型在多物种 Kingdoms 语料上超过全监督的先进 de novo sequencing 模型。作者还报告,无肽序列标签时,dIon 相比其他学习模型形成较强的原生肽相似性几何;经过有限的肽标签监督适配后,在其全部表征基准上获得最佳检索与配对判别表现。具体划分、基线、指标定义及统计信息尚未验证,不能将这些结果直接视为跨数据集泛化证据。 平台推测(待验证):其可借鉴之处是“辅助属性引导选择+隐去属性迫使利用信号”的互补自监督设计。迁移到 EEG 的假设是,若存在与目标信号成分可靠关联的查询信息,可尝试减少模型对元信息的捷径依赖;但质谱的前体—碎片物理关系不能直接替换为被试或通道身份。可复用潜在教师预测思路,需重设计混合、遮蔽和查询语义;低信噪比、跨被试差异、通道变化及小数据可能破坏对应关系。小规模可证伪实验可在固定跨被试划分下,对照完整双任务、单任务与无预训练初始化,核查收益是否仍存在。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 dIon 如何通过互补的潜在预测任务同时利用前体信息并抑制对该信息的捷径依赖,以及其初始化收益在相同端到端训练与解码协议下是否稳健。

来源:arXiv · 表征与预训练 · arxiv.org