跳到正文
OpenReview · Representation learning· David Ming Segura; Jeremy Goumaz; Bojana Ranković; Philippe Schwaller·· 2026-05-31AI 评分69

用于 SMILES 与自然语言联合表示学习的双语义化学嵌入模型

Bi-semantic Chemical Embedder for Joint Representation Learning of SMILES and Natural Language

AI 导读

基于摘要分析。该研究针对化学领域适应预训练可能过度拟合化学语法、遗忘原有语言语义能力的问题,提出 CheMatE,在同一表示空间中联合编码 SMILES 所表达的分子结构与领域自然语言。主要研究对象是化学表示学习,而非 EEG 或 BCI。 CheMatE 以 ModernBERT 为骨干,采用顺序式两阶段训练:先进行持续掩码语言建模(MLM),再以 Multiple Negative Ranking Loss(MNRL)开展 Matryoshka 对比学习。第一阶段使用作者从 FineWeb 和 ChemPile 构建、整理的含 SMILES 标注的长上下文科学文档语料;摘要分别给出 10.4B 和 11.5B tokens 的规模,但具体组成与处理流程尚未验证。第二阶段使用从原训练语料中通过算法生成的合成 SMILES-text 配对数据,以学习分子结构与文本语境的联合表示。配对生成规则、负样本构造及 Matryoshka 的具体配置尚未验证。 作者报告,在分子性质预测与科学语言理解等下游任务上,定制语料与上述顺序训练策略产生了可迁移的表示,并相对专用化学模型和通用编码器基线取得有竞争力的表现。摘要未提供具体任务、数据划分、基线名称或指标数值,因此尚不能量化性能提升,也不能据此确认灾难性遗忘得到多大程度的缓解。实验协议、消融及统计信息尚未验证。 复现时需核对语料筛选与 SMILES 标注方式、合成配对质量、两阶段训练配置,以及原有语言能力保留的评估方法;模型权重、数据和代码的可获得性尚未验证。该方法依赖文本化分子表示及结构—语言配对监督,材料未提供其与 EEG 信号结构的具体对应关系,不据此推断 BCI 有效性或提出 EEG 复现实验。

来源:OpenReview · Representation learning · openreview.net