跳到正文
OpenReview · Representation learning· Jaejun Lee; Chanyoung Chung; Hochang Lee; Sungho Jo; Joyce Jiyoung Whang·· 2023-10-08精选AI 评分73

VISTA:视觉—文本知识图谱表示学习

VISTA: Visual-Textual Knowledge Graph Representation Learning

AI 导读

基于摘要分析。该研究面向知识图谱表示学习与知识图谱补全,提出视觉—文本知识图谱(VTKGs)及方法 VISTA,将实体、关系的文本描述与实体、三元组的视觉信息纳入表示学习。贡献包括构建以图像解释三元组的基准数据集,以及使用 Transformer 联合编码和解码这些多模态知识。 核心机制:传统知识图谱以实体和关系组成的三元组表示知识,多数嵌入方法主要利用图结构,部分多模态方法进一步使用实体图像或文本。本文扩展了信息附着的位置:不仅实体可以有图像,三元组本身也可以由图像解释;实体和关系均可附带文本描述。VISTA 通过 entity encoding、relation encoding 和 triplet decoding transformers 纳入实体与关系的视觉、文本表示。具体模态融合方式、损失函数、训练流程与推理细节尚未验证。 数据与结果:作者通过汇编可视觉表达的常识知识构建新基准,使三元组具有图像解释,实体与关系具有文本语义描述。作者报告,VISTA 在真实世界 VTKGs 的知识图谱补全实验中优于所比较的先进方法;摘要未给出数据集名称、规模、划分、指标、数值及基线配置,因此无法判断提升幅度或不同证据来源的独立贡献。实验协议、消融及统计信息尚未验证。 适用边界:原论文研究对象是多模态知识图谱,而非 EEG 解码或 BCI。其机制依赖图结构、三元组及相应视觉和文本证据;现有材料未提供这些结构与 EEG 任务的具体对应关系,因此不据此推断 BCI 有效性,也不提出 EEG 复现实验。已有 EEG 相关工作尚未检索确认。复现前需核对基准与实现的开放情况,以及多模态证据的构建和评估方式。

阅读价值

值得阅读的是其将图像证据从实体扩展到三元组,并联合建模实体与关系的文本语义;作者报告的知识图谱补全优势仍需结合全文中的数据划分和对照协议核对。

来源:OpenReview · Representation learning · openreview.net