通用图异常检测是否需要真实世界训练数据?
Is Real-World Training Data Necessary for Generalist Graph Anomaly Detection?
基于摘要分析。研究关注通用图异常检测(Generalist GAD)的训练数据短缺:目标是在任意未见图上检测异常,无需重新训练或微调。作者提出异常图自动合成方法 AG-FORGE,并开发拓扑—语义协同模型 TS-GGAD 及面向大规模合成训练的课程学习策略,探索仅依赖合成数据训练的可行性。 核心机制上,AG-FORGE 用于自动生成异常图;TS-GGAD 则结合互补的拓扑异常证据与语义异常证据。摘要未说明异常注入方式、语义特征来源、模型结构、损失函数或课程难度的定义,这些实现细节尚未验证。 作者报告,在其通用 GAD 评估中,合成数据训练可达到与真实世界数据训练相当的性能,但现有方法的容量限制了进一步提升;作者据此引入 TS-GGAD 与课程学习。作者报告,仅使用 AG-FORGE 生成的数据训练的 TS-GGAD,在 14 个真实世界数据集上显著优于所比较的先进方法。摘要未提供数据集名称、指标、分数、训练与测试划分、基线配置及显著性检验方法,实验协议、消融及统计信息尚未验证。因此,尚不能判断提升分别来自数据规模、模型机制还是课程学习,也不能将标题中的问题概括为真实训练数据普遍不必要。 平台推测(待验证):若 EEG 被表示为带节点特征的连接图,合成拓扑与特征异常可能为低标注异常检测提供预训练数据;这依赖图构建方式及合成异常与真实生理变化的一致性。可复用候选包括图生成流程和拓扑—语义证据整合,需改造通道定义、连接估计与节点特征。低信噪比、跨被试差异、通道变化及小样本可能使模型学习到伪迹或合成规律,而非目标异常。一个可检验的小实验是固定 EEG 图构建与跨被试划分,比较合成数据预训练和真实数据训练的同一模型,并分别核对生理异常与伪迹检测表现;已有 EEG 相关工作尚未检索确认。
值得核对合成异常图的生成机制,以及拓扑—语义协同与课程学习能否共同改善未见图上的泛化;摘要提供了真实数据集验证的作者报告,但具体协议与增益尚未验证。
来源:arXiv · 学习目标与优化 · arxiv.org