GNN-CB:用于人类与 LLM 评估的图神经网络竞赛基准
GNN-CB: A Graph Neural Network Competition Benchmark for Human and LLM Evaluation
基于摘要分析。该研究关注 LLM 能否在真实竞赛约束下自主完成端到端 Graph Neural Network(GNN)编程任务,提出面向人类与 LLM 的竞赛基准 GNN-CB。其贡献是将多种图学习任务纳入统一自动评估流程,并提供可复现执行管线;作者将其称为首个此类竞赛基准,该优先性尚未独立核验。 任务与协议:GNN-CB 包含 18 个经过整理的竞赛,覆盖节点级、边级和图级预测,以及不同图类别、领域和难度层级。提交通过隐藏测试集与标准化评分进行评估。人类参与者在受控竞赛约束下完成任务;LLM 使用固定的零样本提示协议,采用 plan-then-code 范式,并允许次数受限的 execute-and-repair 循环。同一协议还支持非智能体与自主智能体评估,但摘要未说明其工具权限、执行预算及具体差异。 结果:作者报告,在所评估协议下,LLM 很少达到 Human Top 表现,且跨竞赛表现较不稳定;没有单一模型在所有任务上占优,LLM 在少数竞赛中获胜,而人类在多数任务上保持最高分。摘要未提供模型名单、各任务指标、分数或重复运行统计,因此不能量化差距,也不能将这些结论推广到其他提示与资源预算。具体数据集、训练与测试划分、人类参与者构成、消融及统计信息尚未验证。 复现与适用范围:作者表示已公开基准及评估框架,并提供自动评估基础设施、动态排行榜和可复现执行管线;环境依赖与版本固定方式仍需核对。该材料评估的是图学习编程能力,而非 EEG/BCI 任务效果。平台推测(待验证):其隐藏测试与受限执行协议可作为未来 EEG 图学习编程评估的设计参考,但需另行定义被试划分、图构建规则和工具预算,不能据此推断 LLM 具备跨被试建模能力;已有 EEG 相关工作尚未检索确认。
值得阅读其隐藏测试集、统一评分及受限执行修复协议如何支持人类与 LLM 的 GNN 编程能力比较,但具体公平性与可复现性仍需核对全文。
来源:arXiv · 架构与算子 · arxiv.org