跳到正文
OpenReview · EEG·· 27 天前精选AI 评分78

BrainBench:面向全面 EEG 理解的大语言模型基准评估

BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding

AI 导读

基于摘要分析。本文研究大语言模型(LLMs)能否支持全面的 EEG 理解,而非仅完成孤立的解码任务或特定系统演示,并提出统一的指令条件化评估基准 BrainBench。其核心贡献是将理解分析指令、处理生理信号、提取定量证据及形成有科学依据的结论纳入同一评估框架。 基准包含 Foundational Analysis、Sleep Assessment、Neurocognitive Assessment 和 Physiological Integration 四个子集。作者报告,这些子集覆盖 17 个数据集、172 项任务及超过 4K 个真实数据实例。系统输入为分析指令、EEG 记录及可选的其他生理信号,需执行指定分析并生成具有科学依据、可核验的输出。摘要未说明实例构建方式、数据划分、具体数据集名称及各类任务的评分规则,相关协议尚未验证。 作者报告,在自主代码执行与结构化智能体分析两种范式下,对 13 个代表性 LLMs 进行了超过 100K 次执行评估;结果在模型、子集、难度级别与执行范式之间存在明显差异。作者据此认为,EEG 分析能力不仅取决于基础模型,也取决于模型如何被组织和执行。摘要未提供具体分数、指标或模型排名,因此不能判断哪种模型或执行范式更优,也不能将这些结果等同于 EEG 解码精度或 BCI 在线性能。 阅读与复现时应重点核对:科学结论的可核验标准、代码执行结果与文字解释的评分关系,以及两种范式下工具权限、计算预算和错误处理是否具有可比性。实验协议、消融及统计信息尚未验证;基准与评估实现的获取条件也未在所给材料中说明。该工作主要评估 LLMs 对 EEG 分析流程的综合支持能力,并非提出新的 EEG 解码模型。

阅读价值

BrainBench 将 EEG 理解评估扩展到指令执行、信号分析与可核验科学结论,值得核对其任务设计及评分协议,尤其是如何区分模型能力与执行框架带来的影响。

来源:OpenReview · EEG · openreview.net