Bit Budget:EEG 在冻结语言先验之外增加了多少信息?
BIT BUDGET: HOW MUCH INFORMATION DOES EEG ADD BEYOND A FROZEN LANGUAGE PRIOR?
基于摘要分析。本文研究 EEG-to-text 系统生成的文本究竟包含多少来自 EEG、而非语言先验的文本特异性信息,提出校准框架 Bit Budget,将神经信号到语言的解码视为通信信道测量问题,量化冻结语言先验之外依赖输入证据的信息贡献。 核心思路是把语言生成表现与神经证据依赖分开评估:生成流畅文本不自动意味着系统利用了 EEG 中的语言信息。摘要强调校准信息测量与显式证据破坏对照,但信息估计公式、冻结先验的具体模型、EEG 表征方式及校准过程尚未验证。 作者报告,在 ZuCo corpus 上,gaze 提供了显著的 0.107 bits/token 信息下界,而所评估 EEG 表征为 0.000 bits/token,未检测到显著证据依赖。在独立的 COFETT corpus 上,同一框架测得注入的文本相关信号为 0.149 bits/token;真实 EEG 在所评估条件下仍处于 ±0.004 bits/token 范围。gaze 与注入信号对照支持该框架在这些条件下能够检出文本相关信息,但不同语料与条件的数值不能直接作为解码性能排名。 作者还报告,EEG 表征在四分类任务/会话身份解码中达到 82.1% Balanced Accuracy,说明该表征含有可解码的结构化信息,却未在当前测量中转化为可检测的 token 级语言证据。该结果不等于 EEG 完全没有语言信息,也不能直接推广至所有 EEG-to-text 系统。 复现时需核对语言先验是否保持冻结、信息下界的估计与显著性检验、证据破坏方式、注入信号构造,以及任务/会话身份分类的数据划分。被试数量、被试内或跨被试协议、训练与测试划分、消融及统计信息尚未验证。本文主要贡献是提供补充性的评估视角,而非证明某种 EEG 解码模型具有更高文本生成性能。
值得阅读的具体原因是 Bit Budget 将文本生成流畅度与对 EEG 证据的依赖分开测量,并通过 gaze 和注入信号对照检验测量灵敏度;其零值结果仍需结合全文中的校准与统计协议解释。
来源:OpenReview · EEG · openreview.net