跳到正文
OpenReview · EEG·· 22 天前精选AI 评分75

RLE-Reasoner:通过反事实诊断与诊断引导修复,基于互补 EEG/EOG 证据构建可信情绪推理

RLE-Reasoner: Building Trustworthy Emotion Reasoning from Complementary EEG/EOG Evidence through Counterfactual Diagnosis and Diagnosis-Guided Repair

AI 导读

基于摘要分析。研究针对多模态大语言模型(MLLMs)在情绪判断中可能生成流畅、却不符合实际生理信号的解释,提出 RLE-Reasoner“构建—诊断—修复”框架,将情绪推理与可核验的 EEG/EOG 响应证据关联。 构建阶段,RLE-MLLM 使用独立的 EEG/EOG 编码器、Complementarity-Aware Response Fusion(CARF)与生理前缀,完成七分类情绪预测,并生成结构化生理证据和自然语言解释。从原始信号独立提取的七项属性用于监督证据字段,不作为模型输入;这些属性的文字化描述提供解释训练目标。诊断阶段,RLE-Eval 通过受控替换真实 EEG/EOG 记录,检验生成证据是否随当前信号变化。修复阶段,RLE-PostTrain 将诊断转化为 GRPO 奖励,鼓励正确的生理描述及对证据变化的响应。具体属性、信号替换规则及奖励形式尚未验证。 作者报告,在包含十二名被试、5,040 个试次、留出 1,260 个测试试次的数据集上,RLE-MLLM 14B 的七分类跨被试情绪 Accuracy 为 66.52%,匹配条件下的生理状态 Accuracy 为 62.08%。作者报告,后训练使总体生理依据准确率由 63.84% 升至 74.15%,状态 Macro-F1 由 46.21% 升至 58.10%,匹配条件下的情绪 Accuracy 由 66.52% 变为 66.66%。这些指标对应不同评估对象,不能互换;匹配条件及总体指标的具体定义需核对全文。作者还报告,在依据所提供生理参考状态评估自由文本的盲法人工评审中,一致性由 58.33% 升至 69.06%。 其核心方法价值在于将解释的信号依赖性作为可诊断、可优化的目标,而不只考察情绪分类表现。摘要结果主要支持生理依据与解释一致性的改善,并不等同于验证情绪判断本身的真实性。仍需核对属性提取可靠性、跨被试划分、受控替换是否引入额外分布变化,以及人工评审规模与一致性。数据集名称、预处理、对照基线、消融、统计信息及代码可用性尚未验证。

阅读价值

值得阅读的具体原因是其通过受控替换 EEG/EOG 信号检验解释是否依赖当前生理证据,并将诊断用于后训练修复;作者报告解释一致性改善,但诊断有效性与完整评估协议尚需全文核对。

来源:OpenReview · EEG · openreview.net