数据与复现预印本基于摘要分析
Beyond Trained Models: Compiling GNNs for a Sound Explainer Benchmark
基于摘要分析。该研究针对 GNN 解释器评估中的一个关键假设:数据中预设的 motif 不一定是训练后模型实际依赖的依据。作者提出以编译替代训练,通过 Gracr 将分级模态逻辑公式转换为 GNN 权重,并据此构建具有精确解释真值的 GracrBench。
阅读价值 · 该研究以行为由构造确定的 GNN 建立精确解释真值,值得用于核对解释器是否真正解释模型,而非仅恢复数据中预设的 motif;其形式化保证与评估细节仍需全文验证。
首次公开 2026-10-02 · 最新源版本 2026-10-02 · 首次发现 2026-10-09
展开技术分析、元数据与版本记录
基于摘要分析。该研究针对 GNN 解释器评估中的一个关键假设:数据中预设的 motif 不一定是训练后模型实际依赖的依据。作者提出以编译替代训练,通过 Gracr 将分级模态逻辑公式转换为 GNN 权重,并据此构建具有精确解释真值的 GracrBench。
核心机制是让模型复现给定逻辑公式的行为,使解释真值不再仅来自数据生成时植入的结构,而能够依据已知模型行为形式化定义并精确计算。作者称 Gracr 是首个将分级模态逻辑公式编译为 GNN 权重的编译器;其适用公式范围、编译约束及形式化保证尚未验证。
作者报告,在若干常用基准中,预设 motif 与模型实际决策依据之间的假设并不成立,例如仅凭节点度统计即可完成任务。在 GracrBench 的六项任务、十一种解释器评估中,作者报告多数解释器对间接影响,或同一逻辑公式的不同实现不够稳健。摘要未提供具体任务、解释器名单、指标数值及数据划分,实验协议、消融及统计信息尚未验证。
其主要价值是区分“恢复预设图结构”与“忠实解释模型行为”,并为解释器提供更细粒度的诊断条件。需要核对精确真值如何处理多种有效解释,以及编译模型与训练模型之间的行为和结构差异;这些差异可能限制评估结论向实际应用的外推。
平台推测(待验证):若 EEG 分析采用通道或脑区图上的 GNN,该基准可作为解释器的受控测试环境,但不能直接证明解释结果具有神经生理意义。迁移需明确图节点、边和逻辑条件如何对应 EEG 特征,并评估低信噪比、跨被试变化及通道配置变化的影响。一个可检验的小实验是在固定通道图上构造逻辑行为相同、实现不同的编译模型,比较解释器相对精确真值的表现是否稳定,再逐步加入特征噪声。已有 EEG 相关工作尚未检索确认。
- 作者:
- Steve Azzolin; Francesco Paolo Nerini; Stefano Teso; Francesco Bonchi; Bruno Lepri; André Panisson; Andrea Passerini
- 机构:
- 尚未验证
- 发表平台:
- arxiv
- 标识:
- 2610.03526
学术质量 82 / 100 · 兴趣权重 2 · 前沿观察,迁移价值待评估
- arxiv · v1 · 2026-10-02 · 预印本
数据与复现预印本基于摘要分析
RNADyn: A Benchmark for Generating and Understanding RNA Dynamics
基于摘要分析。该研究针对静态结构难以完整描述 RNA 构象变化、标准化动力学数据有限,以及轨迹生成与动力学理解通常分离的问题,提出 RNA 分子动力学(MD)基准 RNADynBench,并构建统一模型 RNADynNet,将全原子轨迹生成与动力学表征学习连接起来。
阅读价值 · 值得阅读之处在于将标准化 RNA 动力学基准与生成、表征共享骨干的模型结合,可重点核对物理约束如何改善轨迹与动力学指纹,以及防泄漏划分的具体实现。
首次公开 2026-10-02 · 最新源版本 2026-10-02 · 首次发现 2026-10-09
展开技术分析、元数据与版本记录
基于摘要分析。该研究针对静态结构难以完整描述 RNA 构象变化、标准化动力学数据有限,以及轨迹生成与动力学理解通常分离的问题,提出 RNA 分子动力学(MD)基准 RNADynBench,并构建统一模型 RNADynNet,将全原子轨迹生成与动力学表征学习连接起来。
数据与机制:作者提供了 2585 条经过质量控制、每条时长为 100 ns 的全原子 MD 轨迹,并采用防泄漏数据划分。RNADynNet 使用共享骨干,从单个构象同时支持轨迹生成与动力学指纹提取;其机制结合坐标去噪、单帧到轨迹对齐及物理约束(physical grounding)。具体网络结构、损失形式、物理约束定义与数据划分依据尚未验证。
结果:作者报告,在两个测试集上(其中包含高柔性挑战集),生成轨迹的 RMSF 相关性分别为 0.875 和 0.766;摘要未明确两个数值与各测试集的对应关系。作者还报告,单构象预测与 MD 推导的动力学具有相近的一致性,物理约束能够改善生成动力学及指纹中可恢复的物理信息。上述相关性不等同于完整轨迹精度,仍需结合正文核对指标计算、对照基线、消融与统计不确定性。
适用边界:该工作直接面向 RNA 分子动力学,而非 EEG 或 BCI。其建模依赖原子坐标与分子物理结构,不能据此推定对神经信号有效。平台推测(待验证):生成与动力学表征共享骨干的思路可供时序建模参考,但 EEG 并不具有相同的坐标监督与物理约束条件,因此暂不提出直接迁移结论。相关 EEG 工作尚未检索确认;数据获取方式、实现开放情况、实验协议、消融及统计信息尚未验证。
- 作者:
- Yiming Huang; Lennart Bastian; Hanqun Cao; Luis Vollmers; Tolga Birdal
- 机构:
- 尚未验证
- 发表平台:
- arxiv
- 标识:
- 2610.03712
学术质量 80 / 100 · 兴趣权重 2 · 前沿观察,迁移价值待评估
- arxiv · v1 · 2026-10-02 · 预印本
数据与复现预印本基于摘要分析
A multi-scenario EEG dataset for auditory attention decoding in naturalistic multi-talker environments
基于摘要分析。本研究针对现有开放听觉注意解码(Auditory Attention Decoding,AAD)EEG 数据集多采用理想化单一竞争说话者范式、难以覆盖日常交流复杂性的问题,提出 SoundBubble-EEG 数据集。其核心贡献是将注意目标设为动态说话者群体,并在多群体干扰及多种自然化场景下记录 EEG,为研究多说话者语音理解、神经语音追踪和跨场景泛化提供资源。
阅读价值 · SoundBubble-EEG 将 AAD 的研究对象扩展到动态目标说话者群体与多群体干扰,为核对现有算法在自然化多说话者环境中的适用性提供了具体数据资源,但其评估协议与基线结果尚未验证。
首次公开 2026-10-07 · 最新源版本 2026-10-07 · 首次发现 2026-10-09
展开技术分析、元数据与版本记录
基于摘要分析。本研究针对现有开放听觉注意解码(Auditory Attention Decoding,AAD)EEG 数据集多采用理想化单一竞争说话者范式、难以覆盖日常交流复杂性的问题,提出 SoundBubble-EEG 数据集。其核心贡献是将注意目标设为动态说话者群体,并在多群体干扰及多种自然化场景下记录 EEG,为研究多说话者语音理解、神经语音追踪和跨场景泛化提供资源。
作者报告,数据集包含来自 30 名参与者的超过 25 小时、128 通道高密度 EEG 记录。实验要求听者选择性关注指定的目标说话者群体,即“sound bubble”,同时面对其他多说话者干扰群体;场景包括餐厅、家庭观看电视和会议讨论。与摘要所描述的常见单一竞争说话者范式相比,该设计将声学、空间与语义变化纳入任务环境,但具体刺激构建、群体动态变化方式及注意标签定义尚未验证。
作者将该资源定位为现实声学与语义变化条件下的 AAD 基准,并认为其可能支持听觉神经科学和神经引导助听技术的发展。摘要未提供解码算法、数据划分、基线性能或跨场景泛化结果,因此不能据此认定已有方法在这些场景中的有效性,也不能将数据集发布等同于助听技术的临床验证。
复现与评估时需核对 EEG 与语音的同步及预处理方式、目标群体和个体说话者的标签粒度,以及训练与测试在被试、会话、场景和语音材料上的划分关系。数据访问条件、实验协议、消融及统计信息尚未验证;跨场景测试尤其需要明确哪些声学或语义因素发生变化,避免把不同任务难度下的指标直接比较。
- 作者:
- Shu Peng; Rui Liu; Yufei Zhang; Wenlong You; Zhige Chen; Jiachen Xi; Qiyuan Sun; Yan Liu; Kay Chen Tan; Jibin Wu
- 机构:
- 尚未验证
- 发表平台:
- arxiv
- 标识:
- 2610.09539
学术质量 77 / 100 · 兴趣权重 2 · 按原研究证据理解,不推断适用范围
- arxiv · v1 · 2026-10-07 · 预印本
数据与复现预印本基于摘要分析
RideBench: A Large-Scale Exogenous-Aware Benchmark for Ride-Hailing Time Series Forecasting
基于摘要分析。该研究针对天气、节假日和大型活动影响下的网约车时间序列预测,发布由 DiDi 市场数据合成的 Ride-Hailing 数据集,并构建外生信息感知预测基准 RideBench,以评估常规及长预测范围下现有方法的适用性。
阅读价值 · 值得阅读其对未来已知外生变量与长预测范围的评估设计,但作者报告的收益尚需结合数据划分、外生信息可用性和具体指标核对,不能直接视为 EEG/BCI 的迁移证据。
首次公开 2026-10-08 · 最新源版本 2026-10-08 · 首次发现 2026-10-09
展开技术分析、元数据与版本记录
基于摘要分析。该研究针对天气、节假日和大型活动影响下的网约车时间序列预测,发布由 DiDi 市场数据合成的 Ride-Hailing 数据集,并构建外生信息感知预测基准 RideBench,以评估常规及长预测范围下现有方法的适用性。
数据与评估:Ride-Hailing 覆盖 200 个空间区域、连续四年的半小时时间序列,包含 Weather Disturbance、Holiday Effect 和 Large-scale Event Impact 三类代表性外生场景。RideBench 设置未来一周预测与未来八周预测,后者最多包含 2,688 个预测步;评估超过 30 种方法,包括仅使用内生信息的模型、外生信息感知模型及时间序列基础模型。摘要未给出数据合成细节、训练与测试划分、具体模型名单及指标定义,这些内容尚未验证。
作者报告:在未来一周预测中,未来已知外生变量带来明显收益,尤其是在天气、节假日及大型活动场景下;但现有外生信息感知模型仍难充分捕捉复杂外部条件引发的模式变化。在未来八周预测中,现有模型难以同时兼顾低逐点误差、准确的整体趋势和可靠的近期预测。摘要未提供具体分数、对照差值或统计不确定性,不能据此量化收益或排序模型;实验协议、消融及统计信息尚未验证。
平台推测(待验证):其可借鉴价值主要在评估设计,而非已证实的 EEG 算法。假设任务日程等真正提前可知的上下文能够帮助 EEG 状态预测,可复用“内生信息与外生信息分开对照”的思路;但需改造空间区域与半小时序列的组织方式,以适配被试、通道和 EEG 时间尺度。低信噪比、跨被试差异及小数据可能削弱收益。一个可证伪的小实验是在固定跨会话划分下,对比同一预测模型使用或不使用预先确定的任务日程,核对不同预测范围的误差,并确保外生信息在预测时确实可用。该假设不等于已验证的 BCI 效果,已有 EEG 相关工作尚未检索确认。
- 作者:
- Shengsheng Lin; Jing Hu; Zhengyang Hu; Jiazheng Sun; Zichun Cao; Siwei Sun; Zhichao Zou; Enyun Yu; Dongdong Li; Xinyi Hu; Weiwei Lin
- 机构:
- 尚未验证
- 发表平台:
- arxiv
- 标识:
- 2610.11164
学术质量 76 / 100 · 兴趣权重 2 · 前沿观察,迁移价值待评估
- arxiv · v1 · 2026-10-08 · 预印本
数据与复现预印本基于摘要分析
GNN-CB: A Graph Neural Network Competition Benchmark for Human and LLM Evaluation
基于摘要分析。该研究关注 LLM 能否在真实竞赛约束下自主完成端到端 Graph Neural Network(GNN)编程任务,提出面向人类与 LLM 的竞赛基准 GNN-CB。其贡献是将多种图学习任务纳入统一自动评估流程,并提供可复现执行管线;作者将其称为首个此类竞赛基准,该优先性尚未独立核验。
阅读价值 · 值得阅读其隐藏测试集、统一评分及受限执行修复协议如何支持人类与 LLM 的 GNN 编程能力比较,但具体公平性与可复现性仍需核对全文。
首次公开 2026-10-04 · 最新源版本 2026-10-04 · 首次发现 2026-10-09
展开技术分析、元数据与版本记录
基于摘要分析。该研究关注 LLM 能否在真实竞赛约束下自主完成端到端 Graph Neural Network(GNN)编程任务,提出面向人类与 LLM 的竞赛基准 GNN-CB。其贡献是将多种图学习任务纳入统一自动评估流程,并提供可复现执行管线;作者将其称为首个此类竞赛基准,该优先性尚未独立核验。
任务与协议:GNN-CB 包含 18 个经过整理的竞赛,覆盖节点级、边级和图级预测,以及不同图类别、领域和难度层级。提交通过隐藏测试集与标准化评分进行评估。人类参与者在受控竞赛约束下完成任务;LLM 使用固定的零样本提示协议,采用 plan-then-code 范式,并允许次数受限的 execute-and-repair 循环。同一协议还支持非智能体与自主智能体评估,但摘要未说明其工具权限、执行预算及具体差异。
结果:作者报告,在所评估协议下,LLM 很少达到 Human Top 表现,且跨竞赛表现较不稳定;没有单一模型在所有任务上占优,LLM 在少数竞赛中获胜,而人类在多数任务上保持最高分。摘要未提供模型名单、各任务指标、分数或重复运行统计,因此不能量化差距,也不能将这些结论推广到其他提示与资源预算。具体数据集、训练与测试划分、人类参与者构成、消融及统计信息尚未验证。
复现与适用范围:作者表示已公开基准及评估框架,并提供自动评估基础设施、动态排行榜和可复现执行管线;环境依赖与版本固定方式仍需核对。该材料评估的是图学习编程能力,而非 EEG/BCI 任务效果。平台推测(待验证):其隐藏测试与受限执行协议可作为未来 EEG 图学习编程评估的设计参考,但需另行定义被试划分、图构建规则和工具预算,不能据此推断 LLM 具备跨被试建模能力;已有 EEG 相关工作尚未检索确认。
- 作者:
- Murad Hossen; Tasneem Selim; Gurur Gamgam; Tuga Yousif; Abderrahmane Kasmi; Ikram Aissiou; Mubaraq Onipede; Faran Taimoor Butt; Sanae Zrigui; Rosa Y. G. Paccotacya-Yanque; Ignatius Balayo; Ikram Elhouiti; Hadil Affes; Bijay Adhikari; Sargam Goyal; Muhammad Ibrahim Isah; Mohammad Idrees Bhat; Samuel Kangoni Matia; Peguy Kem-Meka Tiotsop Kadzue; Maha Trabelsi; Emmanuel Owusu; Vinit; Nour Majdoub; Tamiru Alemnew; Islem Rekik
- 机构:
- 尚未验证
- 发表平台:
- arxiv
- 标识:
- 2610.05387
学术质量 76 / 100 · 兴趣权重 2 · 按原研究证据理解,不推断适用范围
- arxiv · v1 · 2026-10-04 · 预印本
数据与复现预印本基于摘要分析
Low-Cost Sensor Calibration for Indoor Air Quality Monitoring: A Dataset, Evaluation Scenarios, and a Lightweight Model
基于摘要分析。研究针对低成本室内空气质量传感器的非线性失真、噪声与时间漂移,提出包含参考传感器测量的数据集、四类评估场景及轻量时序校准模型,旨在缓解传统严格成对校准对各部署地点共址参考传感器的依赖,并评估空间与时间异质性。
阅读价值 · 该工作将低成本传感器校准拆分为空间泛化、长期漂移与事件条件下的评估场景,值得核对其划分协议及轻量时序模型如何应对不同分布偏移,但摘要中的性能与推理成本结论尚待全文验证。
首次公开 2026-10-08 · 最新源版本 2026-10-08 · 首次发现 2026-10-09
展开技术分析、元数据与版本记录
基于摘要分析。研究针对低成本室内空气质量传感器的非线性失真、噪声与时间漂移,提出包含参考传感器测量的数据集、四类评估场景及轻量时序校准模型,旨在缓解传统严格成对校准对各部署地点共址参考传感器的依赖,并评估空间与时间异质性。
数据集覆盖五个地点、六个月的多变量室内空气质量测量,包含低成本传感器、参考传感器及上下文元数据。四类场景分别为 reference-efficient、location-transfer、long-term drift 和 event-conditioned:前两类评估空间泛化,后两类评估对渐进及突发分布偏移的稳健性。具体参考数据用量、地点划分、时间切分与事件定义尚未验证,不能将这些场景视为统一难度的测试。
模型结合输入窗口压缩、残差时序融合与特征融合,设计目标是兼顾校准能力和边缘推理成本。作者报告,在上述四类场景中均取得较强校准表现且边缘推理成本较低;摘要未提供具体指标、数值、对照基线或设备条件,损失函数、训练流程、消融及统计信息尚未验证。
平台推测(待验证):其空间迁移与时间漂移评估思路可能对应 EEG 的跨被试、跨会话分布偏移,但原任务依赖低成本与参考传感器测量,不能直接等同于 EEG 解码监督。可考虑复用窗口压缩与时序、特征融合思路,需改造通道表示、输出目标和监督方式;EEG 低信噪比、通道差异及小数据可能使压缩丢失判别信息。一个可检验的假设是:在固定训练数据量和相同跨会话划分下,比较加入与不加入窗口压缩的同一 EEG 模型,检验推理成本降低是否伴随解码性能损失。已有 EEG 相关工作尚未检索确认。
- 作者:
- Jinyong Yun; Seokho Ahn; Hyungjin Kim; Sungbok Shin; Young-Duk Seo
- 机构:
- 尚未验证
- 发表平台:
- arxiv
- 标识:
- 2610.11236
学术质量 72 / 100 · 兴趣权重 2 · 前沿观察,迁移价值待评估
- arxiv · v1 · 2026-10-08 · 预印本
数据与复现正式发表基于摘要分析
MOV-AAD: A Large-Scale Multimodal Dataset for Auditory Attention Decoding During Moving Conversations
基于摘要分析。该研究针对听觉注意解码(AAD)常在静态、简化语音场景中评估、与日常聆听条件不匹配的问题,提出 MOV-AAD 数据集。其核心贡献是结合动态移动的对话声源、64 通道 EEG、同步生理记录及注意投入的行为测量,为自然聆听条件下的选择性听觉注意研究提供数据资源。
阅读价值 · MOV-AAD 将动态移动的对话声源、64 通道 EEG 与同步生理记录结合,值得用于核对静态场景下的 AAD 方法能否适应更自然的空间动态,但其基准协议与实际解码效果尚未验证。
首次公开 2026-10-03 · 最新源版本 2026-10-03 · 首次发现 2026-10-09
展开技术分析、元数据与版本记录
基于摘要分析。该研究针对听觉注意解码(AAD)常在静态、简化语音场景中评估、与日常聆听条件不匹配的问题,提出 MOV-AAD 数据集。其核心贡献是结合动态移动的对话声源、64 通道 EEG、同步生理记录及注意投入的行为测量,为自然聆听条件下的选择性听觉注意研究提供数据资源。
数据与范式:摘要列出的同步记录包括眼动、呼吸、皮肤电反应、心率、外周血氧饱和度、体温、身体运动及光电容积描记(photoplethysmography)。这些模态支持研究神经与生理信号中的注意和聆听努力标记;动态声源则为分析空间变化条件下的 AAD 提供场景。作者将其描述为大规模、生态效度更高的数据集,但摘要未提供被试数、记录时长或具体规模依据。
研究用途与证据边界:作者提出 MOV-AAD 可支持真实空间动态下的稳健 AAD、多模态注意建模、聆听努力及被试间神经反应研究。摘要未给出具体解码模型、评估划分、基线或性能指标,因此这些属于数据集的预期用途,而非已经验证的性能提升。
复现与核对重点:需从全文和数据说明中确认声源运动与对话任务的设计、注意目标及行为标签的获取方式、多模态时间同步和伪迹处理,以及数据访问条件。被试内、跨被试和跨会话评估是否提供、各模态对解码的增益及其统计可靠性尚未验证;实验协议、消融及统计信息尚未验证。
- 作者:
- Xiaomin He; Vishal Choudhari; Tristan J. Spratt; Aarya Raghavan; Richard T. Lee; Nima Mesgarani
- 机构:
- 尚未验证
- 发表平台:
- Proc. Interspeech 2026 [Long Track] (Best Student Paper Award)
- 标识:
- 10.21437/interspeech.2026-3556 · 2610.04180
学术质量 71 / 100 · 兴趣权重 2 · 按原研究证据理解,不推断适用范围
- arxiv · v1 · 2026-10-03 · 正式发表
数据与复现预印本基于摘要分析
Benchmarking Time Series Foundation Models for Load Forecasting Under Covariate Uncertainty
基于摘要分析。本文研究时间序列基础模型(TSFM)在真实运行条件下进行短期负荷预测(STLF)的有效性,重点考察未来协变量的可用性与质量如何影响预测表现。研究在三个真实负荷预测数据集上,对四个从零训练(TFS)的模型与四个 TSFM 进行基准评估,覆盖未来协变量信息不同的运行场景。
阅读价值 · 该基准将未来协变量的可用性与预测噪声纳入负荷预测评估,值得用于核对基础模型的性能优势是否依赖实际部署中难以获得的高质量协变量。
首次公开 2026-10-05 · 最新源版本 2026-10-05 · 首次发现 2026-10-09
展开技术分析、元数据与版本记录
基于摘要分析。本文研究时间序列基础模型(TSFM)在真实运行条件下进行短期负荷预测(STLF)的有效性,重点考察未来协变量的可用性与质量如何影响预测表现。研究在三个真实负荷预测数据集上,对四个从零训练(TFS)的模型与四个 TSFM 进行基准评估,覆盖未来协变量信息不同的运行场景。
作者报告,在未来协变量可获得或能够准确预测的条件下,Chronos-2 在零样本和微调设置中均持续达到作者所称的最先进性能;随着协变量预测噪声增大,其性能下降,而 TimesNet 在严重协变量不确定性下表现出更强的鲁棒性。摘要未提供具体指标、数值、数据集名称、划分方式、预测时距或完整模型名单,因此不能量化优势,也不能将不同条件下的结论直接等同于部署收益。
本研究的主要阅读价值在于将模型比较与未来协变量质量联系起来,而不只评估理想输入条件下的预测能力。需进一步核对协变量的类型、预测与噪声构造方式、各模型接入协变量的方式,以及零样本、微调和从零训练设置之间的比较条件。实验协议、消融及统计信息尚未验证。
平台推测(待验证):这一评估思路可能用于 EEG 预测中依赖外部上下文的模型,但前提是任务明确包含预测时可获取、且可能存在误差的协变量。可复用的是按协变量可用性与噪声水平组织评估的框架,需改造的是 EEG 目标、上下文输入和数据划分;低信噪比、跨被试差异及小数据可能使模型更依赖不稳定上下文。一个可检验的小实验是在固定 EEG 预测任务与划分下,对同一模型比较无协变量、真实可获取协变量及受控扰动协变量三种条件。该迁移假设不代表已证实的 EEG/BCI 效果,已有 EEG 相关工作尚未检索确认。
- 作者:
- Tomas Kaljevic; Ivan Arzola; Yu Zhang
- 机构:
- 尚未验证
- 发表平台:
- arxiv
- 标识:
- 2610.07232
学术质量 70 / 100 · 兴趣权重 2 · 前沿观察,迁移价值待评估
- arxiv · v1 · 2026-10-05 · 预印本