跳到正文
10月3日周六
  1. arXiv · 泛化与分布偏移81

    SIFT:分布偏移下思维链推理的稳健元忠实性验证

    基于摘要分析。本研究关注 Chain-of-Thought(CoT)忠实性检测器在分布偏移下能否保持一致判定,将“元忠实性”定义为:对保持真实忠实性不变的推理轨迹变换,检测器应返回相同结论。作者提出压力测试协议 FaithShift,以及结合跨环境不变性训练目标和带认证保证的弃权机制的隐藏状态轨迹检测器 SIFT。 理论方面,作者提出三项结果:仅使用干预—响应特征的检测器,无法区分具有相同特征表现的忠实机制与附带现象机制;依赖偏移敏感特征的检测器,其不变性违反率不受分布内准确率保证;渐近的认证选择性风险保证可支持有把握的弃权。这些结论的假设、证明条件及有限样本适用性尚未验证。 作者报告,在涵盖十类偏移轴、14,996 条轨迹、四个领域和八个模型的评估中,所考察的既有检测器均出现至少 0.15 的 AUROC 差距,具体迁移划分与参照条件需查正文。作者报告,超过 80% 的检测不稳定性来自随机种子变化,而非分布偏移,未支持其预注册的“偏移归因违反率超过 0.25”预测。 作者报告,相对最佳单随机种子基线,SIFT 将不变性违反减少 64%;但采用四随机种子集成后,任一检测器与 SIFT 的差距缩至 0.01,在匹配覆盖率时未显示统计显著差异(p=0.21),且 SIFT 需要 51% 的弃权率。因此,应同时核对稳定性、覆盖率与选择性风险,不能仅凭违反率下降判断整体优势。作者还报告,跨模型迁移表现从同模型家族、跨家族到开放权重模型迁移至 API 模型逐步下降,多模型训练可部分缓解。 研究价值主要在于审计方法及其反直觉对照,而非已验证的 EEG/BCI 增益。隐藏状态可获取性、忠实性真值与保持真值的变换如何构造、随机种子的作用环节,以及实验协议、消融及统计信息尚未验证;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的具体原因是作者将 CoT 忠实性检测器自身的稳定性纳入审计,并报告随机种子集成显著缩小 SIFT 的优势,为区分分布偏移、检测方差与弃权成本提供了可核对的对照。

10月2日周五
  1. arXiv · 泛化与分布偏移79

    超越随机划分:在化学与生物学驱动的分布偏移下评估药物–靶标亲和力模型

    基于摘要分析。研究考察药物–靶标亲和力(DTA)预测中,评估所采用的分布偏移是否会改变模型架构的优劣排序。其贡献是对化学结构、蛋白质靶标及二者同时变化的外推情境进行受控比较,检验单一划分下的模型选择能否适用于其他部署情境。 作者从 ChEMBL 与 BindingDB 整理了 718,800 个唯一药物–蛋白质配对,将 Morgan-fingerprint + protein-CNN 基线与 12 种受控架构进行比较;后者组合四种药物表征与三种 ESM-2 交互模式。摘要未给出各表征和交互模式的具体实现、训练损失及划分构造细节。 作者报告,在 scaffold OOD 与 fingerprint-cluster OOD 下,平均验证 RMSE 分别为 0.950 和 0.945;在 protein-cluster OOD 与 dual OOD 下,分别升至 1.299 和 1.321。两种化学偏移下的模型排名较一致(tau = 0.79),但 protein OOD 与 scaffold OOD 的排名一致性降至 tau = 0.39,dual OOD 与 scaffold OOD 则呈负向关系(tau = -0.55)。这些数值分别对应不同评估分布,不能视为同一测试条件下的直接性能比较;亲和力标签单位、变换及聚合细节尚未验证。 作者报告,留出评估、重复随机种子、考虑分组的 bootstrap 分析以及样本量匹配对照支持同一结论:架构选择依赖外推类型,而不只依赖平均误差或训练集规模。全文中的实验协议、消融及统计信息尚未验证,尤其需要核对分组规则、各划分样本量和排名不确定性。 平台推测(待验证):可迁移到 EEG/BCI 的是评估原则,而非这些 DTA 架构本身。假设被试、会话或采集设备的变化也可能改变模型排名,可在同一 EEG 数据集上对固定候选模型分别进行被试内与跨被试评估,并以被试为单位估计排名不确定性。小样本、低信噪比和通道差异可能使排名更不稳定;原领域结果不构成 EEG 有效性证据,相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其分布偏移评估设计:作者报告化学偏移与蛋白质偏移可改变甚至逆转模型排名,提示架构选择应与预期部署场景匹配,而非仅依据单一划分的误差。