跳到正文

算法、任务与模态

Calibration 最新动态

Calibration 研究索引;按可核对的标签归档,不以热度评价质量。

26 条精选近 30 天 22 条共收录 26 条

更新

精选归档 · 第 2 页

10月3日周六第 21–26 条
  1. arXiv · 学习目标与优化77

    用于 LLM 不确定性量化的释义感知评分保形预测

    基于摘要分析。该研究针对 LLM 不确定性量化对语义保持改写不稳定的问题,提出释义感知评分框架:利用 LLM 隐藏状态训练轻量代理模型,并聚合多个释义版本的预测,构造逐标签非一致性分数,以改善保形预测在改写条件下的稳定性。 核心机制是将学习得到的代理评分与释义聚合接入保形校准。作者指出,在分数满足可交换性的条件下,校准保留边际覆盖保证;若仅测试数据被改写,还需要释义生成流程满足额外的分布对齐条件。该保证不能直接解读为任意改写、任意分布偏移下均有效,具体条件及其可检验性尚需全文核对。 作者在七个多项选择 QA 基准及多个模型家族上评估三种设置:normal 不改写校准集和测试集,fully reworded 同时改写两者,semi-reworded 仅改写测试集。作者报告,方法在这些设置下生成较紧凑的预测集,经验覆盖率通常接近名义目标,包括仅测试集改写的设置;摘要未给出具体覆盖率、预测集大小或基准名称。作者报告的消融结果表明,预测集大小的主要缩减来自学习得到的代理模型,而释义增强训练和推理时聚合进一步改善改写稳定性。 复现需核对代理模型的监督来源与训练划分、释义生成流程、聚合规则、校准样本构造及额外分布对齐条件。摘要提供了代码地址,但代码内容、实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可借鉴之处是通过任务含义保持的变换聚合评分,再进行保形校准;但自然语言释义不等同于 EEG 信号增强。若迁移至 EEG 分类,需要先验证增强是否保持类别语义,并改造特征代理与聚合模块;低信噪比、通道变化及跨被试差异可能破坏分数可交换性。可在固定被试内划分上,比较无增强、校准与测试均增强、仅测试增强三种条件下的经验覆盖率和预测集大小。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其对测试集单独改写时覆盖保证的分布对齐条件,以及代理模型与释义聚合对预测集大小和稳定性的不同贡献。

9月17日周四
  1. OpenReview · EEG77

    跨被试 EEG 到图像检索的表征、归一化与序贯校准

    基于摘要分析。该研究针对 EEG-to-image retrieval 的跨被试部署问题:源被试训练时可用的被试特异性归一化统计,在未见被试冷启动时不可直接获得。作者提出 Representation-Normalization-Sequential Calibration(RNSC)框架,将共享表征学习、源被试归一化与未见被试校准协调到同一检索空间中。 机制上,RNSC 使用共享且不依赖被试身份的视觉参照;EEG 编码器先对时间结构进行因子化处理,再进行通道语义混合,并在潜在编码之后聚合重复试次。源训练阶段在被试标准化坐标中优化 EEG 潜在表征;部署阶段结合有限的源先验与过去的无标签目标 EEG,序贯估计目标统计矩。摘要明确采用严格的 predict-before-update 协议,即先预测、后更新统计量,但具体估计公式、先验构造及更新规则尚未验证。 作者报告,在 THINGS-EEG2 的被试内(Within-subject)200-way 检索中,共享表征取得 93.67% Top-1 和 99.36% Top-5,并称其达到该设置下的最佳水平;完整 RNSC 在跨被试(Cross-subject)评估中取得 48.10% Top-1 和 76.34% Top-5。摘要未明确跨被试结果的候选集规模,两个协议下的数值不宜直接比较;具体数据划分、重复试次聚合条件与对照基线尚需全文核对。 作者称通过受控消融、潜在空间几何诊断和冷启动分析,区分了表征学习、训练时归一化与序贯目标统计估计的互补作用。复现时应重点核对目标 EEG 的到达顺序、预测与更新边界、统计估计对冷启动样本量的敏感性,以及各阶段的独立增益。详细实验协议、消融结果及统计信息尚未验证,代码与复现资源在所给材料中未获确认。

    阅读价值:值得核对其严格 predict-before-update 协议下的冷启动校准机制,以及表征学习、训练时归一化和序贯统计估计各自对跨被试检索的贡献。

5月11日周一
  1. OpenReview · EEG73

    解释、解释、再解释:伪迹与解释器扰动下 EEG 模型的不确定性–解释对齐

    基于摘要分析。该研究关注扰动式归因方法生成解释时,模型是否仍保持可靠预测的问题,提出在同一扰动条件下联合审计预测不确定性与解释可靠性,并以 EEG 型 BCI 为研究场景。其贡献是三个对齐诊断指标,以及在预测熵超过经校准阈值时不输出归因图的 abstain to explain 控制机制。 作者将通道丢失、眼部伪迹突发、肌肉噪声、工频噪声和带通不匹配作为可控扰动,用于考察分布偏移下的解释失效。审计指标包括:以预测熵与 deletion AUC 的 Spearman ρalign 衡量不确定性–忠实度对齐;单调性分数 M;以及统计模型不确定但归因仍高度集中的试次的失配率。摘要未给出各指标的完整定义、预期变化方向或计算细节,因此不能仅凭指标名称判断其是否充分反映解释可信度。 作者报告,在 BCI Competition IV 2a 上使用 EEGNet 和 ShallowConvNet,并比较 single softmax、temperature scaling、MC dropout 与 deep ensembles 时,deep ensembles 产生的解释最符合所提出的审计要求;abstain to explain 则移除了许多尖锐但具有误导性的归因。摘要未提供定量结果,也未明确被试内或跨被试评估、数据划分、具体归因方法及扰动强度,故这些结论应限定在作者所述实验范围内。 复现时需核对预测校准的评估方式、熵阈值的校准数据来源、deletion AUC 的实现,以及拒绝解释后的保留比例和解释质量变化。实验协议、消融及统计信息尚未验证。作者提出协议可推广至 EEG 之外的 AI 场景,但摘要未提供跨领域验证证据。

    阅读价值:值得阅读的具体原因是将 EEG 扰动下的预测不确定性与归因可靠性纳入同一审计协议,并提供可复核的诊断指标与拒绝解释机制,但其校准效果及诊断有效性尚需全文验证。

5月1日周五
  1. OpenReview · Representation learning80

    具有理论保证的等变推断表示学习

    基于摘要分析。该研究关注如何利用物理或几何对称性,在回归、条件概率估计和不确定性量化中构建具有统计学习保证的表示。作者提出统一的等变表示学习框架,以条件期望算子的谱分解近似为核心,同时构造等变表示及沿独立对称商群解耦的表示。 技术上,框架建立在算子理论与群表示理论之上,将对称性先验与统计推断联系起来,而非仅依赖几何深度学习中的经验性能。作者声称提供此类框架的首次非渐近统计学习保证;具体误差界、成立假设、样本复杂度及谱近似实现尚未验证,不能据摘要判断保证是否适用于任意群、数据分布或模型规模。 作者报告,在合成数据集及真实机器人应用的评估中,该方法的回归表现达到或超过既有等变基线,并提供校准良好的不确定性估计。摘要未给出数据集名称、划分方式、基线名称、指标或数值,实验协议、消融及统计信息尚未验证,因而暂不能比较提升幅度或校准稳定性。 平台推测(待验证):若 EEG 任务中存在可明确建模且保持预测目标的对称变换,该框架可能为小数据条件下的表示学习和不确定性估计提供研究路径。可复用部分是等变表示与谱近似思路;需改造部分包括 EEG 的群作用定义、输入结构及任务输出的变换规则。假设的主要风险是通道变换未必对应真实对称性,跨被试差异及低信噪比也可能破坏相关假设。一个可检验的小实验是在固定被试内划分下,对比同容量的等变与非等变模型,测试候选变换是否保持任务标签,并评估预测误差及不确定性校准;这不是论文已验证的 EEG 结果。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其如何将条件期望算子的谱近似与等变表示结合,并为回归、条件概率估计及不确定性量化提供非渐近统计保证;保证的适用条件与实验优势尚需全文核对。

9月15日周一
  1. OpenReview · Representation learning79

    具有理论保证的等变推断表示学习

    基于摘要分析。该研究针对回归、条件概率估计与不确定性量化中如何利用物理或几何对称性的问题,提出一个等变表示学习框架,将上述任务与非渐近统计学习保证纳入统一方法。作者声称,这类保证具有首次性,但具体适用范围及与已有理论的区别尚未核对。 核心机制:框架以算子理论和群表示理论为基础,近似条件期望算子的谱分解,构建具有等变性、并沿独立对称商群解耦的表示。其价值在于不只把对称性作为模型结构约束,还尝试连接表示构建与统计误差保证。摘要未提供谱近似的具体实现、训练目标、推理流程或理论假设,因此尚不能判断保证对群结构、样本规模与数据分布的依赖。 结果与证据:在合成数据集和真实机器人应用的评估中,作者报告,回归表现达到或超过已有等变基线,并能提供校准良好的参数化不确定性估计。摘要未列出数据集名称、划分、基线、指标或数值;实验协议、消融及统计信息尚未验证,不宜据此认定普遍优于现有方法。 平台推测(待验证):迁移假设是,若 EEG 任务存在可明确描述且保留任务语义的对称变换,等变表示可能有助于缓解小样本泛化与不确定性估计问题。可尝试复用群约束及谱表示思路,但需改造输入变换、输出等变关系和算子估计,使其适配通道布局与信号特征;原方法所需监督形式和数据规模尚未验证。低信噪比、跨被试差异、通道缺失及小数据下的谱估计不稳定,都可能使这一假设失效。一个可检验的小实验是在固定 EEG 数据划分和相同训练预算下,对有明确语义依据的对称变换比较等变模型与非等变对照,分别评估任务性能及不确定性校准。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其如何将条件期望算子的谱分解、等变表示与非渐近统计保证统一起来,以及不确定性校准的评估条件;其对 EEG/BCI 的适用性尚未验证。

10月2日周六
  1. OpenReview · Representation learning81

    结合表示学习的校准多输出分位数回归

    基于摘要分析。该研究针对多变量响应的预测区域构造问题,将表示学习、多输出分位数回归与 conformal prediction 校准结合,目标是在满足用户指定覆盖概率的同时,得到形状灵活且信息量更高的预测区域。 方法包含两个部分:首先,利用深度生成模型学习具有单峰分布的响应表示,在该表示空间应用已有多输出分位数回归方法,再将所得区域变换回原始响应空间。作者认为,这种构造可形成任意形状的预测区域,突破既有方法的形状限制。其次,将 conformal prediction 扩展至多变量响应设置,对预测集合进行校准,使其达到预先指定的覆盖水平。生成模型类型、表示变换方式、训练目标及校准算法细节尚未验证。 作者报告,该覆盖性质对任意分布具有有限样本理论保证;摘要未说明保证所需的采样假设,也未区分边际覆盖与条件覆盖,需结合正文核对。作者还报告,在真实与合成数据实验中,所构造区域相较既有技术显著更小。具体数据集、样本量、划分、覆盖水平、区域大小度量、对照基线及统计信息尚未验证,不能据此量化改进幅度。 平台推测(待验证):若 EEG 应用需要预测多维连续目标而非离散类别,该机制可能用于构造联合不确定性区域;其依赖配对输入与多维响应,以及足够的训练和校准数据。可复用部分是响应表示学习、分位数区域构造与集合校准,需改造 EEG 编码器,并核对跨被试或跨会话分布变化下校准假设是否成立。低信噪比、小样本和复杂多峰响应可能导致表示失真或预测区域膨胀。一个可检验的小实验是在明确划分的 EEG 连续目标预测任务中,对比原始响应空间与学习表示空间的区域构造,在相同目标覆盖水平下评估实测覆盖率和区域大小,再单独考察跨被试偏移。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其将响应表示学习与多变量 conformal prediction 校准结合的机制,以核对复杂形状预测区域的构造方式、有限样本覆盖保证的适用条件及区域大小的比较协议。