跳到正文
arXiv · 在线与高效推理· Yannis Montreuil; Axel Carlier; Lai Xing Ng; Wei Tsang Ooi·· 4 天前精选AI 评分79

查询不等于采纳:在线转交中专家答案校正的学习

A Query Is Not a Commitment: Learning to Correct Expert Answers in Online Deferral

AI 导读

基于摘要分析。研究在线学习转交(online learning to defer)中如何利用并校正不准确的专家答案:学习器在付费获取答案前选择专家并确定校正函数,再对收到的答案应用该函数。核心问题是早期观测损失混合了专家质量与尚未学好的校正效果,可能使路由器过早放弃日后有价值的查询。 作者提出 ORUCB,联合学习共享及专家特定的多项式响应,以累计响应学习误差的上界校准置信度加权风险回归与探索,使路由决策考虑校正尚未充分学习带来的不确定性。摘要未提供具体更新公式、置信区间构造或计算开销。 理论方面,作者报告:在残差与分歧有界、最优响应存在固定可行模型、免费决策风险与最优查询风险满足线性模型等前提下,对固定问题参数,算法在 T 轮内具有高概率 O(√T log(T+1)) 伪遗憾保证。该保证允许奇异答案分布及共享响应模型设定错误,但最优性仅相对于有界响应类,不能解读为对任意校正函数或专家分布均成立。 实验方面,作者报告,在四个测试流上,选定的三次多项式策略相较七个直接采用原始答案的基线具有更低的含查询费用成本;另以共用校正学习器的比较考察路由效果,并在六种价格设置下比较成本与查询率。测试流名称、划分方式、成本定义、收益幅度、消融及统计信息尚未验证,因此目前不能量化优势或判断不同费用条件下的稳定性。 平台推测(待验证):这一机制可能适用于需要付费或消耗资源获取外部预测的 EEG 决策,但原领域结果不等于 BCI 有效。迁移需明确专家输出是否适合多项式校正、在线反馈能否取得及查询成本如何定义;低信噪比、跨被试变化与小样本可能使风险估计和校正学习不稳定。可先在固定 EEG 数据划分与反馈协议下,比较直接采用专家答案、共用校正学习器的路由方法及 ORUCB,并同时记录含查询成本的损失与查询率。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 ORUCB 如何将答案校正的学习误差纳入路由置信度,以及共用校正学习器的对照能否分离路由收益与校正收益;其理论保证依赖明确的模型假设。

来源:arXiv · 在线与高效推理 · arxiv.org