先验还是反馈?LLM 在适配神经算子时使用了什么
Prior or Feedback? What an LLM Uses When Adapting Neural Operators
基于摘要分析。研究考察 LLM 科研智能体在有限试验预算下选择神经算子微调配置时,究竟依赖初始任务背景,还是会根据实验反馈调整决策。其核心贡献是用受控干预分析决策来源,而不只以最终预测误差判断适配能力。 作者报告,在偏微分方程(PDE)族内及族间迁移的匹配比较中,LLM 在几乎所有比较中的留出测试集 nRMSE 均低于随机搜索和 Bayesian optimisation。摘要未给出具体误差、试验预算、任务数量或匹配条件,因此不能量化优势,也不能据此推断其在其他适配任务上的表现。 机制分析包含两类证据。关于初始先验,作者报告,LLM 在尚未观察任何验证分数时提出的首个配置,已在对应随机搜索候选池中排名靠前;冷启动干预还显示,所选基础学习率会随 PDE 描述变化。关于反馈响应,作者报告,将已评估配置之间的验证分数重新分配,会在所有被测试案例中改变下一次提案,而保留数值的改写未产生可比的总体效应。这支持作者关于“任务相关先验与实验反馈敏感性共同影响决策”的结论,但反馈能改变提案并不单独证明每次调整都改善性能。 平台推测(待验证):可借鉴的是超参数搜索智能体的归因评估方法,而非直接将 PDE 神经算子效果外推至 EEG。假设在 EEG 微调任务中,以相同搜索空间和预算比较原始反馈、重分配反馈与保值改写,可检验智能体是否利用真实验证结果;需适配任务描述、评价指标及被试与会话划分。低信噪比、小样本和被试差异可能使验证反馈不稳定,导致对噪声的响应被误认为有效适应。已有相关 EEG 工作尚未检索确认。所用 LLM、神经算子、数据规模、提示设计、实验协议、消融及统计信息尚未验证。
值得阅读其受控干预设计:作者不仅比较优化终点,还通过任务描述与验证分数干预区分 LLM 的初始先验和反馈响应,但这些响应是否带来稳定收益仍需核对全文。
来源:arXiv · 架构与算子 · arxiv.org