基于贝叶斯非参数记忆的推理策略测试时自适应
Test-Time Adaptation of Reasoning Strategies with Bayesian Nonparametric Memory
基于摘要分析。该研究针对 LLM 推理路径不够高效、从既往查询中获得的策略难以持续用于后续问题这两个问题,提出 Bayesian Cheatsheet:将推理行为组织为可在线更新的结构化记忆,在推理时检索相关行为,以支持推理策略的测试时自适应。 核心机制是在行为嵌入上建立 Hierarchical Dirichlet Process Gaussian Mixture Model(HDP-GMM),跨领域共享混合模型组件,同时保留各领域自己的混合权重,并利用后验预测分布检索与查询相关的行为。在在线 test-time training(TTT)设置下,模块随每个样本对混合模型的充分统计量进行软更新;当合成行为具有足够新颖性时,可创建新组件。摘要还描述了通过单步 collapsed Gibbs sampling 将行为重新分配至组件的机制,使记忆结构能够动态重组。这里明确更新的是记忆混合模型,不能据此推断 LLM 本体参数是否更新。 作者报告,在 AIME'25、Omni-MATH 和 PhysReason 等推理基准上,Bayesian Cheatsheet 相比既有记忆模块取得性能提升,冷启动设置下也有收益。摘要未提供具体指标、分数、基线名称、冷启动定义及查询顺序,因此尚不能量化提升,也不能确认生成成本是否实际降低。行为的生成与嵌入方式、领域定义、新组件创建准则、实验协议、消融及统计信息尚未验证;复现还需核对记忆初始化、在线更新流程和推理开销。 平台推测(待验证):其跨域共享组件与域特异权重可能启发 EEG 跨被试或跨会话的非参数记忆建模,但原方法依赖可嵌入、可检索的推理行为,而 EEG 并不天然具有同类策略表示。可复用的是混合模型及在线更新机制,需改造的是 EEG 表征、域定义与检索输出;低信噪比、小数据及通道差异可能造成不稳定聚类或错误的新组件扩增。一个可检验的小实验是在固定 EEG 编码器和相同跨会话划分下,对比静态记忆与在线 HDP-GMM 记忆,并同时记录预测指标和组件增长。相关 EEG 工作尚未检索确认,原领域收益不等于 BCI 有效。
值得核对其以跨域共享聚类、域特异混合权重和在线统计量更新实现推理策略记忆适应的机制,尤其是冷启动收益与记忆重组效果;具体增益及计算开销尚未验证。
来源:arXiv · 泛化与分布偏移 · arxiv.org