跳到正文
OpenReview · State space models· Sam Blouir; Jimmy T. H. Smith; Antonios Anastasopoulos; Amarda Shehu·· 2024-01-01精选AI 评分78

Birdie:通过奖励驱动的目标与课程推进状态空间模型

Birdie: Advancing State Space Models with Reward-Driven Objectives and Curricula

AI 导读

基于摘要分析。本文研究状态空间模型(SSMs)在文本复制、关联回忆和长上下文问答等上下文检索任务上的能力瓶颈,提出训练程序 Birdie,将双向输入处理与由强化学习优化的专门预训练目标动态混合结合,以改善固定状态容量下的信息利用。主要研究对象是文本序列模型,并非 EEG 或 BCI。 机制上,Birdie 将改进重点放在训练目标及其动态调度,而不是单纯依靠扩大或修改模型结构。摘要同时介绍了一种能够从双向上下文处理切换到因果生成的双向 SSM 架构。因此,“不改变架构的训练改进”与新双向架构之间的关系,以及两者对结果的独立贡献,仍需正文核对。奖励定义、目标构成、课程更新方式、损失形式和训练规模尚未验证。 作者报告,在多号码电话簿查询、长段落问答和文本填空等检索密集型任务上,Birdie 改善了表现,缩小与 Transformers 的差距,同时保留计算效率。摘要未给出具体数据集、划分、基线配置、指标或效率测量条件,不能据此量化提升幅度或直接比较不同协议。实验协议、消融及统计信息尚未验证。作者称代码及预训练模型已公开,并支持 JAX 和 PyTorch;具体复现配置及资源需求仍需核对。 平台推测(待验证):迁移假设是,奖励驱动的目标调度可能帮助 EEG 序列模型在固定状态容量下保留与任务相关的远程信息,对应长时序建模中信息压缩与遗忘的瓶颈。但文本中的离散符号、明确检索答案和大规模预训练条件不等同于连续、低信噪比的 EEG。可考虑复用目标调度机制,需改造输入表示、预训练任务及奖励;被试差异、通道变化和小数据可能使奖励不稳定或偏向伪相关。一个可证伪的小实验是:在固定 SSM、数据划分和训练预算下,对比固定目标混合与奖励驱动混合的跨被试 EEG 任务表现,分别控制双向处理因素,并确保推理时可用上下文符合任务条件。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 Birdie 如何通过奖励驱动的预训练目标混合改善 SSM 的长上下文检索,并区分训练策略与双向处理架构各自的贡献;其对 EEG 的适用性尚未验证。

来源:OpenReview · State space models · openreview.net