Repeat After Me:Transformer 在复制任务上优于状态空间模型
Repeat After Me: Transformers are Better than State Space Models at Copying
基于摘要分析。本文研究序列模型能否准确复制输入上下文中的内容,比较 Transformer 与潜在状态大小不随序列长度变化的 generalized state space models(GSSMs)。其主要贡献是将字符串复制的理论容量分析与合成任务、预训练语言模型评估结合,考察固定大小状态带来的记忆能力限制。 理论方面,作者报告证明了两层 Transformer 能够复制指数长度的字符串,而 GSSMs 的复制能力受到固定大小潜在状态的根本限制。摘要未交代指数长度对应的具体变量、状态精度假设及证明适用条件,需核对正文才能确定结论边界。这里的 GSSMs 是作者按状态大小定义的一类模型,不宜将结论无条件推广到所有状态空间架构和序列任务。 实验方面,作者报告:在需要复制上下文的合成任务上,Transformer 的效率与泛化表现优于 GSSMs;在预训练大语言模型评估中,Transformer 在上下文复制和信息检索方面显著优于状态空间模型。摘要同时认可 GSSMs 在推理效率上的潜力,因此合成任务中的“效率”优势不能直接解释为所有场景下的推理速度优势。具体模型、数据规模、训练与评估划分、效率定义、指标数值、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 任务确实依赖从长上下文中检索或保留局部细节,固定大小状态的信息压缩可能构成瓶颈;可借鉴的是架构容量分析与受控复制测试,而非直接套用语言模型结论。原任务依赖离散序列及明确的复制目标,迁移时需改造连续 EEG 的输入表示和检索监督。低信噪比、跨被试差异、通道变化及小数据可能使精确复制能力与实际解码收益脱节。一个可检验的小实验是在固定被试与通道、统一训练数据和计算预算下,比较 Transformer 与 GSSM 对 EEG 片段延迟检索的表现,并改变上下文长度,检验性能是否随记忆负担呈不同退化趋势。该实验仅验证机制假设,不构成 BCI 有效性证据;相关 EEG 工作尚未检索确认。
该研究以理论分析和复制、检索任务对照考察固定大小潜在状态的信息容量限制,值得用于理解序列架构的记忆能力边界,但其结论尚不能直接外推至 EEG 解码。
来源:OpenReview · State space models · openreview.net