超越语义:时间偏置如何塑造 Transformer 与状态空间模型中的检索
Beyond Semantics: How Temporal Biases Shape Retrieval in Transformer and State-Space Models
基于摘要分析。本研究关注预训练 LLM 的上下文信息检索如何受到时间位置与语义关系的共同影响,通过重复 token 序列探测 Transformer 与状态空间模型能否区分并检索出现在不同位置的事件,主要贡献是隔离时间位置效应并比较不同架构的检索偏置。 核心实验在输入序列中多次呈现同一 token,并让该 token 再次出现在序列末尾;固定这些重复 token 的位置,同时置换其他 token,以减少语义混杂,再考察下一 token 的预测概率。作者报告,在所考察的多种序列中,模型倾向于为此前重复 token 后接的 token 分配最高概率,但更偏向输入开头或末尾附近的候选,而不是均匀检索各次出现后的信息。 作者报告,一项消融实验将 Transformer 中的这一现象与 induction heads 联系起来;在具有部分语义重叠的不同上下文中,提示中部的记忆也更难被可靠检索。尽管架构不同,状态空间模型与 Transformer 表现出相近的时间偏置。上述结果属于上下文检索与下一 token 预测行为,不等同于证明模型具有人的情景记忆机制。具体模型、序列长度、置换方案、检索指标、效应大小及消融实施方式在摘要中未披露,实验协议、消融及统计信息尚未验证。 平台推测(待验证):其位置控制与干扰置换方法可作为 EEG 长序列模型的诊断工具,检验模型是否更依赖窗口边缘而忽略中部事件;这是假设,不是已证实的 BCI 效果。可复用的是位置控制和检索探测思路,需将离散 token 与下一 token 概率改造为 EEG 事件片段及对应任务读出。小规模可证伪实验可在相同背景 EEG 的不同位置嵌入同一事件片段,比较模型识别该事件的稳定性,同时控制裁剪、位置编码和边界伪迹。低信噪比、通道差异、跨被试变化及小数据均可能掩盖或混淆位置效应;已有 EEG 相关工作尚未检索确认。
通过固定重复 token 位置并置换其他 token,该研究提供了区分语义关联与时间位置偏置的可核对探测方法,值得用于分析不同序列架构的上下文检索行为,但其 EEG/BCI 适用性尚未验证。
来源:OpenReview · State space models · openreview.net