跳到正文
OpenReview · State space models· Bingheng Wu; Jingze Shi; Yifan Wu; Nan Tang; Yuyu Luo·· 2025-12-31精选AI 评分71

TransXSSM:采用统一旋转位置嵌入的 Transformer 与状态空间模型混合架构

TransXSSM: A Hybrid Transformer State Space Model with Unified Rotary Position Embedding

AI 导读

基于摘要分析。本文研究语言建模中 Transformer 与状态空间模型(SSM)混合时的位置表示兼容问题,提出 Unified RoPE,并据此构建 TransXSSM,以在统一的位置编码框架下结合自注意力与状态空间组件。 作者将问题归因于 Transformer 的显式 Rotary Position Embedding(RoPE)与 SSM 通过卷积形成的隐式位置表示不一致,认为这种差异会导致混合架构中的位置表示不连续和性能损失。核心贡献是位置编码统一,而非仅将两类层组合;但 Unified RoPE 如何作用于状态空间组件、层间如何衔接,以及训练目标和推理实现,摘要未提供足够细节,尚未验证。 作者报告:在摘要写作“4 sequenceK”的序列长度下,相对标准 Transformer,训练和推理速度分别提高 42.3% 和 29.5%;该长度表述需核对原文。在可比设置的语言建模基准上,作者报告准确率提升超过 4%。作者还报告,TransXSSM-1.3B 相对其 320M 版本的平均准确率增益为 7.22%,而相应 Transformer 或 SSM 的增益约为 6%。摘要未明确这些准确率增益是相对百分比还是百分点,不宜转换或直接比较。具体基准、数据划分、硬件、速度测量口径、对照匹配、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 长序列混合模型确实存在注意力与 SSM 时间位置表示不一致,Unified RoPE 可能提供可复用的时间编码机制;这是假设,不是本文已验证的 BCI 结果。迁移需改造多通道输入及采样时间表示,且低信噪比、跨被试差异与小数据可能使收益不稳定。可在固定数据划分和训练预算下,对同一 EEG 混合骨干比较统一与非统一位置编码,并核对任务指标及运行成本。其对数据规模和监督的依赖尚不清楚,已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 Unified RoPE 如何对齐自注意力与 SSM 的位置表示,以及其相对混合架构对照的独立收益;摘要中的效率与准确率结果尚不足以确认 EEG/BCI 适用性。

来源:OpenReview · State space models · openreview.net