DocMamba:基于状态空间模型的高效文档预训练
DocMamba: Efficient Document Pre-training with State Space Model
基于摘要分析。该研究针对视觉丰富文档理解中 Transformer 自注意力计算复杂度随序列长度呈二次增长的问题,提出基于状态空间模型的文档预训练框架 DocMamba,目标是在保留全局建模能力的同时将计算复杂度降低为线性。 核心机制是引入 Segment-First Bidirectional Scan(SFBS),用于捕获连续语义信息。摘要未说明文档片段如何划分、扫描顺序如何确定,以及文本、视觉和布局信息如何编码或融合;预训练目标、损失形式和训练规模也尚未验证。因此,目前可确认的贡献是状态空间模型与面向文档语义连续性的扫描策略相结合,不能据此补写具体网络结构。 作者报告,DocMamba 在 FUNSD、CORD 和 SORIE 下游数据集上取得新的最佳结果,并显著提升速度、降低内存使用;作者还报告,HRDoc 实验显示其具有长度外推潜力。摘要未提供具体指标、数值、数据划分、对照模型、运行硬件或外推长度范围,上述结论需在相应协议下核对,实验协议、消融及统计信息尚未验证。 平台推测(待验证):其迁移假设是,线性复杂度的序列建模与分段双向扫描可能帮助处理长时程 EEG,但文档的语义片段结构不能直接等同于 EEG 时间窗或生理事件。可考虑复用状态空间序列模块,并改造时间分段、通道表示及扫描方式;这一路径依赖合理的 EEG 分段结构和足够的训练数据。低信噪比、跨被试差异、通道配置变化及小数据规模都可能使分段或双向扫描收益失效。一个可证伪的小实验是在固定 EEG 数据划分、训练预算和通道配置下,对比普通扫描与改造后的 SFBS,检验长序列任务表现及速度、内存变化;双向扫描还需区分离线分析与实时因果推理的适用性。已有 EEG 相关工作尚未检索确认。
值得阅读的是 DocMamba 如何通过 Segment-First Bidirectional Scan 在降低长文档计算成本的同时保留连续语义与全局建模能力,但其效率对照、长度外推协议及向 EEG 的迁移价值尚未验证。
来源:OpenReview · State space models · openreview.net