研究状态空间模型中文档表示的可融合性
Studying the Soupability of Documents in State Space Models
基于摘要分析。本文研究 Structured State Space Models(SSMs)的隐状态能否在编码后合并,以支持下游推理。作者提出 document souping:分别编码各文档,再通过平均等简单操作将表示池化为单一上下文状态,从而支持模块化编码与表示复用,避免为每个查询重新处理完整输入。 机制与对照:该方法受到 model souping 启发,但融合对象是文档表示,而非模型参数。摘要涉及经过微调的 Mamba2,主要对照为整体式编码及传统拼接方式。其关键研究问题是:独立编码时未显式建模的跨文档关系,能否在合并后的状态中仍被下游推理利用。状态的提取位置、池化细节、微调目标及查询如何使用合并状态尚未验证。 作者报告,在多跳 QA、稀疏检索和长文档推理任务上,融合表示的性能与标准整体式编码相当或更优;在长文档问答基准 RACE 和 QuALITY 上,优于传统拼接方式。作者还报告测试规模达到最多 256 个片段,并获得显著的推理成本节省。摘要未提供具体分数、成本指标、数据划分及基线配置,实验协议、消融及统计信息尚未验证,不能据此量化收益或判断不同任务间的可比性。 平台推测(待验证):该机制可启发 EEG 长记录的分段编码与状态缓存,但原研究对象是文本文档,原领域有效不等于 BCI 有效。迁移假设是局部片段的任务相关信息可被 SSM 状态保留,并在池化后用于整段判别;可复用独立编码和缓存机制,需改造信号输入、通道表示及训练监督。简单平均可能损失 EEG 的时序顺序、瞬态事件和跨片段依赖,低信噪比、跨被试差异、通道变化及小数据微调也可能使融合失效。一个可检验的小实验是在固定被试内划分与相同训练预算下,对比完整序列编码和分段状态平均,核对任务指标及端到端推理成本,并通过打乱片段顺序检查任务对顺序信息的依赖。已有 EEG 相关工作尚未检索确认。
值得核对独立编码后的 SSM 隐状态能否通过简单池化保留下游推理能力,以及其相对整体编码的性能与推理成本权衡;摘要所述优势仍需全文实验协议支持。
来源:OpenReview · State space models · openreview.net