状态空间模型中文档表示出人意料的可融合性
The Surprising Soupability of Documents in State Space Models
基于摘要分析。本文研究结构化状态空间模型(SSMs)的隐状态能否在编码完成后合并,用于下游推理,提出 document souping:独立编码各篇文档,再通过平均等简单操作将其表示池化为单一上下文状态,从而支持模块化编码与表示复用,避免每次查询都重新处理完整输入。 该方法受 model souping 启发,但合并对象是文档表示,而非模型参数。其核心研究对象是微调后的 Mamba2 在文本推理中的上下文表示,主要对照为标准整体编码方式。摘要未说明具体池化位置、状态对齐方式、微调目标,以及查询如何使用合并状态,这些机制细节尚未验证。 作者报告,使用融合表示的微调 Mamba2 在多跳 QA、稀疏检索和长文档推理任务上取得与整体编码相当或更优的表现;在长文档问答基准 RACE 和 QuALITY 上,作者报告其明显优于传统拼接方式,但摘要未给出具体指标或提升幅度。作者还报告,在最多 256 篇文档的测试中,该模块化设计能够扩展并显著节省推理成本;文档长度、成本口径、数据划分、实验协议、消融及统计信息尚未验证,尚不能量化其收益边界。 平台推测(待验证):若 EEG 的分段编码状态具有可合并性,类似机制可能用于缓存并复用长时记录的片段表示,减少重复编码。此假设依赖表示空间的一致性及合并后任务信息的保留,不能由文本结果直接推出。可复用部分是独立编码、状态缓存与池化流程;需改造 EEG 输入编码、时间顺序表达和训练监督。低信噪比、跨被试分布差异、通道配置变化及小数据训练都可能使简单平均稀释关键事件。一个可检验的小实验是在固定被试内划分、相同编码器和训练预算下,对比完整序列编码与分段状态平均,同时测量任务指标和推理成本,并检查片段顺序改变是否影响结果。相关 EEG 工作尚未检索确认。
值得核对微调后的 Mamba2 隐状态为何可通过简单池化支持多文档推理,以及模块化编码的性能与推理成本权衡;其对 EEG 的适用性尚未验证。
来源:OpenReview · State space models · openreview.net