跳到正文
OpenReview · State space models· Peng Lu; Suyuchen Wang; Mehdi Rezagholizadeh; Bang Liu; Ivan Kobyzev·· 2023-01-01精选AI 评分72

基于状态空间模型的高效长文档分类

Efficient Classification of Long Documents via State-Space Models

AI 导读

基于摘要分析。本文研究长文档分类中标准自注意力的二次计算复杂度与有限长度外推能力,探索用 State-Space Models(SSMs,状态空间模型)替代自注意力,并提出 SSM-pooler,以兼顾分类性能与处理效率。 作者在六个长文档分类数据集上开展实验,覆盖二分类、多分类和多标签分类,对比经过预训练及未经预训练的 SSMs 与基于自注意力的模型。作者报告,SSM-pooler 在这些长文档分类实验中取得可比性能,同时平均效率提升 36%;但摘要未明确该效率指耗时、吞吐量、计算量还是其他口径,也未给出具体对照模型与统计方式。作者还报告方法对输入噪声具有更高鲁棒性,包括噪声达到 40% 的极端情形;噪声类型、比例定义及对应性能指标尚未验证。 方法的主要方向是改变长序列建模机制,而非对自注意力使用稀疏或层次化结构。SSM-pooler 的内部结构、池化操作、训练目标、预训练方案,以及数据集名称、划分、长度设置、消融与统计信息均需全文核对,不能仅凭摘要判断其优势来自哪一模块。 平台推测(待验证):假设 SSM 的长序列处理机制能缓解长时间窗 EEG 分类的计算瓶颈,可尝试复用序列编码与分类汇聚思路,但需将文本输入接口改为多通道 EEG 表征,并验证其能否保留短暂事件与跨通道信息。文本输入噪声鲁棒性不等同于对 EEG 伪迹、低信噪比或被试差异的鲁棒性;小数据训练也可能削弱优势。一个可检验的小实验是在固定数据划分、时间窗、参数预算和训练预算下,对比 SSM-pooler 与自注意力模型,分别评估分类表现、推理耗时及明确噪声条件下的性能变化,并将被试内与跨被试结果分开报告。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 SSM-pooler 在长文档分类中的效率与噪声鲁棒性评估,但摘要未说明效率口径及噪声定义,作者报告的优势尚不能直接外推至 EEG。

来源:OpenReview · State space models · openreview.net